diff --git a/backend/loader.py b/backend/loader.py index 104cd115..de74d2d0 100644 --- a/backend/loader.py +++ b/backend/loader.py @@ -379,7 +379,7 @@ def load_huggingface_component(guess, component_name, lib_name, cls_name, repo_p override_dtype = backend.args.dynamic_args.forge_unet_storage_dtype if override_dtype is torch.int8: - override_dtype = None + override_dtype = torch.bfloat16 if memory_management.should_use_bf16(load_device) else None try_int8 = True if guess.nunchaku: diff --git a/backend/operations.py b/backend/operations.py index 17513ad5..5f5a7072 100644 --- a/backend/operations.py +++ b/backend/operations.py @@ -404,7 +404,7 @@ class ForgeOperationsInt8(ForgeOperations): self.compute_dtype = torch.bfloat16 self.lora_patches = [] # List of (down_scaled, up, start, size) set by INT8ModelPatcher - self.parameters_manual_cast = True + self.parameters_manual_cast = current_dtype != self.compute_dtype def reset_parameters(self): return None