diff --git a/backend/diffusion_engine/qwen.py b/backend/diffusion_engine/qwen.py index 8a9f2451..a9751d4a 100644 --- a/backend/diffusion_engine/qwen.py +++ b/backend/diffusion_engine/qwen.py @@ -23,7 +23,7 @@ class QwenImage(ForgeDiffusionEngine): super().__init__(estimated_config, huggingface_components) self.is_inpaint = False - clip = CLIP(model_dict={"qwen25": huggingface_components["text_encoder"]}, tokenizer_dict={"qwen25": huggingface_components["tokenizer"]}) + clip = CLIP(model_dict={"qwen25_7b": huggingface_components["text_encoder"]}, tokenizer_dict={"qwen25_7b": huggingface_components["tokenizer"]}) vae = VAE(model=huggingface_components["vae"], is_wan=True) vae.first_stage_model.latent_format = self.model_config.latent_format @@ -33,8 +33,8 @@ class QwenImage(ForgeDiffusionEngine): unet = UnetPatcher.from_model(model=huggingface_components["transformer"], diffusers_scheduler=None, k_predictor=k_predictor, config=estimated_config) self.text_processing_engine_qwen = QwenTextProcessingEngine( - text_encoder=clip.cond_stage_model.qwen25, - tokenizer=clip.tokenizer.qwen25, + text_encoder=clip.cond_stage_model.qwen25_7b, + tokenizer=clip.tokenizer.qwen25_7b, ) self.forge_objects = ForgeObjects(unet=unet, clip=clip, vae=vae, clipvision=None) diff --git a/backend/loader.py b/backend/loader.py index cbc3d8f9..3ea298ab 100644 --- a/backend/loader.py +++ b/backend/loader.py @@ -533,7 +533,7 @@ def replace_state_dict(sd: dict[str, torch.Tensor], asd: dict[str, torch.Tensor] weight = asd["model.layers.0.self_attn.k_proj.bias"] assert weight.shape[0] == 512 for k, v in asd.items(): - sd[f"{text_encoder_key_prefix}qwen25.{k}"] = v + sd[f"{text_encoder_key_prefix}qwen25_7b.{k}"] = v if "model.layers.0.post_feedforward_layernorm.weight" in asd: assert "model.layers.0.self_attn.q_norm.weight" not in asd diff --git a/modules_forge/packages/huggingface_guess/model_list.py b/modules_forge/packages/huggingface_guess/model_list.py index a40719bd..2dd6043a 100644 --- a/modules_forge/packages/huggingface_guess/model_list.py +++ b/modules_forge/packages/huggingface_guess/model_list.py @@ -428,7 +428,7 @@ class QwenImage(BASE): return ModelType.FLOW def clip_target(self, state_dict: dict): - return {"qwen25": "text_encoder"} + return {"qwen25_7b": "text_encoder"} models = [