Qwen Image 2.1 dans ComfyUI : installation locale selon la VRAM
Guide pas à pas pour choisir les poids officiels de Qwen Image 2.1 selon la VRAM, enregistrer le premier PNG dans ComfyUI, corriger les erreurs OOM ou de modèle et évaluer GGUF.
Sommaire

La méthode la plus fiable pour lancer Qwen Image 2.1 sur une carte graphique grand public ne consiste pas à choisir immédiatement le plus petit GGUF disponible. Commencez par mettre ComfyUI à jour, chargez le workflow texte-vers-image officiel, associez le modèle de diffusion INT8 à un encodeur de texte Qwen3-VL compatible et au VAE, puis générez et enregistrez une première image de taille modeste. Avec 8 ou 12 Go de VRAM, n’activez pas d’emblée BF16, la sortie 2K ou l’amélioration de prompt.
Ni Qwen ni Comfy Org ne publient un minimum de VRAM universel. Les configurations 8 et 12 Go ci-dessous sont des points de départ prudents, pas des garanties : la RAM système, l’offloading, les pilotes, la résolution et les autres applications utilisant le GPU modifient le pic mémoire.
Choisir les poids d’abord : la taille des fichiers n’est pas la VRAM
Au 28 septembre 2026, le dépôt de modèles officiel de Comfy Org propose deux poids de diffusion, trois encodeurs de texte principaux, un VAE et deux modèles distincts d’amélioration de prompt. Pour produire une première image, il suffit d’un modèle de diffusion, d’un encodeur principal et du VAE. Le fichier qwen3.5_9b_..._pe_t2i est un module optionnel d’amélioration du prompt ; il ne remplace pas l’encodeur qwen3vl_8b_....
| Rôle | Fichier conseillé pour le premier essai | Taille de téléchargement approx. | Dossier |
|---|---|---|---|
| Modèle de diffusion | qwen_image_2.1_int8_convrot.safetensors | 7,26 Go | ComfyUI/models/diffusion_models/ |
| Encodeur principal, option plus légère | qwen3vl_8b_w4a8.safetensors | 6,31 Go | ComfyUI/models/text_encoders/ |
| Encodeur principal par défaut du template officiel | qwen3vl_8b_int8_convrot.safetensors | 9,35 Go | ComfyUI/models/text_encoders/ |
| VAE | qwen_image_2.1_vae_bf16.safetensors | 0,68 Go | ComfyUI/models/vae/ |
| Améliorateur T2I optionnel | qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors | 9,47 Go | ComfyUI/models/text_encoders/ |
Ces chiffres correspondent aux fichiers du dépôt, pas à la VRAM utilisée pendant l’inférence. Diffusion INT8 + encodeur W4A8 + VAE représentent environ 14,24 Go à télécharger ; la combinaison INT8 + INT8 + VAE du template officiel atteint environ 17,28 Go. L’améliorateur de prompt ajoute environ 9,47 Go de stockage et une étape supplémentaire de chargement d’un gros modèle.
Une première configuration pratique pour chaque niveau de VRAM
| VRAM disponible | À essayer en premier | Réglages de la première génération | À augmenter seulement après réussite |
|---|---|---|---|
| 8 Go | Diffusion INT8 + encodeur W4A8 + VAE ; amélioration du prompt désactivée | 768×768 ou environ 1 Mpx maximum, batch 1, CFG 1 | Tester ensuite 1024 ; envisager un GGUF communautaire uniquement si la voie officielle provoque encore un OOM |
| 12 Go | Diffusion INT8 + encodeur W4A8 ; essayer l’encodeur INT8 plus tard | 1024×1024, batch 1, CFG 1 | Activer l’amélioration ou augmenter la résolution, un changement à la fois |
| 16 Go et plus | Diffusion INT8 + encodeur INT8 + VAE du template officiel | 1024×1024, 25 étapes, CFG 1 | Tester séparément l’amélioration du prompt et le 2K |
| Beaucoup de VRAM et de RAM | Valider d’abord la voie INT8, puis comparer BF16 | Conserver le même prompt, seed et les mêmes dimensions | Utiliser BF16 seulement pour une comparaison contrôlée et en acceptant son empreinte supérieure |
Les lignes 8 et 12 Go visent à réduire le coût du diagnostic ; ce ne sont pas des exigences matérielles officielles. Qwen documente l’offloading lorsque la mémoire est limitée, tandis que ComfyUI décide quels composants conserver sur le GPU pour chaque machine. Deux ordinateurs équipés de la même carte peuvent donc se comporter différemment.
1. Mettre ComfyUI à jour avant de chercher des nœuds tiers
Qwen Image 2.1 bénéficie d’un support natif dans ComfyUI. Le workflow officiel ne devrait pas nécessiter de pack de nœuds tiers. Des nœuds rouges, l’absence du template Qwen Image 2.1 ou de TextEncodeQwenImage21 indiquent généralement que le cœur de l’application ou ses dépendances sont trop anciens.
- Windows Portable : fermez ComfyUI, lancez
ComfyUI_windows_portable/update/update_comfyui.bat, puis redémarrez. N’utilisez pasupdate_comfyui_and_python_dependencies.batcomme premier choix courant, car il réinstalle toute la pile de dépendances. - ComfyUI Desktop : mettez à jour l’Engine via Manage → Update. Le canal Stable peut recevoir les nouveaux modèles plus tard ; si les nœuds manquent encore, utilisez le canal disponible
Latest on GitHubou passez à Portable/installation manuelle. - Installation Git manuelle : mettez à jour le code et les dépendances dans l’environnement Python qui exécute réellement ComfyUI, puis redémarrez.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py
Le guide officiel de mise à jour précise qu’un simple git pull peut laisser le frontend, les templates et les nouveaux nœuds obsolètes. La mise à jour des dépendances de requirements.txt fait partie de l’opération.
2. Placer chaque modèle dans le dossier lu par son chargeur
Téléchargez les fichiers choisis depuis le dépôt officiel ComfyUI. Conservez les noms exacts : un suffixe tel que (1) ajouté par le navigateur peut empêcher le template de retrouver le modèle.
Pour un premier essai à mémoire limitée, utilisez cette structure. Choisissez W4A8 ou INT8 comme encodeur principal :
ComfyUI/
└── models/
├── diffusion_models/
│ └── qwen_image_2.1_int8_convrot.safetensors
├── text_encoders/
│ ├── qwen3vl_8b_w4a8.safetensors
│ └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors # optional
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors
Pour reproduire le réglage par défaut du template officiel, remplacez qwen3vl_8b_w4a8.safetensors par qwen3vl_8b_int8_convrot.safetensors. Redémarrez ComfyUI après la copie : les listes des chargeurs sont normalement remplies au démarrage.
3. Importer le workflow texte-vers-image officiel
Ouvrez le template Qwen Image 2.1 text-to-image depuis le panneau Templates, ou téléchargez puis glissez sur le canvas le JSON officiel du workflow T2I. La version actuelle regroupe le graphe principal dans un subgraph et démarre à 1024×1024, 25 étapes, CFG 1 et euler + simple.
Vérifiez les chargeurs et réglages dans cet ordre :
- Sélectionnez
qwen_image_2.1_int8_convrot.safetensorscomme modèle de diffusion. - Sélectionnez
qwen3vl_8b_w4a8.safetensorsouqwen3vl_8b_int8_convrot.safetensorscomme encodeur principal, avec le typeqwen_image. - Sélectionnez
qwen_image_2.1_vae_bf16.safetensorscomme VAE. - Laissez
refine_promptsurfalsepour le premier essai. Le sélecteur de modèle PE du template sert uniquement à améliorer le prompt. - Avec 8 Go, commencez à 768×768. Avec 12 Go ou plus, commencez à 1024×1024. Préférez des dimensions divisibles par 32.
- Gardez batch 1 et CFG 1. N’ajoutez pas encore de LoRA, ControlNet, image de référence ou upscale.
Utilisez un premier prompt volontairement simple afin de reconnaître facilement un résultat valide :
A red ceramic teapot on a wooden table, soft window light, plain background.
Ne commencez pas en 2K. Le support natif du 2K signifie que le modèle peut générer directement en 2048×2048 ; il ne garantit pas que toutes les configurations de 8 ou 12 Go y parviendront.
4. Mettre une seule tâche en file, attendre et vérifier le PNG
Cliquez une seule fois sur Queue Prompt. Le premier lancement peut charger plusieurs dizaines de gigaoctets et déplacer des composants entre VRAM, RAM et CPU. Si aucun aperçu n’apparaît immédiatement, surveillez le terminal ou le journal de démarrage plutôt que d’ajouter à nouveau la même tâche.
Considérez le premier essai comme réussi uniquement lorsque ces quatre signaux sont présents :
- La file se termine sans
model not found,missing node type,CUDA out of memoryni arrêt du processus. SaveImageAdvancedaffiche l’image ; la fin du sampler ne prouve pas à elle seule que le fichier a été enregistré.- Un PNG existe dans
ComfyUI/output/. Le template officiel utilise par défaut le préfixeQwen_image_2.1; si vous avez modifié le nœud d’enregistrement, suivez le chemin qu’il indique. - Le PNG s’ouvre normalement, possède les dimensions attendues et n’est ni entièrement noir, ni entièrement transparent, ni corrompu.
Sur un système NVIDIA, surveillez la mémoire dans un second terminal :
nvidia-smi -l 1
Notez le fichier de diffusion, l’encodeur, les dimensions et le pic observé. Modifiez ensuite une seule variable à la fois, afin qu’une nouvelle erreur ait une cause identifiable.
5. Dépanner par symptôme plutôt que tout remplacer
Un nœud est rouge ou affiche missing node type
Mettez à jour le cœur de ComfyUI et ses dépendances, puis redémarrez. TextEncodeQwenImage21, ResolutionSelector et le switch logique du workflow officiel sont des nœuds du cœur. Installer un pack tiers au nom proche peut compliquer le diagnostic.
La liste des modèles est vide ou affiche model not found
Vérifiez le dossier, l’extension et le nom exact, puis redémarrez ComfyUI. Les erreurs fréquentes sont l’encodeur placé dans models/clip/, le modèle de diffusion dans models/checkpoints/ ou un fichier renommé par le navigateur.
La VRAM est saturée avant le sampling
Désactivez l’amélioration du prompt, remplacez l’encodeur principal INT8 par W4A8, gardez batch 1 et fermez les navigateurs, jeux ou outils vidéo qui utilisent le GPU. Ramenez une carte de 8 Go à 768×768 ; sur 12 Go, revenez à 1024×1024 et supprimez les branches optionnelles.
L’OOM survient au décodage VAE ou juste avant l’enregistrement
Réduisez la largeur et la hauteur, puis lancez une seule nouvelle tâche. Diminuer les étapes agit surtout sur la durée ; réduire la résolution diminue plus directement la mémoire du latent et du décodage VAE.
La file paraît bloquée alors que le disque ou le CPU travaillent
Il s’agit souvent du chargement ou de l’offloading des modèles, pas d’un échec définitif. Attendez un état clair de réussite ou d’erreur. Les clics répétés ne font qu’empiler des tâches lourdes. Si la RAM monte jusqu’à un swap intense, annulez, réduisez la configuration et redémarrez ComfyUI.
L’image est délavée, surtraitée ou structurellement incohérente
Vérifiez que CFG vaut toujours 1. Le template officiel indique que le prompt négatif n’est pas utilisé à CFG 1 ; reprendre un CFG élevé d’un workflow SDXL est un mauvais point de départ.
1024 fonctionne mais le 2K provoque toujours un OOM
Conservez 1024 comme base fonctionnelle. Testez 1280, puis 1536 et enfin 2048, un palier à la fois, avec batch 1 et l’amélioration désactivée. Les capacités du modèle et celles de la mémoire locale sont deux contraintes différentes.
Le bon choix pour les cartes de 8 et 12 Go
Avec 8 Go, l’objectif est de valider toute la chaîne, pas d’activer toutes les options. Utilisez la diffusion INT8, l’encodeur W4A8 et le VAE ; désactivez PE ; commencez à 768×768 et batch 1. Si cela échoue encore, vérifiez que ComfyUI est à jour et que la machine dispose d’assez de RAM avant de passer à GGUF. N’insérez pas un fichier quantifié inconnu dans le workflow standard en supposant qu’il est interchangeable.
Avec 12 Go, visez d’abord 1024×1024. Commencez avec W4A8 pour conserver une marge, puis essayez l’encodeur INT8 du template officiel lorsque la base est stable. L’amélioration du prompt est une seconde étape : elle charge un autre modèle 9B pour réécrire le prompt et ne doit pas être ajoutée tant que le graphe de base échoue.
Les messages de la communauté ne montrent que des cas individuels, pas un minimum établi. Un utilisateur a indiqué faire tourner le modèle sur une RTX 5060 mobile de 8 Go tout en poursuivant l’optimisation ; un autre, équipé d’une RTX 3060 12 Go, a conseillé W4A8 à un utilisateur de 8 Go. Voici le premier témoignage et le second conseil, sans protocole contrôlé ni journaux complets : ce sont des pistes, pas des garanties.
GGUF est une option basse mémoire, pas le point de départ officiel
Les templates Qwen et Comfy Org utilisent des fichiers .safetensors. GGUF exige un chargeur tiers, un fichier quantifié spécifiquement pour Qwen Image 2.1 et un graphe conçu pour ce chargeur. Le projet ComfyUI-GGUF se décrit comme work in progress et ne certifie pas chaque quantification Qwen publiée par un tiers.
N’envisagez la voie communautaire que si la combinaison officielle INT8/W4A8 échoue encore par manque de mémoire :
- Mettez ComfyUI à jour, puis installez
ComfyUI-GGUFvia Manager ou depuis son dépôt. - Obtenez un fichier explicitement conçu pour Qwen Image 2.1. Vérifiez l’auteur, la licence, le hash et le chargeur requis.
- Remplacez le chargeur de diffusion standard par
Unet Loader (GGUF). Conservez un encodeur principal et un VAE compatibles avec Qwen Image 2.1. - Sélectionnez le nom exact et testez sous environ 1 Mpx, CFG 1 et batch 1.
- En cas d’échec, revenez aux instructions propres à cette quantification. Ne mélangez pas des graphes Qwen Image 1.x, Flux ou Stable Diffusion générique pendant le diagnostic.
Un utilisateur russe a indiqué avoir lancé qwen-image-2.1-UC-Q4_K_M.gguf, tout en précisant que l’installation avait nécessité une aide supplémentaire. Un autre workflow communautaire Q8_0 combine GGUF avec l’encodeur et le VAE officiels. Ces exemples prouvent qu’une voie alternative existe, pas que n’importe quel fichier Q4/Q8 est compatible ou sûr à télécharger.
Ajouter l’amélioration, le 2K et l’édition après la base
Une fois l’image de base générée et enregistrée de façon stable, étendez le graphe dans cet ordre :
- Amélioration du prompt : téléchargez
qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors, sélectionnez-le et activezrefine_prompt. Conservez seed, dimensions et nombre d’étapes pour comparer. - Résolution supérieure : augmentez progressivement au lieu de passer directement de 1024 à 2048×2048. Enregistrez en PNG si vous avez besoin d’un canal alpha.
- Édition d’image : passez au workflow Image Edit officiel. Son améliorateur utilise le fichier
..._pe_i2i..., pas le fichier T2I. - Sortie transparente : utilisez la formulation officielle RGBA/fond transparent et enregistrez en PNG. Validez d’abord une image opaque classique afin que la transparence soit la seule nouvelle variable.
Liste de validation finale
- Le cœur, les dépendances frontend et les templates de ComfyUI sont à jour ; aucun nœud du cœur ne reste rouge après redémarrage.
- Le modèle de diffusion, l’encodeur principal et le VAE sont dans les bons dossiers et visibles sous leur nom exact.
- L’amélioration est désactivée, batch vaut 1 et CFG vaut 1 ; 8 Go commence à 768 et 12 Go à 1024.
- Une seule tâche est en file et le terminal la termine sans erreur de modèle, de nœud ou d’OOM.
- Un PNG valide aux dimensions demandées existe dans
ComfyUI/output/. - La combinaison fonctionnelle, la résolution et le pic observé sont notés avant d’ajouter PE, une résolution supérieure, l’édition ou GGUF.
Lorsque ces six points sont remplis, vous disposez d’une base locale reproductible pour Qwen Image 2.1. Chaque optimisation suivante doit modifier un seul élément de cette base, plutôt que la remplacer par un grand graphe dont l’origine d’une panne serait impossible à isoler.