ComfyUI में Qwen Image 2.1: VRAM के हिसाब से लोकल सेटअप
यह guide official Qwen Image 2.1 weights को VRAM के हिसाब से चुनने, ComfyUI में पहला PNG save करने, missing model और OOM errors ठीक करने तथा GGUF कब आज़माना है, यह बताती है।
विषय-सूची

Consumer GPU पर Qwen Image 2.1 चलाने का सबसे भरोसेमंद तरीका सबसे छोटी GGUF फ़ाइल से शुरुआत करना नहीं है। पहले ComfyUI को अपडेट करें, आधिकारिक text-to-image workflow लोड करें, आधिकारिक INT8 diffusion model को compatible Qwen3-VL text encoder और VAE के साथ चुनें, फिर एक छोटी image बनाकर सचमुच save होने की पुष्टि करें। 8 GB या 12 GB VRAM पर शुरुआत में BF16, 2K output या prompt enhancement चालू न करें।
Qwen और Comfy Org ने ऐसा एक minimum VRAM number प्रकाशित नहीं किया है जो हर PC पर लागू हो। नीचे दिए गए 8 GB और 12 GB configuration सुरक्षित शुरुआती विकल्प हैं, guarantee नहीं। System RAM, model offloading, driver, resolution और GPU का उपयोग कर रहे दूसरे programs peak memory को बदलते हैं।
पहले सही weights चुनें: file size, runtime VRAM नहीं है
28 सितंबर 2026 तक Comfy Org के आधिकारिक model repository में दो diffusion weights, तीन मुख्य text encoders, एक VAE और दो अलग prompt-enhancer models उपलब्ध हैं। पहली image के लिए diffusion model, एक main text encoder और VAE पर्याप्त हैं। qwen3.5_9b_..._pe_t2i optional prompt enhancer है; यह qwen3vl_8b_... encoder की जगह नहीं लेता।
| भूमिका | पहली run के लिए सुझाई गई file | लगभग download size | Folder |
|---|---|---|---|
| Diffusion model | qwen_image_2.1_int8_convrot.safetensors | 7.26 GB | ComfyUI/models/diffusion_models/ |
| Main text encoder, कम memory वाला विकल्प | qwen3vl_8b_w4a8.safetensors | 6.31 GB | ComfyUI/models/text_encoders/ |
| Main text encoder, official template default | qwen3vl_8b_int8_convrot.safetensors | 9.35 GB | ComfyUI/models/text_encoders/ |
| VAE | qwen_image_2.1_vae_bf16.safetensors | 0.68 GB | ComfyUI/models/vae/ |
| Optional T2I prompt enhancer | qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors | 9.47 GB | ComfyUI/models/text_encoders/ |
ये repository file sizes हैं, runtime VRAM नहीं। INT8 diffusion + W4A8 encoder + VAE का download लगभग 14.24 GB है; official template का INT8 + INT8 + VAE combination लगभग 17.28 GB है। Prompt enhancer चालू करने पर लगभग 9.47 GB storage और एक अतिरिक्त बड़ा model-loading stage जुड़ता है।
अलग-अलग VRAM के लिए practical first configuration
| उपलब्ध VRAM | पहले यह आज़माएँ | पहली generation की settings | सफल होने के बाद ही बढ़ाएँ |
|---|---|---|---|
| 8 GB | INT8 diffusion + W4A8 main encoder + VAE; prompt enhancement बंद | 768×768 या लगभग 1 MP से कम, batch 1, CFG 1 | बाद में 1024; official path फिर भी OOM दे तो community GGUF पर विचार करें |
| 12 GB | INT8 diffusion + W4A8 main encoder; INT8 encoder बाद में test करें | 1024×1024, batch 1, CFG 1 | Enhancer या resolution में एक समय पर एक बदलाव करें |
| 16 GB और अधिक | Official-template INT8 diffusion + INT8 encoder + VAE | 1024×1024, 25 steps, CFG 1 | Prompt enhancement और 2K अलग-अलग test करें |
| पर्याप्त VRAM और system RAM | पहले INT8 path साबित करें, फिर BF16 components compare करें | Prompt, seed और dimensions समान रखें | बड़ा footprint स्वीकार हो और controlled comparison चाहिए तभी BF16 लें |
8 GB और 12 GB वाली rows troubleshooting आसान बनाने के लिए हैं, official hardware requirement नहीं। Qwen सीमित memory में model offloading का तरीका बताता है, जबकि ComfyUI हर machine पर तय करता है कि कौन-सा component GPU पर रहे। इसलिए एक ही GPU वाले दो systems अलग व्यवहार कर सकते हैं।
1. Custom nodes खोजने से पहले ComfyUI अपडेट करें
Qwen Image 2.1 को ComfyUI में native support मिलता है। Official workflow के लिए पहले कोई third-party node pack install नहीं करना चाहिए। Red nodes, Qwen Image 2.1 template न दिखना या TextEncodeQwenImage21 node गायब होना आम तौर पर पुराने core या dependencies का संकेत है।
- Windows Portable: ComfyUI बंद करें,
ComfyUI_windows_portable/update/update_comfyui.batचलाएँ और फिर restart करें। Routine update के पहले विकल्प के रूप मेंupdate_comfyui_and_python_dependencies.batन चलाएँ, क्योंकि यह पूरी dependency stack reinstall करता है। - ComfyUI Desktop: Manage → Update में Engine अपडेट करें। Stable channel नई model support में पीछे रह सकता है; nodes फिर भी न मिलें तो उपलब्ध
Latest on GitHubchannel लें या Portable/manual install पर जाएँ। - Manual Git install: उसी Python environment में code और dependencies अपडेट करें जिससे ComfyUI चलता है, फिर restart करें।
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py
आधिकारिक update guide चेतावनी देता है कि केवल git pull चलाने से frontend, workflow templates और नए nodes पुराने रह सकते हैं। requirements.txt dependencies अपडेट करना भी इस प्रक्रिया का हिस्सा है।
2. हर model को उसके loader वाली सही folder में रखें
चुनी गई files आधिकारिक ComfyUI model repository से डाउनलोड करें। Exact filename न बदलें। Browser duplicate download पर (1) जैसा suffix जोड़ दे तो workflow नाम से model नहीं ढूँढ पाएगा।
कम memory वाली पहली run के लिए यह layout उपयोग करें। Main encoder में W4A8 या INT8 में से एक चुनें:
ComfyUI/
└── models/
├── diffusion_models/
│ └── qwen_image_2.1_int8_convrot.safetensors
├── text_encoders/
│ ├── qwen3vl_8b_w4a8.safetensors
│ └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors # optional
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors
Official template के default से मिलाना हो तो qwen3vl_8b_w4a8.safetensors की जगह qwen3vl_8b_int8_convrot.safetensors रखें। Files copy करने के बाद ComfyUI restart करें; loader dropdowns आम तौर पर startup के समय मिले models से भरते हैं।
3. Official text-to-image workflow import करें
ComfyUI के Templates panel से Qwen Image 2.1 text-to-image template खोलें, या official T2I workflow JSON डाउनलोड करके canvas पर drag करें। Current official template मुख्य graph को subgraph में रखता है और 1024×1024, 25 steps, CFG 1 तथा euler + simple से शुरू होता है।
Loaders और controls को इस क्रम में जाँचें:
- Diffusion model के रूप में
qwen_image_2.1_int8_convrot.safetensorsचुनें। - Main text encoder में
qwen3vl_8b_w4a8.safetensorsयाqwen3vl_8b_int8_convrot.safetensorsचुनें और typeqwen_imageरखें। - VAE में
qwen_image_2.1_vae_bf16.safetensorsचुनें। - पहली run के लिए
refine_promptकोfalseरखें। Template का PE-model selector केवल prompt enhancement के लिए है। - 8 GB card को 768×768 से शुरू करें। 12 GB या उससे अधिक को 1024×1024 से शुरू करें। Dimensions को 32 से divisible रखना बेहतर है।
- Batch size 1 और CFG 1 रखें। अभी LoRA, ControlNet, reference image या upscaling branch न जोड़ें।
पहला prompt जानबूझकर सरल रखें, ताकि success पहचानना आसान हो:
A red ceramic teapot on a wooden table, soft window light, plain background.
2K से शुरुआत न करें। Native 2K support का अर्थ है कि model सीधे 2048×2048 बना सकता है; इसका अर्थ यह नहीं कि हर 8 GB या 12 GB configuration उस size को पूरा करेगी।
4. केवल एक job queue करें, wait करें और saved PNG verify करें
Queue Prompt पर एक बार क्लिक करें। पहली run में कई दर्जन GB load हो सकते हैं और components VRAM, system RAM तथा CPU के बीच move हो सकते हैं। Preview तुरंत न दिखे तो वही job बार-बार queue करने के बजाय launch terminal या log देखें।
पहली run को तभी सफल मानें जब ये चार signals मिलें:
- Queue
model not found,missing node type,CUDA out of memoryया process crash के बिना समाप्त हो। SaveImageAdvancedimage दिखाए; केवल sampler का समाप्त होना file save होने का प्रमाण नहीं है।ComfyUI/output/में PNG मौजूद हो। Official template default रूप सेQwen_image_2.1prefix उपयोग करता है; Save Image node बदला हो तो उसी में दिख रही location देखें।- PNG सामान्य रूप से खुले, expected dimensions हों और पूरी तरह black, transparent या corrupt न हो।
NVIDIA system पर दूसरी terminal में memory देख सकते हैं:
nvidia-smi -l 1
Diffusion file, text encoder, dimensions और observed peak नोट करें। बाद में weight या resolution बदलते समय एक बार में एक variable बदलें, ताकि नई failure का कारण पहचाना जा सके।
5. पूरा workflow बदलने के बजाय symptom के हिसाब से ठीक करें
Node लाल है या missing node type दिखता है
ComfyUI core और dependencies अपडेट करके restart करें। Official workflow के TextEncodeQwenImage21, ResolutionSelector और logic switch core nodes हैं। मिलते-जुलते नाम वाला unrelated third-party pack install करने से diagnosis कठिन हो सकता है।
Model dropdown खाली है या model not found आता है
Folder, extension और exact filename जाँचें, फिर ComfyUI restart करें। Common mistakes हैं: main encoder को models/clip/ में रखना, diffusion model को models/checkpoints/ में रखना, या browser द्वारा duplicate file rename होना।
Sampling शुरू होने से पहले VRAM खत्म होती है
Prompt enhancement बंद करें, main encoder INT8 से W4A8 पर बदलें, batch 1 रखें और GPU-heavy browser, game या video tool बंद करें। 8 GB card को 768×768 पर और 12 GB card को 1024×1024 पर लौटाएँ; optional branches हटाएँ।
VAE decode के दौरान या save से ठीक पहले OOM होता है
Width और height घटाएँ, फिर एक नई job queue करें। Steps कम करने से मुख्यतः समय बदलता है; resolution घटाने से latent और VAE decode memory अधिक सीधे कम होती है।
Disk या CPU चल रहा है, पर queue frozen लगती है
यह model loading या offloading हो सकता है, final failure नहीं। स्पष्ट completion या error तक wait करें। बार-बार click करने से बड़े jobs stack होते हैं। यदि RAM लगातार बढ़कर भारी swap करने लगे तो cancel करें, configuration कम करें और ComfyUI restart करें।
Image फीकी, overprocessed या structurally broken दिखती है
पक्का करें कि CFG अभी भी 1 है। Official template बताता है कि CFG 1 पर negative prompt उपयोग नहीं होता। SDXL workflow की high-CFG आदत को यहाँ शुरुआती setting के रूप में न अपनाएँ।
1024 चलता है, लेकिन 2K हमेशा OOM देता है
1024 को working baseline बनाए रखें। Batch 1 और prompt enhancement बंद रखते हुए पहले 1280, फिर 1536 और अंत में 2048 आज़माएँ। Model का 2K capable होना और local memory में उसका fit होना अलग सीमाएँ हैं।
8 GB और 12 GB users को वास्तव में क्या चुनना चाहिए
8 GB पर लक्ष्य हर feature चालू करना नहीं, पूरी pipeline को साबित करना है। INT8 diffusion, W4A8 main encoder और VAE लें; PE बंद रखें; 768×768 और batch 1 से शुरू करें। फिर भी failure हो तो GGUF पर जाने से पहले ComfyUI version और पर्याप्त system RAM की जाँच करें। Unknown quantized file को stock workflow में डालकर interchangeable न मानें।
12 GB पर पहला target 1024×1024 रखें। Headroom के लिए W4A8 से शुरू करें और base run स्थिर होने के बाद official template का INT8 encoder आज़माएँ। Prompt enhancement दूसरे चरण की feature है: यह prompt rewrite करने के लिए एक और 9B model load करता है, इसलिए base graph fail हो रहा हो तो इसे न जोड़ें।
Community posts केवल individual experiments दिखाते हैं, minimum साबित नहीं करते। एक user ने बताया कि वह 8 GB laptop RTX 5060 पर model चला रहा है और अभी optimize कर रहा है; 12 GB RTX 3060 वाले दूसरे user ने 8 GB user को W4A8 सुझाया। ये पहली report और दूसरी suggestion controlled tests या complete logs नहीं हैं, इसलिए इन्हें lead मानें, guarantee नहीं।
GGUF optional low-memory route है, official first run नहीं
Qwen और Comfy Org के templates .safetensors उपयोग करते हैं। GGUF के लिए third-party loader, खास तौर पर Qwen Image 2.1 के लिए बनाया quantized file और उसी loader के अनुरूप graph चाहिए। ComfyUI-GGUF project खुद को work in progress बताता है और हर third-party Qwen quant की compatibility प्रमाणित नहीं करता।
Community route तभी लें जब official INT8/W4A8 path memory की वजह से फिर भी fail हो:
- ComfyUI अपडेट करें और Manager या repository से
ComfyUI-GGUFinstall करें। - स्पष्ट रूप से Qwen Image 2.1 के लिए बनी file लें। Publisher, license, hash और required loader जाँचें।
- Stock diffusion loader को
Unet Loader (GGUF)से बदलें। Qwen Image 2.1-compatible main text encoder और VAE बनाए रखें। - Exact filename चुनें और लगभग 1 MP से कम, CFG 1, batch 1 पर test करें।
- Failure पर उसी quant की workflow notes पर लौटें। Qwen Image 1.x, Flux या generic Stable Diffusion graph को diagnosis में न मिलाएँ।
एक रूसी user ने qwen-image-2.1-UC-Q4_K_M.gguf को ComfyUI में चलाने की report दी, लेकिन यह भी कहा कि installation में अतिरिक्त मदद लगी। अलग community Q8_0 workflow GGUF को official encoder और VAE के साथ जोड़ता है। इससे alternative route का अस्तित्व दिखता है; arbitrary Q4 या Q8 file की compatibility या download safety साबित नहीं होती।
Baseline के बाद prompt enhancement, 2K और editing जोड़ें
Base image स्थिर रूप से generate और save होने के बाद graph को इस क्रम में बढ़ाएँ:
- Prompt enhancement:
qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensorsडाउनलोड करें, select करें औरrefine_promptचालू करें। तुलना में seed, dimensions और steps समान रखें। - Higher resolution: 1024 से सीधे 2048×2048 पर न जाएँ; क्रमशः बढ़ाएँ। Alpha channel चाहिए तो PNG में save करें।
- Image editing: official Image Edit workflow पर जाएँ। इसका prompt enhancer T2I नहीं,
..._pe_i2i...file उपयोग करता है। - Transparent output: Official RGBA/transparent-background prompt wording उपयोग करें और PNG में save करें। पहले normal opaque image साबित करें, ताकि transparency अकेला नया variable हो।
अंतिम acceptance checklist
- ComfyUI core, frontend dependencies और workflow templates current हैं; restart के बाद कोई core node red नहीं है।
- Diffusion model, main text encoder और VAE सही folders में हैं और exact filenames से दिखते हैं।
- Prompt enhancement बंद है, batch 1 है और CFG 1 है; 8 GB की शुरुआत 768 से और 12 GB की 1024 से हुई है।
- Queue में केवल एक task है और terminal model, node या OOM error के बिना समाप्त होता है।
ComfyUI/output/में requested dimensions वाला valid PNG मौजूद है।- PE, higher resolution, editing या GGUF जोड़ने से पहले working weight combination, resolution और observed peak memory दर्ज हैं।
जब ये छह बातें पूरी हों, आपके पास reproducible local Qwen Image 2.1 baseline है। आगे की हर optimization में उसी baseline का एक element बदलें; ऐसा बड़ा graph एक साथ न लगाएँ जिसमें failure का source अलग करना असंभव हो।