आमंत्रित करें और कमाएँ

आमंत्रण पुरस्कार कैसे काम करते हैं

अपना आमंत्रण लिंक साझा करें। मित्र इसके माध्यम से पंजीकरण करके टॉप-अप करता है तो उसके बाद के टॉप-अप पर आपको दिखाया गया पुरस्कार मिलेगा।

ComfyUI में Qwen Image 2.1: VRAM के हिसाब से लोकल सेटअप

यह guide official Qwen Image 2.1 weights को VRAM के हिसाब से चुनने, ComfyUI में पहला PNG save करने, missing model और OOM errors ठीक करने तथा GGUF कब आज़माना है, यह बताती है।

विषय-सूची
ComfyUI में Qwen Image 2.1: VRAM के हिसाब से लोकल सेटअप

Consumer GPU पर Qwen Image 2.1 चलाने का सबसे भरोसेमंद तरीका सबसे छोटी GGUF फ़ाइल से शुरुआत करना नहीं है। पहले ComfyUI को अपडेट करें, आधिकारिक text-to-image workflow लोड करें, आधिकारिक INT8 diffusion model को compatible Qwen3-VL text encoder और VAE के साथ चुनें, फिर एक छोटी image बनाकर सचमुच save होने की पुष्टि करें। 8 GB या 12 GB VRAM पर शुरुआत में BF16, 2K output या prompt enhancement चालू न करें।

Qwen और Comfy Org ने ऐसा एक minimum VRAM number प्रकाशित नहीं किया है जो हर PC पर लागू हो। नीचे दिए गए 8 GB और 12 GB configuration सुरक्षित शुरुआती विकल्प हैं, guarantee नहीं। System RAM, model offloading, driver, resolution और GPU का उपयोग कर रहे दूसरे programs peak memory को बदलते हैं।

पहले सही weights चुनें: file size, runtime VRAM नहीं है

28 सितंबर 2026 तक Comfy Org के आधिकारिक model repository में दो diffusion weights, तीन मुख्य text encoders, एक VAE और दो अलग prompt-enhancer models उपलब्ध हैं। पहली image के लिए diffusion model, एक main text encoder और VAE पर्याप्त हैं। qwen3.5_9b_..._pe_t2i optional prompt enhancer है; यह qwen3vl_8b_... encoder की जगह नहीं लेता।

भूमिकापहली run के लिए सुझाई गई fileलगभग download sizeFolder
Diffusion modelqwen_image_2.1_int8_convrot.safetensors7.26 GBComfyUI/models/diffusion_models/
Main text encoder, कम memory वाला विकल्पqwen3vl_8b_w4a8.safetensors6.31 GBComfyUI/models/text_encoders/
Main text encoder, official template defaultqwen3vl_8b_int8_convrot.safetensors9.35 GBComfyUI/models/text_encoders/
VAEqwen_image_2.1_vae_bf16.safetensors0.68 GBComfyUI/models/vae/
Optional T2I prompt enhancerqwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors9.47 GBComfyUI/models/text_encoders/

ये repository file sizes हैं, runtime VRAM नहीं। INT8 diffusion + W4A8 encoder + VAE का download लगभग 14.24 GB है; official template का INT8 + INT8 + VAE combination लगभग 17.28 GB है। Prompt enhancer चालू करने पर लगभग 9.47 GB storage और एक अतिरिक्त बड़ा model-loading stage जुड़ता है।

अलग-अलग VRAM के लिए practical first configuration

उपलब्ध VRAMपहले यह आज़माएँपहली generation की settingsसफल होने के बाद ही बढ़ाएँ
8 GBINT8 diffusion + W4A8 main encoder + VAE; prompt enhancement बंद768×768 या लगभग 1 MP से कम, batch 1, CFG 1बाद में 1024; official path फिर भी OOM दे तो community GGUF पर विचार करें
12 GBINT8 diffusion + W4A8 main encoder; INT8 encoder बाद में test करें1024×1024, batch 1, CFG 1Enhancer या resolution में एक समय पर एक बदलाव करें
16 GB और अधिकOfficial-template INT8 diffusion + INT8 encoder + VAE1024×1024, 25 steps, CFG 1Prompt enhancement और 2K अलग-अलग test करें
पर्याप्त VRAM और system RAMपहले INT8 path साबित करें, फिर BF16 components compare करेंPrompt, seed और dimensions समान रखेंबड़ा footprint स्वीकार हो और controlled comparison चाहिए तभी BF16 लें

8 GB और 12 GB वाली rows troubleshooting आसान बनाने के लिए हैं, official hardware requirement नहीं। Qwen सीमित memory में model offloading का तरीका बताता है, जबकि ComfyUI हर machine पर तय करता है कि कौन-सा component GPU पर रहे। इसलिए एक ही GPU वाले दो systems अलग व्यवहार कर सकते हैं।

1. Custom nodes खोजने से पहले ComfyUI अपडेट करें

Qwen Image 2.1 को ComfyUI में native support मिलता है। Official workflow के लिए पहले कोई third-party node pack install नहीं करना चाहिए। Red nodes, Qwen Image 2.1 template न दिखना या TextEncodeQwenImage21 node गायब होना आम तौर पर पुराने core या dependencies का संकेत है।

  • Windows Portable: ComfyUI बंद करें, ComfyUI_windows_portable/update/update_comfyui.bat चलाएँ और फिर restart करें। Routine update के पहले विकल्प के रूप में update_comfyui_and_python_dependencies.bat न चलाएँ, क्योंकि यह पूरी dependency stack reinstall करता है।
  • ComfyUI Desktop: Manage → Update में Engine अपडेट करें। Stable channel नई model support में पीछे रह सकता है; nodes फिर भी न मिलें तो उपलब्ध Latest on GitHub channel लें या Portable/manual install पर जाएँ।
  • Manual Git install: उसी Python environment में code और dependencies अपडेट करें जिससे ComfyUI चलता है, फिर restart करें।
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py

आधिकारिक update guide चेतावनी देता है कि केवल git pull चलाने से frontend, workflow templates और नए nodes पुराने रह सकते हैं। requirements.txt dependencies अपडेट करना भी इस प्रक्रिया का हिस्सा है।

2. हर model को उसके loader वाली सही folder में रखें

चुनी गई files आधिकारिक ComfyUI model repository से डाउनलोड करें। Exact filename न बदलें। Browser duplicate download पर (1) जैसा suffix जोड़ दे तो workflow नाम से model नहीं ढूँढ पाएगा।

कम memory वाली पहली run के लिए यह layout उपयोग करें। Main encoder में W4A8 या INT8 में से एक चुनें:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── qwen_image_2.1_int8_convrot.safetensors
    ├── text_encoders/
    │   ├── qwen3vl_8b_w4a8.safetensors
    │   └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors  # optional
    └── vae/
        └── qwen_image_2.1_vae_bf16.safetensors

Official template के default से मिलाना हो तो qwen3vl_8b_w4a8.safetensors की जगह qwen3vl_8b_int8_convrot.safetensors रखें। Files copy करने के बाद ComfyUI restart करें; loader dropdowns आम तौर पर startup के समय मिले models से भरते हैं।

3. Official text-to-image workflow import करें

ComfyUI के Templates panel से Qwen Image 2.1 text-to-image template खोलें, या official T2I workflow JSON डाउनलोड करके canvas पर drag करें। Current official template मुख्य graph को subgraph में रखता है और 1024×1024, 25 steps, CFG 1 तथा euler + simple से शुरू होता है।

Loaders और controls को इस क्रम में जाँचें:

  1. Diffusion model के रूप में qwen_image_2.1_int8_convrot.safetensors चुनें।
  2. Main text encoder में qwen3vl_8b_w4a8.safetensors या qwen3vl_8b_int8_convrot.safetensors चुनें और type qwen_image रखें।
  3. VAE में qwen_image_2.1_vae_bf16.safetensors चुनें।
  4. पहली run के लिए refine_prompt को false रखें। Template का PE-model selector केवल prompt enhancement के लिए है।
  5. 8 GB card को 768×768 से शुरू करें। 12 GB या उससे अधिक को 1024×1024 से शुरू करें। Dimensions को 32 से divisible रखना बेहतर है।
  6. Batch size 1 और CFG 1 रखें। अभी LoRA, ControlNet, reference image या upscaling branch न जोड़ें।

पहला prompt जानबूझकर सरल रखें, ताकि success पहचानना आसान हो:

A red ceramic teapot on a wooden table, soft window light, plain background.

2K से शुरुआत न करें। Native 2K support का अर्थ है कि model सीधे 2048×2048 बना सकता है; इसका अर्थ यह नहीं कि हर 8 GB या 12 GB configuration उस size को पूरा करेगी।

4. केवल एक job queue करें, wait करें और saved PNG verify करें

Queue Prompt पर एक बार क्लिक करें। पहली run में कई दर्जन GB load हो सकते हैं और components VRAM, system RAM तथा CPU के बीच move हो सकते हैं। Preview तुरंत न दिखे तो वही job बार-बार queue करने के बजाय launch terminal या log देखें।

पहली run को तभी सफल मानें जब ये चार signals मिलें:

  1. Queue model not found, missing node type, CUDA out of memory या process crash के बिना समाप्त हो।
  2. SaveImageAdvanced image दिखाए; केवल sampler का समाप्त होना file save होने का प्रमाण नहीं है।
  3. ComfyUI/output/ में PNG मौजूद हो। Official template default रूप से Qwen_image_2.1 prefix उपयोग करता है; Save Image node बदला हो तो उसी में दिख रही location देखें।
  4. PNG सामान्य रूप से खुले, expected dimensions हों और पूरी तरह black, transparent या corrupt न हो।

NVIDIA system पर दूसरी terminal में memory देख सकते हैं:

nvidia-smi -l 1

Diffusion file, text encoder, dimensions और observed peak नोट करें। बाद में weight या resolution बदलते समय एक बार में एक variable बदलें, ताकि नई failure का कारण पहचाना जा सके।

5. पूरा workflow बदलने के बजाय symptom के हिसाब से ठीक करें

Node लाल है या missing node type दिखता है

ComfyUI core और dependencies अपडेट करके restart करें। Official workflow के TextEncodeQwenImage21, ResolutionSelector और logic switch core nodes हैं। मिलते-जुलते नाम वाला unrelated third-party pack install करने से diagnosis कठिन हो सकता है।

Model dropdown खाली है या model not found आता है

Folder, extension और exact filename जाँचें, फिर ComfyUI restart करें। Common mistakes हैं: main encoder को models/clip/ में रखना, diffusion model को models/checkpoints/ में रखना, या browser द्वारा duplicate file rename होना।

Sampling शुरू होने से पहले VRAM खत्म होती है

Prompt enhancement बंद करें, main encoder INT8 से W4A8 पर बदलें, batch 1 रखें और GPU-heavy browser, game या video tool बंद करें। 8 GB card को 768×768 पर और 12 GB card को 1024×1024 पर लौटाएँ; optional branches हटाएँ।

VAE decode के दौरान या save से ठीक पहले OOM होता है

Width और height घटाएँ, फिर एक नई job queue करें। Steps कम करने से मुख्यतः समय बदलता है; resolution घटाने से latent और VAE decode memory अधिक सीधे कम होती है।

Disk या CPU चल रहा है, पर queue frozen लगती है

यह model loading या offloading हो सकता है, final failure नहीं। स्पष्ट completion या error तक wait करें। बार-बार click करने से बड़े jobs stack होते हैं। यदि RAM लगातार बढ़कर भारी swap करने लगे तो cancel करें, configuration कम करें और ComfyUI restart करें।

Image फीकी, overprocessed या structurally broken दिखती है

पक्का करें कि CFG अभी भी 1 है। Official template बताता है कि CFG 1 पर negative prompt उपयोग नहीं होता। SDXL workflow की high-CFG आदत को यहाँ शुरुआती setting के रूप में न अपनाएँ।

1024 चलता है, लेकिन 2K हमेशा OOM देता है

1024 को working baseline बनाए रखें। Batch 1 और prompt enhancement बंद रखते हुए पहले 1280, फिर 1536 और अंत में 2048 आज़माएँ। Model का 2K capable होना और local memory में उसका fit होना अलग सीमाएँ हैं।

8 GB और 12 GB users को वास्तव में क्या चुनना चाहिए

8 GB पर लक्ष्य हर feature चालू करना नहीं, पूरी pipeline को साबित करना है। INT8 diffusion, W4A8 main encoder और VAE लें; PE बंद रखें; 768×768 और batch 1 से शुरू करें। फिर भी failure हो तो GGUF पर जाने से पहले ComfyUI version और पर्याप्त system RAM की जाँच करें। Unknown quantized file को stock workflow में डालकर interchangeable न मानें।

12 GB पर पहला target 1024×1024 रखें। Headroom के लिए W4A8 से शुरू करें और base run स्थिर होने के बाद official template का INT8 encoder आज़माएँ। Prompt enhancement दूसरे चरण की feature है: यह prompt rewrite करने के लिए एक और 9B model load करता है, इसलिए base graph fail हो रहा हो तो इसे न जोड़ें।

Community posts केवल individual experiments दिखाते हैं, minimum साबित नहीं करते। एक user ने बताया कि वह 8 GB laptop RTX 5060 पर model चला रहा है और अभी optimize कर रहा है; 12 GB RTX 3060 वाले दूसरे user ने 8 GB user को W4A8 सुझाया। ये पहली report और दूसरी suggestion controlled tests या complete logs नहीं हैं, इसलिए इन्हें lead मानें, guarantee नहीं।

GGUF optional low-memory route है, official first run नहीं

Qwen और Comfy Org के templates .safetensors उपयोग करते हैं। GGUF के लिए third-party loader, खास तौर पर Qwen Image 2.1 के लिए बनाया quantized file और उसी loader के अनुरूप graph चाहिए। ComfyUI-GGUF project खुद को work in progress बताता है और हर third-party Qwen quant की compatibility प्रमाणित नहीं करता।

Community route तभी लें जब official INT8/W4A8 path memory की वजह से फिर भी fail हो:

  1. ComfyUI अपडेट करें और Manager या repository से ComfyUI-GGUF install करें।
  2. स्पष्ट रूप से Qwen Image 2.1 के लिए बनी file लें। Publisher, license, hash और required loader जाँचें।
  3. Stock diffusion loader को Unet Loader (GGUF) से बदलें। Qwen Image 2.1-compatible main text encoder और VAE बनाए रखें।
  4. Exact filename चुनें और लगभग 1 MP से कम, CFG 1, batch 1 पर test करें।
  5. Failure पर उसी quant की workflow notes पर लौटें। Qwen Image 1.x, Flux या generic Stable Diffusion graph को diagnosis में न मिलाएँ।

एक रूसी user ने qwen-image-2.1-UC-Q4_K_M.gguf को ComfyUI में चलाने की report दी, लेकिन यह भी कहा कि installation में अतिरिक्त मदद लगी। अलग community Q8_0 workflow GGUF को official encoder और VAE के साथ जोड़ता है। इससे alternative route का अस्तित्व दिखता है; arbitrary Q4 या Q8 file की compatibility या download safety साबित नहीं होती।

Baseline के बाद prompt enhancement, 2K और editing जोड़ें

Base image स्थिर रूप से generate और save होने के बाद graph को इस क्रम में बढ़ाएँ:

  1. Prompt enhancement: qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors डाउनलोड करें, select करें और refine_prompt चालू करें। तुलना में seed, dimensions और steps समान रखें।
  2. Higher resolution: 1024 से सीधे 2048×2048 पर न जाएँ; क्रमशः बढ़ाएँ। Alpha channel चाहिए तो PNG में save करें।
  3. Image editing: official Image Edit workflow पर जाएँ। इसका prompt enhancer T2I नहीं, ..._pe_i2i... file उपयोग करता है।
  4. Transparent output: Official RGBA/transparent-background prompt wording उपयोग करें और PNG में save करें। पहले normal opaque image साबित करें, ताकि transparency अकेला नया variable हो।

अंतिम acceptance checklist

  • ComfyUI core, frontend dependencies और workflow templates current हैं; restart के बाद कोई core node red नहीं है।
  • Diffusion model, main text encoder और VAE सही folders में हैं और exact filenames से दिखते हैं।
  • Prompt enhancement बंद है, batch 1 है और CFG 1 है; 8 GB की शुरुआत 768 से और 12 GB की 1024 से हुई है।
  • Queue में केवल एक task है और terminal model, node या OOM error के बिना समाप्त होता है।
  • ComfyUI/output/ में requested dimensions वाला valid PNG मौजूद है।
  • PE, higher resolution, editing या GGUF जोड़ने से पहले working weight combination, resolution और observed peak memory दर्ज हैं।

जब ये छह बातें पूरी हों, आपके पास reproducible local Qwen Image 2.1 baseline है। आगे की हर optimization में उसी baseline का एक element बदलें; ऐसा बड़ा graph एक साथ न लगाएँ जिसमें failure का source अलग करना असंभव हो।

अपना LLM वर्कफ़्लो बेहतर बनाना चाहते हैं?

एक API से मॉडल जोड़ें, कुंजियाँ प्रबंधित करें और AI खर्च नियंत्रित करें।

मुफ़्त शुरू करें