Qwen Image 2.1 no ComfyUI: instalação local por faixa de VRAM
Guia prático para escolher os pesos oficiais do Qwen Image 2.1 por faixa de VRAM, salvar o primeiro PNG no ComfyUI, resolver OOM e modelos ausentes e avaliar quando usar GGUF.
Conteúdo

A maneira mais confiável de rodar o Qwen Image 2.1 em uma GPU doméstica não é começar pelo menor GGUF que aparecer. Primeiro atualize o ComfyUI, carregue o fluxo oficial de texto para imagem, combine o modelo de difusão INT8 com um encoder de texto Qwen3-VL compatível e o VAE, e gere uma imagem pequena que seja realmente salva. Em placas com 8 ou 12 GB, não comece com BF16, saída 2K nem aprimoramento de prompt.
Nem a Qwen nem a Comfy Org publicam um único mínimo de VRAM que valha para todos os computadores. As configurações de 8 e 12 GB abaixo são pontos de partida conservadores, não garantias: RAM do sistema, offloading, driver, resolução e outros processos na GPU alteram o pico de memória.
Escolha os pesos primeiro: tamanho do arquivo não é consumo de VRAM
Em 28 de setembro de 2026, o repositório oficial de modelos da Comfy Org oferece dois pesos de difusão, três encoders de texto principais, um VAE e dois modelos separados de aprimoramento de prompt. Para a primeira imagem, você precisa apenas da difusão, de um encoder principal e do VAE. O arquivo qwen3.5_9b_..._pe_t2i é um aprimorador opcional; ele não substitui o encoder qwen3vl_8b_....
| Função | Arquivo indicado para o primeiro teste | Download aprox. | Pasta |
|---|---|---|---|
| Modelo de difusão | qwen_image_2.1_int8_convrot.safetensors | 7,26 GB | ComfyUI/models/diffusion_models/ |
| Encoder principal, opção de menor memória | qwen3vl_8b_w4a8.safetensors | 6,31 GB | ComfyUI/models/text_encoders/ |
| Encoder principal, padrão do template oficial | qwen3vl_8b_int8_convrot.safetensors | 9,35 GB | ComfyUI/models/text_encoders/ |
| VAE | qwen_image_2.1_vae_bf16.safetensors | 0,68 GB | ComfyUI/models/vae/ |
| Aprimorador T2I opcional | qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors | 9,47 GB | ComfyUI/models/text_encoders/ |
Esses números são tamanhos no repositório, não VRAM em execução. Difusão INT8 + encoder W4A8 + VAE somam cerca de 14,24 GB de download; a combinação INT8 + INT8 + VAE do template oficial chega a aproximadamente 17,28 GB. Ativar o aprimorador acrescenta cerca de 9,47 GB em disco e outra etapa pesada de carregamento.
Uma configuração inicial prática para cada faixa de VRAM
| VRAM disponível | Tente primeiro | Configuração da primeira geração | Só aumente depois de funcionar |
|---|---|---|---|
| 8 GB | Difusão INT8 + encoder W4A8 + VAE; aprimoramento desligado | 768×768 ou aproximadamente até 1 MP, lote 1, CFG 1 | Depois tente 1024; considere GGUF da comunidade apenas se a rota oficial ainda der OOM |
| 12 GB | Difusão INT8 + encoder W4A8; teste o encoder INT8 depois | 1024×1024, lote 1, CFG 1 | Ative o aprimorador ou aumente a resolução, uma mudança por vez |
| 16 GB ou mais | Difusão INT8 + encoder INT8 + VAE do template oficial | 1024×1024, 25 passos, CFG 1 | Teste aprimoramento e 2K separadamente |
| Bastante VRAM e RAM | Confirme primeiro a rota INT8 e depois compare BF16 | Mantenha prompt, seed e dimensões iguais | Use BF16 apenas em comparação controlada e aceitando o maior consumo |
As linhas de 8 e 12 GB reduzem o custo de diagnóstico; não são requisitos oficiais. A Qwen documenta offloading para memória limitada, enquanto o ComfyUI decide o que manter na GPU em cada máquina. Dois sistemas com a mesma placa podem, portanto, ter resultados diferentes.
1. Atualize o ComfyUI antes de procurar custom nodes
O Qwen Image 2.1 tem suporte nativo no ComfyUI. O fluxo oficial não deveria exigir pacotes de nós de terceiros. Nós vermelhos, ausência do template Qwen Image 2.1 ou falta do TextEncodeQwenImage21 normalmente indicam que o núcleo ou as dependências incluídas estão desatualizados.
- Windows Portable: feche o ComfyUI, execute
ComfyUI_windows_portable/update/update_comfyui.bate abra novamente. Não useupdate_comfyui_and_python_dependencies.batcomo primeira escolha de rotina, pois ele reinstala toda a pilha de dependências. - ComfyUI Desktop: atualize o Engine em Manage → Update. O canal Stable pode demorar a receber suporte a modelos novos; se os nós ainda não aparecerem, use o canal disponível
Latest on GitHubou migre para Portable/instalação manual. - Instalação manual via Git: atualize o código e as dependências dentro do ambiente Python que realmente executa o ComfyUI, depois reinicie.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py
O guia oficial de atualização alerta que apenas git pull pode deixar frontend, templates e nós novos desatualizados. Instalar as dependências de requirements.txt faz parte da atualização.
2. Coloque cada modelo na pasta lida pelo seu loader
Baixe os arquivos escolhidos no repositório oficial do ComfyUI. Preserve os nomes exatos: um sufixo como (1) adicionado pelo navegador pode impedir que o template encontre o modelo.
Para o primeiro teste com memória limitada, use esta estrutura. Escolha W4A8 ou INT8 como encoder principal:
ComfyUI/
└── models/
├── diffusion_models/
│ └── qwen_image_2.1_int8_convrot.safetensors
├── text_encoders/
│ ├── qwen3vl_8b_w4a8.safetensors
│ └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors # optional
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors
Para reproduzir o padrão do template oficial, troque qwen3vl_8b_w4a8.safetensors por qwen3vl_8b_int8_convrot.safetensors. Reinicie o ComfyUI depois de copiar os arquivos; os menus dos loaders normalmente são preenchidos na inicialização.
3. Importe o fluxo oficial de texto para imagem
Abra o template Qwen Image 2.1 text-to-image no painel Templates ou baixe e arraste para a tela o JSON oficial do fluxo T2I. A versão atual agrupa o grafo principal em um subgraph e começa em 1024×1024, 25 passos, CFG 1 e euler + simple.
Confira loaders e controles nesta ordem:
- Selecione
qwen_image_2.1_int8_convrot.safetensorscomo modelo de difusão. - Selecione
qwen3vl_8b_w4a8.safetensorsouqwen3vl_8b_int8_convrot.safetensorscomo encoder principal, com tipoqwen_image. - Selecione
qwen_image_2.1_vae_bf16.safetensorscomo VAE. - Deixe
refine_promptemfalseno primeiro teste. O seletor de PE do template serve apenas para aprimorar o prompt. - Em 8 GB, comece em 768×768. Em 12 GB ou mais, comece em 1024×1024. Prefira dimensões divisíveis por 32.
- Mantenha lote 1 e CFG 1. Ainda não adicione LoRA, ControlNet, imagem de referência nem upscale.
Use um primeiro prompt simples para que o resultado seja fácil de reconhecer:
A red ceramic teapot on a wooden table, soft window light, plain background.
Não comece em 2K. Suporte nativo a 2K significa que o modelo pode gerar 2048×2048 diretamente; não significa que toda configuração com 8 ou 12 GB consiga concluir esse tamanho.
4. Coloque uma tarefa na fila, aguarde e confirme o PNG salvo
Clique em Queue Prompt uma vez. A primeira execução pode carregar dezenas de gigabytes e mover componentes entre VRAM, RAM e CPU. Se a prévia ainda não apareceu, observe o terminal ou log de inicialização em vez de enfileirar o mesmo trabalho repetidamente.
Considere o primeiro teste bem-sucedido somente quando os quatro sinais estiverem presentes:
- A fila termina sem
model not found,missing node type,CUDA out of memoryou encerramento do processo. SaveImageAdvancedmostra a imagem; o sampler terminar sozinho não prova que o arquivo foi salvo.- Há um PNG em
ComfyUI/output/. O template oficial usa o prefixoQwen_image_2.1por padrão; se você alterou o nó de salvamento, siga o caminho exibido nele. - O PNG abre normalmente, tem as dimensões esperadas e não está totalmente preto, transparente ou corrompido.
Em uma GPU NVIDIA, acompanhe a memória em outro terminal:
nvidia-smi -l 1
Anote o arquivo de difusão, o encoder, as dimensões e o pico observado. Depois, mude uma variável por vez para que qualquer nova falha tenha uma causa identificável.
5. Resolva pelo sintoma, sem trocar o fluxo inteiro
Um nó fica vermelho ou mostra missing node type
Atualize o núcleo do ComfyUI e as dependências e reinicie. TextEncodeQwenImage21, ResolutionSelector e o switch lógico do fluxo oficial são nós do próprio ComfyUI. Instalar um pacote de terceiros com nome parecido pode piorar a investigação.
O seletor está vazio ou aparece model not found
Confira pasta, extensão e nome exato e reinicie o ComfyUI. Erros comuns: encoder em models/clip/, modelo de difusão em models/checkpoints/ ou arquivo renomeado pelo navegador.
A VRAM acaba antes do sampling
Desligue o aprimoramento, troque o encoder principal de INT8 por W4A8, mantenha lote 1 e feche navegadores, jogos ou editores de vídeo que usam a GPU. Em 8 GB, volte para 768×768; em 12 GB, volte para 1024×1024 e remova ramos opcionais.
O OOM ocorre no VAE decode ou pouco antes de salvar
Reduza largura e altura e enfileire uma única nova tarefa. Diminuir passos afeta principalmente o tempo; reduzir resolução diminui mais diretamente a memória de latent e do decode do VAE.
A fila parece travada enquanto disco ou CPU continuam ativos
Muitas vezes é carregamento ou offloading, não falha definitiva. Espere um estado claro de conclusão ou erro. Cliques repetidos só empilham tarefas grandes. Se a RAM entrar em swap intenso, cancele, reduza a configuração e reinicie o ComfyUI.
A imagem fica lavada, exagerada ou estruturalmente quebrada
Confira se CFG continua em 1. O template oficial informa que o prompt negativo não é usado com CFG 1; copiar um CFG alto de um fluxo SDXL não é um bom começo.
1024 funciona, mas 2K sempre dá OOM
Mantenha 1024 como base funcional. Teste 1280, depois 1536 e só então 2048, uma etapa por vez, com lote 1 e aprimoramento desligado. Capacidade do modelo e memória local são limites diferentes.
O que usuários de 8 e 12 GB devem escolher de fato
Em 8 GB, o objetivo é provar a cadeia, não ligar todos os recursos. Use difusão INT8, encoder W4A8 e VAE; desligue PE; comece em 768×768 e lote 1. Se ainda falhar, confirme que o ComfyUI está atual e que há RAM suficiente antes de migrar para GGUF. Não coloque um quant desconhecido no fluxo padrão supondo que seja intercambiável.
Em 12 GB, use 1024×1024 como primeiro alvo. Comece com W4A8 para preservar margem e teste o encoder INT8 do template oficial depois que a base estiver estável. O aprimoramento é uma segunda etapa: ele carrega outro modelo 9B para reescrever o prompt, então não deve ser introduzido enquanto o grafo básico ainda falha.
Posts da comunidade mostram apenas experiências individuais, não um mínimo comprovado. Uma pessoa disse que rodava o modelo em uma RTX 5060 de notebook com 8 GB enquanto ainda o otimizava; outra, com uma RTX 3060 de 12 GB, sugeriu W4A8 a um usuário de 8 GB. Estes são o primeiro relato e a segunda sugestão, sem testes controlados ou logs completos; use-os como pistas, não garantias.
GGUF é uma rota opcional de pouca memória, não o começo oficial
Os templates da Qwen e da Comfy Org usam .safetensors. GGUF exige um loader de terceiros, um arquivo quantizado específico para Qwen Image 2.1 e um grafo preparado para esse loader. O projeto ComfyUI-GGUF se descreve como work in progress e não certifica todo quant Qwen publicado por terceiros.
Considere a rota comunitária apenas se a combinação oficial INT8/W4A8 ainda falhar por memória:
- Atualize o ComfyUI e instale
ComfyUI-GGUFpelo Manager ou pelo repositório. - Obtenha um arquivo explicitamente criado para Qwen Image 2.1. Confira autor, licença, hash e loader necessário.
- Troque o loader de difusão padrão por
Unet Loader (GGUF). Mantenha encoder principal e VAE compatíveis com Qwen Image 2.1. - Selecione o nome exato e teste abaixo de aproximadamente 1 MP, CFG 1 e lote 1.
- Se falhar, volte às notas daquele quant. Não misture grafos de Qwen Image 1.x, Flux ou Stable Diffusion genérico no diagnóstico.
Um usuário russo relatou ter executado qwen-image-2.1-UC-Q4_K_M.gguf, mas também disse que precisou de ajuda extra para instalar. Outro fluxo comunitário Q8_0 combina GGUF com encoder e VAE oficiais. Isso mostra que existe uma alternativa, não que qualquer Q4/Q8 seja compatível ou seguro para download.
Adicione aprimoramento, 2K e edição só depois da base funcionar
Quando a imagem básica estiver sendo gerada e salva de forma estável, amplie o grafo nesta ordem:
- Aprimoramento de prompt: baixe
qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors, selecione-o e ativerefine_prompt. Mantenha seed, dimensões e passos iguais na comparação. - Resolução maior: aumente em etapas, sem saltar de 1024 para 2048×2048. Salve em PNG quando precisar de canal alfa.
- Edição de imagem: mude para o fluxo oficial Image Edit. O aprimorador dele usa
..._pe_i2i..., não o arquivo T2I. - Saída transparente: use a formulação oficial para RGBA/fundo transparente e salve em PNG. Primeiro valide uma imagem opaca comum para que transparência seja a única variável nova.
Checklist final de aceitação
- Núcleo, dependências do frontend e templates do ComfyUI estão atualizados; nenhum nó do núcleo permanece vermelho após reiniciar.
- Modelo de difusão, encoder principal e VAE estão nas pastas certas e aparecem pelo nome exato.
- Aprimoramento está desligado, lote é 1 e CFG é 1; 8 GB começa em 768 e 12 GB em 1024.
- Há apenas uma tarefa na fila e o terminal termina sem erro de modelo, nó ou OOM.
- Existe um PNG válido com as dimensões pedidas em
ComfyUI/output/. - Antes de adicionar PE, resolução alta, edição ou GGUF, você registrou a combinação funcional, a resolução e o pico observado.
Com os seis itens atendidos, você tem uma base local reproduzível do Qwen Image 2.1. A partir dela, altere um elemento por vez, em vez de trocar tudo por um grafo grande cujo erro seja impossível de isolar.