Convide e ganhe

Como funcionam as recompensas

Compartilhe seu link. Quando um amigo se cadastrar por ele e adicionar saldo, você receberá a recompensa exibida nas recargas posteriores.

Qwen Image 2.1 no ComfyUI: instalação local por faixa de VRAM

Guia prático para escolher os pesos oficiais do Qwen Image 2.1 por faixa de VRAM, salvar o primeiro PNG no ComfyUI, resolver OOM e modelos ausentes e avaliar quando usar GGUF.

Conteúdo
Qwen Image 2.1 no ComfyUI: instalação local por faixa de VRAM

A maneira mais confiável de rodar o Qwen Image 2.1 em uma GPU doméstica não é começar pelo menor GGUF que aparecer. Primeiro atualize o ComfyUI, carregue o fluxo oficial de texto para imagem, combine o modelo de difusão INT8 com um encoder de texto Qwen3-VL compatível e o VAE, e gere uma imagem pequena que seja realmente salva. Em placas com 8 ou 12 GB, não comece com BF16, saída 2K nem aprimoramento de prompt.

Nem a Qwen nem a Comfy Org publicam um único mínimo de VRAM que valha para todos os computadores. As configurações de 8 e 12 GB abaixo são pontos de partida conservadores, não garantias: RAM do sistema, offloading, driver, resolução e outros processos na GPU alteram o pico de memória.

Escolha os pesos primeiro: tamanho do arquivo não é consumo de VRAM

Em 28 de setembro de 2026, o repositório oficial de modelos da Comfy Org oferece dois pesos de difusão, três encoders de texto principais, um VAE e dois modelos separados de aprimoramento de prompt. Para a primeira imagem, você precisa apenas da difusão, de um encoder principal e do VAE. O arquivo qwen3.5_9b_..._pe_t2i é um aprimorador opcional; ele não substitui o encoder qwen3vl_8b_....

FunçãoArquivo indicado para o primeiro testeDownload aprox.Pasta
Modelo de difusãoqwen_image_2.1_int8_convrot.safetensors7,26 GBComfyUI/models/diffusion_models/
Encoder principal, opção de menor memóriaqwen3vl_8b_w4a8.safetensors6,31 GBComfyUI/models/text_encoders/
Encoder principal, padrão do template oficialqwen3vl_8b_int8_convrot.safetensors9,35 GBComfyUI/models/text_encoders/
VAEqwen_image_2.1_vae_bf16.safetensors0,68 GBComfyUI/models/vae/
Aprimorador T2I opcionalqwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors9,47 GBComfyUI/models/text_encoders/

Esses números são tamanhos no repositório, não VRAM em execução. Difusão INT8 + encoder W4A8 + VAE somam cerca de 14,24 GB de download; a combinação INT8 + INT8 + VAE do template oficial chega a aproximadamente 17,28 GB. Ativar o aprimorador acrescenta cerca de 9,47 GB em disco e outra etapa pesada de carregamento.

Uma configuração inicial prática para cada faixa de VRAM

VRAM disponívelTente primeiroConfiguração da primeira geraçãoSó aumente depois de funcionar
8 GBDifusão INT8 + encoder W4A8 + VAE; aprimoramento desligado768×768 ou aproximadamente até 1 MP, lote 1, CFG 1Depois tente 1024; considere GGUF da comunidade apenas se a rota oficial ainda der OOM
12 GBDifusão INT8 + encoder W4A8; teste o encoder INT8 depois1024×1024, lote 1, CFG 1Ative o aprimorador ou aumente a resolução, uma mudança por vez
16 GB ou maisDifusão INT8 + encoder INT8 + VAE do template oficial1024×1024, 25 passos, CFG 1Teste aprimoramento e 2K separadamente
Bastante VRAM e RAMConfirme primeiro a rota INT8 e depois compare BF16Mantenha prompt, seed e dimensões iguaisUse BF16 apenas em comparação controlada e aceitando o maior consumo

As linhas de 8 e 12 GB reduzem o custo de diagnóstico; não são requisitos oficiais. A Qwen documenta offloading para memória limitada, enquanto o ComfyUI decide o que manter na GPU em cada máquina. Dois sistemas com a mesma placa podem, portanto, ter resultados diferentes.

1. Atualize o ComfyUI antes de procurar custom nodes

O Qwen Image 2.1 tem suporte nativo no ComfyUI. O fluxo oficial não deveria exigir pacotes de nós de terceiros. Nós vermelhos, ausência do template Qwen Image 2.1 ou falta do TextEncodeQwenImage21 normalmente indicam que o núcleo ou as dependências incluídas estão desatualizados.

  • Windows Portable: feche o ComfyUI, execute ComfyUI_windows_portable/update/update_comfyui.bat e abra novamente. Não use update_comfyui_and_python_dependencies.bat como primeira escolha de rotina, pois ele reinstala toda a pilha de dependências.
  • ComfyUI Desktop: atualize o Engine em Manage → Update. O canal Stable pode demorar a receber suporte a modelos novos; se os nós ainda não aparecerem, use o canal disponível Latest on GitHub ou migre para Portable/instalação manual.
  • Instalação manual via Git: atualize o código e as dependências dentro do ambiente Python que realmente executa o ComfyUI, depois reinicie.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py

O guia oficial de atualização alerta que apenas git pull pode deixar frontend, templates e nós novos desatualizados. Instalar as dependências de requirements.txt faz parte da atualização.

2. Coloque cada modelo na pasta lida pelo seu loader

Baixe os arquivos escolhidos no repositório oficial do ComfyUI. Preserve os nomes exatos: um sufixo como (1) adicionado pelo navegador pode impedir que o template encontre o modelo.

Para o primeiro teste com memória limitada, use esta estrutura. Escolha W4A8 ou INT8 como encoder principal:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── qwen_image_2.1_int8_convrot.safetensors
    ├── text_encoders/
    │   ├── qwen3vl_8b_w4a8.safetensors
    │   └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors  # optional
    └── vae/
        └── qwen_image_2.1_vae_bf16.safetensors

Para reproduzir o padrão do template oficial, troque qwen3vl_8b_w4a8.safetensors por qwen3vl_8b_int8_convrot.safetensors. Reinicie o ComfyUI depois de copiar os arquivos; os menus dos loaders normalmente são preenchidos na inicialização.

3. Importe o fluxo oficial de texto para imagem

Abra o template Qwen Image 2.1 text-to-image no painel Templates ou baixe e arraste para a tela o JSON oficial do fluxo T2I. A versão atual agrupa o grafo principal em um subgraph e começa em 1024×1024, 25 passos, CFG 1 e euler + simple.

Confira loaders e controles nesta ordem:

  1. Selecione qwen_image_2.1_int8_convrot.safetensors como modelo de difusão.
  2. Selecione qwen3vl_8b_w4a8.safetensors ou qwen3vl_8b_int8_convrot.safetensors como encoder principal, com tipo qwen_image.
  3. Selecione qwen_image_2.1_vae_bf16.safetensors como VAE.
  4. Deixe refine_prompt em false no primeiro teste. O seletor de PE do template serve apenas para aprimorar o prompt.
  5. Em 8 GB, comece em 768×768. Em 12 GB ou mais, comece em 1024×1024. Prefira dimensões divisíveis por 32.
  6. Mantenha lote 1 e CFG 1. Ainda não adicione LoRA, ControlNet, imagem de referência nem upscale.

Use um primeiro prompt simples para que o resultado seja fácil de reconhecer:

A red ceramic teapot on a wooden table, soft window light, plain background.

Não comece em 2K. Suporte nativo a 2K significa que o modelo pode gerar 2048×2048 diretamente; não significa que toda configuração com 8 ou 12 GB consiga concluir esse tamanho.

4. Coloque uma tarefa na fila, aguarde e confirme o PNG salvo

Clique em Queue Prompt uma vez. A primeira execução pode carregar dezenas de gigabytes e mover componentes entre VRAM, RAM e CPU. Se a prévia ainda não apareceu, observe o terminal ou log de inicialização em vez de enfileirar o mesmo trabalho repetidamente.

Considere o primeiro teste bem-sucedido somente quando os quatro sinais estiverem presentes:

  1. A fila termina sem model not found, missing node type, CUDA out of memory ou encerramento do processo.
  2. SaveImageAdvanced mostra a imagem; o sampler terminar sozinho não prova que o arquivo foi salvo.
  3. Há um PNG em ComfyUI/output/. O template oficial usa o prefixo Qwen_image_2.1 por padrão; se você alterou o nó de salvamento, siga o caminho exibido nele.
  4. O PNG abre normalmente, tem as dimensões esperadas e não está totalmente preto, transparente ou corrompido.

Em uma GPU NVIDIA, acompanhe a memória em outro terminal:

nvidia-smi -l 1

Anote o arquivo de difusão, o encoder, as dimensões e o pico observado. Depois, mude uma variável por vez para que qualquer nova falha tenha uma causa identificável.

5. Resolva pelo sintoma, sem trocar o fluxo inteiro

Um nó fica vermelho ou mostra missing node type

Atualize o núcleo do ComfyUI e as dependências e reinicie. TextEncodeQwenImage21, ResolutionSelector e o switch lógico do fluxo oficial são nós do próprio ComfyUI. Instalar um pacote de terceiros com nome parecido pode piorar a investigação.

O seletor está vazio ou aparece model not found

Confira pasta, extensão e nome exato e reinicie o ComfyUI. Erros comuns: encoder em models/clip/, modelo de difusão em models/checkpoints/ ou arquivo renomeado pelo navegador.

A VRAM acaba antes do sampling

Desligue o aprimoramento, troque o encoder principal de INT8 por W4A8, mantenha lote 1 e feche navegadores, jogos ou editores de vídeo que usam a GPU. Em 8 GB, volte para 768×768; em 12 GB, volte para 1024×1024 e remova ramos opcionais.

O OOM ocorre no VAE decode ou pouco antes de salvar

Reduza largura e altura e enfileire uma única nova tarefa. Diminuir passos afeta principalmente o tempo; reduzir resolução diminui mais diretamente a memória de latent e do decode do VAE.

A fila parece travada enquanto disco ou CPU continuam ativos

Muitas vezes é carregamento ou offloading, não falha definitiva. Espere um estado claro de conclusão ou erro. Cliques repetidos só empilham tarefas grandes. Se a RAM entrar em swap intenso, cancele, reduza a configuração e reinicie o ComfyUI.

A imagem fica lavada, exagerada ou estruturalmente quebrada

Confira se CFG continua em 1. O template oficial informa que o prompt negativo não é usado com CFG 1; copiar um CFG alto de um fluxo SDXL não é um bom começo.

1024 funciona, mas 2K sempre dá OOM

Mantenha 1024 como base funcional. Teste 1280, depois 1536 e só então 2048, uma etapa por vez, com lote 1 e aprimoramento desligado. Capacidade do modelo e memória local são limites diferentes.

O que usuários de 8 e 12 GB devem escolher de fato

Em 8 GB, o objetivo é provar a cadeia, não ligar todos os recursos. Use difusão INT8, encoder W4A8 e VAE; desligue PE; comece em 768×768 e lote 1. Se ainda falhar, confirme que o ComfyUI está atual e que há RAM suficiente antes de migrar para GGUF. Não coloque um quant desconhecido no fluxo padrão supondo que seja intercambiável.

Em 12 GB, use 1024×1024 como primeiro alvo. Comece com W4A8 para preservar margem e teste o encoder INT8 do template oficial depois que a base estiver estável. O aprimoramento é uma segunda etapa: ele carrega outro modelo 9B para reescrever o prompt, então não deve ser introduzido enquanto o grafo básico ainda falha.

Posts da comunidade mostram apenas experiências individuais, não um mínimo comprovado. Uma pessoa disse que rodava o modelo em uma RTX 5060 de notebook com 8 GB enquanto ainda o otimizava; outra, com uma RTX 3060 de 12 GB, sugeriu W4A8 a um usuário de 8 GB. Estes são o primeiro relato e a segunda sugestão, sem testes controlados ou logs completos; use-os como pistas, não garantias.

GGUF é uma rota opcional de pouca memória, não o começo oficial

Os templates da Qwen e da Comfy Org usam .safetensors. GGUF exige um loader de terceiros, um arquivo quantizado específico para Qwen Image 2.1 e um grafo preparado para esse loader. O projeto ComfyUI-GGUF se descreve como work in progress e não certifica todo quant Qwen publicado por terceiros.

Considere a rota comunitária apenas se a combinação oficial INT8/W4A8 ainda falhar por memória:

  1. Atualize o ComfyUI e instale ComfyUI-GGUF pelo Manager ou pelo repositório.
  2. Obtenha um arquivo explicitamente criado para Qwen Image 2.1. Confira autor, licença, hash e loader necessário.
  3. Troque o loader de difusão padrão por Unet Loader (GGUF). Mantenha encoder principal e VAE compatíveis com Qwen Image 2.1.
  4. Selecione o nome exato e teste abaixo de aproximadamente 1 MP, CFG 1 e lote 1.
  5. Se falhar, volte às notas daquele quant. Não misture grafos de Qwen Image 1.x, Flux ou Stable Diffusion genérico no diagnóstico.

Um usuário russo relatou ter executado qwen-image-2.1-UC-Q4_K_M.gguf, mas também disse que precisou de ajuda extra para instalar. Outro fluxo comunitário Q8_0 combina GGUF com encoder e VAE oficiais. Isso mostra que existe uma alternativa, não que qualquer Q4/Q8 seja compatível ou seguro para download.

Adicione aprimoramento, 2K e edição só depois da base funcionar

Quando a imagem básica estiver sendo gerada e salva de forma estável, amplie o grafo nesta ordem:

  1. Aprimoramento de prompt: baixe qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors, selecione-o e ative refine_prompt. Mantenha seed, dimensões e passos iguais na comparação.
  2. Resolução maior: aumente em etapas, sem saltar de 1024 para 2048×2048. Salve em PNG quando precisar de canal alfa.
  3. Edição de imagem: mude para o fluxo oficial Image Edit. O aprimorador dele usa ..._pe_i2i..., não o arquivo T2I.
  4. Saída transparente: use a formulação oficial para RGBA/fundo transparente e salve em PNG. Primeiro valide uma imagem opaca comum para que transparência seja a única variável nova.

Checklist final de aceitação

  • Núcleo, dependências do frontend e templates do ComfyUI estão atualizados; nenhum nó do núcleo permanece vermelho após reiniciar.
  • Modelo de difusão, encoder principal e VAE estão nas pastas certas e aparecem pelo nome exato.
  • Aprimoramento está desligado, lote é 1 e CFG é 1; 8 GB começa em 768 e 12 GB em 1024.
  • Há apenas uma tarefa na fila e o terminal termina sem erro de modelo, nó ou OOM.
  • Existe um PNG válido com as dimensões pedidas em ComfyUI/output/.
  • Antes de adicionar PE, resolução alta, edição ou GGUF, você registrou a combinação funcional, a resolução e o pico observado.

Com os seis itens atendidos, você tem uma base local reproduzível do Qwen Image 2.1. A partir dela, altere um elemento por vez, em vez de trocar tudo por um grafo grande cujo erro seja impossível de isolar.

Quer otimizar seu fluxo de trabalho com LLMs?

Conecte modelos por uma única API, gerencie chaves e controle os gastos com IA.

Começar grátis