Invita y gana

Cómo funcionan las recompensas

Comparte tu enlace. Cuando un amigo se registre con él y recargue saldo, recibirás la recompensa indicada por sus recargas posteriores.

Qwen Image 2.1 en ComfyUI: instalación local según tu VRAM

Guía completa para elegir los pesos oficiales de Qwen Image 2.1 según la VRAM, guardar el primer PNG en ComfyUI, diagnosticar OOM y modelos ausentes, y decidir cuándo probar GGUF.

Índice
Qwen Image 2.1 en ComfyUI: instalación local según tu VRAM

La forma más fiable de ejecutar Qwen Image 2.1 en una GPU de consumo no es empezar por el GGUF más pequeño que encuentres. Primero actualiza ComfyUI, carga el flujo oficial de texto a imagen, combina el modelo de difusión INT8 con un codificador de texto Qwen3-VL compatible y el VAE, y genera una imagen pequeña que quede guardada correctamente. Con 8 o 12 GB de VRAM, no empieces con BF16, salida 2K ni mejora automática del prompt.

Ni Qwen ni Comfy Org publican una cifra mínima de VRAM válida para todos los equipos. Las configuraciones de 8 y 12 GB que aparecen aquí son puntos de partida conservadores, no garantías: la RAM del sistema, el offloading, los controladores, la resolución y otros procesos de GPU cambian el pico real de memoria.

Elige primero los pesos: el tamaño del archivo no es el uso de VRAM

A fecha de 28 de septiembre de 2026, el repositorio oficial de modelos de Comfy Org contiene dos pesos de difusión, tres codificadores de texto principales, un VAE y dos modelos separados para mejorar prompts. Para obtener la primera imagen solo necesitas el modelo de difusión, un codificador principal y el VAE. El archivo qwen3.5_9b_..._pe_t2i es un mejorador opcional; no sustituye al codificador qwen3vl_8b_....

FunciónArchivo recomendado para empezarTamaño aprox. de descargaCarpeta
Modelo de difusiónqwen_image_2.1_int8_convrot.safetensors7,26 GBComfyUI/models/diffusion_models/
Codificador principal, opción de menor memoriaqwen3vl_8b_w4a8.safetensors6,31 GBComfyUI/models/text_encoders/
Codificador principal, predeterminado de la plantilla oficialqwen3vl_8b_int8_convrot.safetensors9,35 GBComfyUI/models/text_encoders/
VAEqwen_image_2.1_vae_bf16.safetensors0,68 GBComfyUI/models/vae/
Mejorador T2I opcionalqwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors9,47 GBComfyUI/models/text_encoders/

Estas cifras son tamaños de archivo, no consumo de VRAM durante la ejecución. Difusión INT8 + codificador W4A8 + VAE suman unos 14,24 GB de descarga; la combinación INT8 + INT8 + VAE de la plantilla oficial ronda 17,28 GB. Activar el mejorador añade unos 9,47 GB de almacenamiento y otra fase pesada de carga.

Configuración inicial práctica para cada nivel de VRAM

VRAM disponiblePrueba primeroAjustes de la primera generaciónAmplía solo cuando funcione
8 GBDifusión INT8 + codificador W4A8 + VAE; mejora del prompt desactivada768×768 o aproximadamente hasta 1 MP, lote 1, CFG 1Prueba 1024 después; usa GGUF comunitario solo si la ruta oficial sigue dando OOM
12 GBDifusión INT8 + codificador W4A8; prueba el codificador INT8 más adelante1024×1024, lote 1, CFG 1Activa el mejorador o sube la resolución cambiando una sola cosa cada vez
16 GB o másDifusión INT8 + codificador INT8 + VAE de la plantilla oficial1024×1024, 25 pasos, CFG 1Prueba por separado la mejora del prompt y 2K
Mucha VRAM y RAMConfirma primero la ruta INT8 y después compara componentes BF16Mantén iguales prompt, semilla y dimensionesUsa BF16 solo para una comparación controlada y aceptando su mayor consumo

Las filas de 8 y 12 GB buscan reducir el coste de diagnóstico; no son requisitos oficiales. Qwen documenta el offloading para equipos con memoria limitada, y ComfyUI decide qué componentes mantiene en GPU en cada máquina. Por eso dos ordenadores con la misma tarjeta pueden comportarse de forma distinta.

1. Actualiza ComfyUI antes de buscar nodos personalizados

Qwen Image 2.1 tiene soporte nativo en ComfyUI. El flujo oficial no debería necesitar paquetes de nodos de terceros. Nodos rojos, ausencia de la plantilla Qwen Image 2.1 o falta de TextEncodeQwenImage21 suelen indicar que el núcleo o las dependencias incluidas están desactualizados.

  • Windows Portable: cierra ComfyUI, ejecuta ComfyUI_windows_portable/update/update_comfyui.bat y vuelve a iniciar. No uses update_comfyui_and_python_dependencies.bat como primera opción rutinaria, porque reinstala la pila de dependencias.
  • ComfyUI Desktop: actualiza el Engine desde Manage → Update. El canal Stable puede tardar en incorporar modelos recientes; si aún faltan nodos, usa el canal disponible Latest on GitHub o cambia a Portable/instalación manual.
  • Instalación manual con Git: actualiza código y dependencias dentro del entorno de Python que realmente ejecuta ComfyUI y reinicia.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py

La guía oficial de actualización advierte que un simple git pull puede dejar desactualizados el frontend, las plantillas y los nodos nuevos. Instalar las dependencias de requirements.txt forma parte de la actualización.

2. Coloca cada modelo en la carpeta que lee su cargador

Descarga los archivos elegidos desde el repositorio oficial de ComfyUI. Conserva los nombres exactos: un sufijo como (1) añadido por el navegador puede impedir que la plantilla encuentre el modelo.

Para una primera ejecución con poca memoria, la estructura puede ser esta. Elige W4A8 o INT8 como codificador principal:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── qwen_image_2.1_int8_convrot.safetensors
    ├── text_encoders/
    │   ├── qwen3vl_8b_w4a8.safetensors
    │   └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors  # optional
    └── vae/
        └── qwen_image_2.1_vae_bf16.safetensors

Para reproducir el valor predeterminado de la plantilla oficial, sustituye qwen3vl_8b_w4a8.safetensors por qwen3vl_8b_int8_convrot.safetensors. Reinicia ComfyUI después de copiar los archivos; los menús de los cargadores suelen construirse durante el arranque.

3. Importa el flujo oficial de texto a imagen

Abre la plantilla de Qwen Image 2.1 text-to-image desde el panel Templates, o descarga y arrastra al lienzo el JSON oficial del flujo T2I. La versión actual encapsula el grafo principal como subgrafo y parte de 1024×1024, 25 pasos, CFG 1 y euler + simple.

Comprueba los cargadores y controles en este orden:

  1. Selecciona qwen_image_2.1_int8_convrot.safetensors como modelo de difusión.
  2. Selecciona qwen3vl_8b_w4a8.safetensors o qwen3vl_8b_int8_convrot.safetensors como codificador principal, con tipo qwen_image.
  3. Selecciona qwen_image_2.1_vae_bf16.safetensors como VAE.
  4. Mantén refine_prompt en false durante la primera prueba. El selector de PE de la plantilla solo corresponde a la mejora del prompt.
  5. Con 8 GB empieza en 768×768. Con 12 GB o más empieza en 1024×1024. Es preferible que ambas dimensiones sean divisibles por 32.
  6. Mantén lote 1 y CFG 1. Todavía no añadas LoRA, ControlNet, imágenes de referencia ni escalado.

Usa un prompt deliberadamente sencillo para que el resultado sea fácil de validar:

A red ceramic teapot on a wooden table, soft window light, plain background.

No empieces en 2K. El soporte nativo de 2K significa que el modelo puede generar 2048×2048 directamente, no que cualquier equipo con 8 o 12 GB vaya a completar esa resolución.

4. Encola un solo trabajo, espera y confirma que se guardó el PNG

Pulsa Queue Prompt una vez. En la primera ejecución se pueden cargar decenas de gigabytes y mover componentes entre VRAM, RAM y CPU. Si aún no aparece una vista previa, mira la terminal o el registro de arranque en lugar de volver a añadir el mismo trabajo.

Considera que la primera ejecución ha funcionado solo cuando veas estas cuatro señales:

  1. La cola termina sin model not found, missing node type, CUDA out of memory ni cierre del proceso.
  2. SaveImageAdvanced muestra la imagen; que termine el sampler no basta para demostrar que se guardó.
  3. Existe un PNG dentro de ComfyUI/output/. La plantilla oficial usa por defecto el prefijo Qwen_image_2.1; si cambiaste el nodo de guardado, utiliza la ruta que muestre ese nodo.
  4. El PNG se abre, tiene las dimensiones esperadas y no está completamente negro, transparente ni corrupto.

En una GPU NVIDIA puedes observar la memoria desde otra terminal:

nvidia-smi -l 1

Anota el archivo de difusión, el codificador, las dimensiones y el pico observado. Después cambia una sola variable cada vez para que una nueva avería tenga una causa identificable.

5. Soluciona por síntoma en vez de sustituir todo el flujo

Un nodo está rojo o muestra missing node type

Actualiza el núcleo de ComfyUI y sus dependencias y reinicia. TextEncodeQwenImage21, ResolutionSelector y el conmutador lógico del flujo oficial son nodos del núcleo. Instalar un paquete de terceros con un nombre parecido puede complicar el diagnóstico.

El selector está vacío o aparece model not found

Comprueba carpeta, extensión y nombre exacto; después reinicia ComfyUI. Errores habituales: colocar el codificador en models/clip/, el modelo de difusión en models/checkpoints/ o dejar que el navegador renombre una descarga repetida.

La VRAM se agota antes de empezar el muestreo

Desactiva la mejora del prompt, cambia el codificador principal de INT8 a W4A8, conserva lote 1 y cierra navegadores, juegos o herramientas de vídeo que usen GPU. Baja una tarjeta de 8 GB a 768×768; devuelve una de 12 GB a 1024×1024 y elimina ramas opcionales.

El OOM ocurre durante la decodificación VAE o justo antes de guardar

Reduce anchura y altura y encola un único trabajo nuevo. Bajar los pasos afecta sobre todo al tiempo; reducir la resolución disminuye de forma más directa la memoria del latente y del VAE.

La cola parece congelada mientras el disco o la CPU siguen activos

A menudo es carga u offloading de modelos, no un fallo definitivo. Espera a un estado claro de finalización o error. Hacer clic repetidamente solo apila trabajos pesados. Si la RAM sube hasta provocar intercambio intenso, cancela, reduce la configuración y reinicia ComfyUI.

La imagen sale lavada, quemada o con estructura rota

Comprueba que CFG siga en 1. La plantilla oficial indica que el prompt negativo no se usa con CFG 1; copiar un valor alto típico de SDXL no es un buen punto de partida.

1024 funciona, pero 2K siempre produce OOM

Mantén 1024 como base operativa. Prueba 1280, después 1536 y finalmente 2048, un nivel cada vez, con lote 1 y mejora del prompt desactivada. La capacidad del modelo y la memoria local son límites distintos.

Qué deberían elegir realmente los usuarios de 8 y 12 GB

Con 8 GB, el objetivo es demostrar la cadena completa, no activar todas las funciones. Usa difusión INT8, codificador W4A8 y VAE; desactiva PE; empieza en 768×768 y lote 1. Si aún falla, confirma que ComfyUI está actualizado y que hay suficiente RAM antes de pasar a GGUF. No introduzcas un archivo cuantizado desconocido en el flujo estándar suponiendo que sea intercambiable.

Con 12 GB, fija 1024×1024 como primer objetivo. Empieza con W4A8 para conservar margen y prueba el codificador INT8 de la plantilla oficial cuando la base ya sea estable. La mejora del prompt es una segunda etapa: carga otro modelo de 9B para reescribir el prompt y no conviene añadirlo mientras el grafo básico sigue fallando.

Las publicaciones de la comunidad solo reflejan casos individuales, no un mínimo demostrado. Un usuario dijo que ejecutaba el modelo en una RTX 5060 portátil de 8 GB mientras aún lo optimizaba; otro usuario con una RTX 3060 de 12 GB recomendó W4A8 a alguien con 8 GB. Son el primer informe y la segunda sugerencia, sin pruebas controladas ni registros completos; sirven como pistas, no como garantías.

GGUF es una ruta opcional de menor memoria, no el inicio oficial

Las plantillas de Qwen y Comfy Org utilizan .safetensors. GGUF requiere un cargador de terceros, un archivo cuantizado específico para Qwen Image 2.1 y un grafo preparado para ese cargador. El proyecto ComfyUI-GGUF se define como work in progress y no certifica cada cuantización de Qwen publicada por terceros.

Considera la ruta comunitaria solo cuando la combinación oficial INT8/W4A8 siga fallando por memoria:

  1. Actualiza ComfyUI e instala ComfyUI-GGUF desde Manager o desde su repositorio.
  2. Consigue un archivo creado explícitamente para Qwen Image 2.1. Comprueba autor, licencia, hash y cargador requerido.
  3. Sustituye el cargador de difusión estándar por Unet Loader (GGUF). Mantén un codificador principal y un VAE compatibles con Qwen Image 2.1.
  4. Selecciona el nombre exacto y prueba por debajo de aproximadamente 1 MP, CFG 1 y lote 1.
  5. Si falla, vuelve a las notas del propio cuantizado. No mezcles grafos de Qwen Image 1.x, Flux o Stable Diffusion genérico durante el diagnóstico.

Un usuario ruso indicó que consiguió ejecutar qwen-image-2.1-UC-Q4_K_M.gguf, aunque también necesitó ayuda adicional para instalarlo. Otro flujo comunitario Q8_0 combina GGUF con el codificador y el VAE oficiales. Esto demuestra que existe una ruta alternativa, no que cualquier Q4/Q8 sea compatible o una descarga segura.

Añade mejora del prompt, 2K y edición solo después de estabilizar la base

Cuando la imagen básica se genere y guarde de forma estable, amplía el grafo en este orden:

  1. Mejora del prompt: descarga qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors, selecciónalo y activa refine_prompt. Mantén semilla, dimensiones y pasos al comparar.
  2. Más resolución: sube por niveles en lugar de saltar de 1024 a 2048×2048. Guarda como PNG si necesitas canal alfa.
  3. Edición de imagen: cambia al flujo oficial Image Edit. Su mejorador usa el archivo ..._pe_i2i..., no el T2I.
  4. Salida transparente: usa la formulación oficial para RGBA/fondo transparente y guarda PNG. Primero confirma una imagen opaca normal para que la transparencia sea la única variable nueva.

Lista final de aceptación

  • El núcleo, las dependencias del frontend y las plantillas de ComfyUI están actualizados; no quedan nodos del núcleo en rojo tras reiniciar.
  • El modelo de difusión, el codificador principal y el VAE están en las carpetas correctas y aparecen con su nombre exacto.
  • La mejora del prompt está desactivada, lote es 1 y CFG es 1; 8 GB empieza en 768 y 12 GB en 1024.
  • Solo hay una tarea en cola y la terminal termina sin errores de modelo, nodo u OOM.
  • Existe un PNG válido con las dimensiones solicitadas dentro de ComfyUI/output/.
  • Antes de añadir PE, resolución alta, edición o GGUF, has anotado la combinación que funciona, la resolución y el pico observado.

Cuando se cumplen los seis puntos, ya tienes una base local reproducible de Qwen Image 2.1. A partir de ahí cambia un solo elemento cada vez, en lugar de sustituirla por un grafo grande cuyo fallo sea imposible de aislar.

¿Quieres optimizar tu flujo de trabajo con LLM?

Conecta modelos mediante una API, gestiona claves y controla el gasto en IA.

Empezar gratis