Qwen Image 2.1 в ComfyUI: локальная установка с учётом VRAM
Практическая установка Qwen Image 2.1 в ComfyUI: выбор официальных весов для 8–16 ГБ VRAM, сохранение первого PNG, разбор ошибок моделей и OOM, а также границы применения GGUF.
Содержание

Самый надёжный способ запустить Qwen Image 2.1 на обычной видеокарте — не начинать с первого попавшегося GGUF минимального размера. Сначала обновите ComfyUI, загрузите официальный процесс text-to-image, выберите INT8-модель диффузии, совместимый текстовый энкодер Qwen3-VL и VAE, а затем получите и сохраните одну небольшую картинку. На видеокарте с 8 или 12 ГБ не стоит сразу включать BF16, 2K и улучшение промпта.
Ни Qwen, ни Comfy Org не называют единого минимального объёма VRAM для всех компьютеров. Конфигурации для 8 и 12 ГБ ниже — это осторожные стартовые варианты, а не гарантия: на пик памяти влияют системная RAM, выгрузка моделей на CPU, драйвер, разрешение и другие программы, использующие GPU.
Сначала выберите веса: размер файла не равен расходу VRAM
По состоянию на 28 сентября 2026 года в официальном репозитории моделей Comfy Org есть две версии диффузионной модели, три основных текстовых энкодера, один VAE и две отдельные модели для улучшения промпта. Для первой картинки нужны только диффузионная модель, один основной текстовый энкодер и VAE. Файл qwen3.5_9b_..._pe_t2i служит дополнительным улучшателем промпта и не заменяет энкодер qwen3vl_8b_....
| Роль | Файл для первого запуска | Размер загрузки, примерно | Папка |
|---|---|---|---|
| Диффузионная модель | qwen_image_2.1_int8_convrot.safetensors | 7,26 ГБ | ComfyUI/models/diffusion_models/ |
| Основной энкодер, более экономный вариант | qwen3vl_8b_w4a8.safetensors | 6,31 ГБ | ComfyUI/models/text_encoders/ |
| Основной энкодер по умолчанию в официальном шаблоне | qwen3vl_8b_int8_convrot.safetensors | 9,35 ГБ | ComfyUI/models/text_encoders/ |
| VAE | qwen_image_2.1_vae_bf16.safetensors | 0,68 ГБ | ComfyUI/models/vae/ |
| Необязательный улучшатель промпта T2I | qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors | 9,47 ГБ | ComfyUI/models/text_encoders/ |
Это размеры файлов в репозитории, а не объём VRAM во время генерации. Набор INT8 diffusion + W4A8 encoder + VAE занимает около 14,24 ГБ на диске, а комбинация INT8 + INT8 + VAE из официального шаблона — около 17,28 ГБ. Улучшатель промпта добавляет ещё примерно 9,47 ГБ и отдельный тяжёлый этап загрузки модели.
С какой конфигурации начать при разном объёме VRAM
| Доступная VRAM | Что пробовать сначала | Настройки первой генерации | Что менять после успешного запуска |
|---|---|---|---|
| 8 ГБ | INT8 diffusion + W4A8 encoder + VAE; улучшение промпта выключено | 768×768 или примерно до 1 Мп, batch 1, CFG 1 | Затем попробовать 1024; к GGUF переходить только если официальный вариант всё ещё даёт OOM |
| 12 ГБ | INT8 diffusion + W4A8 encoder; INT8 encoder проверить позже | 1024×1024, batch 1, CFG 1 | Включать улучшатель или повышать разрешение по одному изменению за раз |
| 16 ГБ и больше | INT8 diffusion + INT8 encoder + VAE из официального шаблона | 1024×1024, 25 шагов, CFG 1 | Отдельно проверить улучшение промпта и 2K |
| Много VRAM и системной RAM | Сначала подтвердить работу INT8, затем сравнивать BF16 | Сохранить одинаковые prompt, seed и размеры | Использовать BF16 только ради контролируемого сравнения и при приемлемом расходе памяти |
Строки для 8 и 12 ГБ снижают стоимость диагностики, но не являются официальными требованиями. В документации Qwen упоминается выгрузка моделей при ограниченной памяти, а ComfyUI самостоятельно распределяет компоненты между GPU, RAM и CPU. Поэтому два компьютера с одинаковой видеокартой могут вести себя по-разному.
1. Обновите ComfyUI, прежде чем искать сторонние ноды
Qwen Image 2.1 поддерживается в ComfyUI штатно. Для официального процесса не нужен сторонний набор нод. Красные блоки, отсутствие шаблона Qwen Image 2.1 или ноды TextEncodeQwenImage21 обычно означают, что ядро ComfyUI или его зависимости устарели.
- Windows Portable: закройте ComfyUI, запустите
ComfyUI_windows_portable/update/update_comfyui.bat, затем перезапустите программу. Для обычного обновления не начинайте сupdate_comfyui_and_python_dependencies.bat: этот сценарий переустанавливает весь набор зависимостей. - ComfyUI Desktop: откройте Manage → Update и обновите Engine. Stable-канал может отставать от поддержки новых моделей; если нод всё ещё нет, используйте доступный канал
Latest on GitHubлибо перейдите на Portable/ручную установку. - Установка из Git: обновите код и зависимости в том Python-окружении, из которого запускается ComfyUI, затем перезапустите его.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py
В официальной инструкции по обновлению отдельно сказано, что одного git pull может быть недостаточно: без актуальных зависимостей останутся старыми интерфейс, шаблоны и новые ноды.
2. Разложите модели по папкам, которые сканируют загрузчики
Скачайте выбранные файлы из официального репозитория ComfyUI. Не меняйте имена. Суффикс вроде (1), который браузер добавляет при повторной загрузке, может помешать шаблону найти модель.
Для первого запуска с ограниченной памятью структура может выглядеть так. Выберите один основной энкодер — W4A8 или INT8:
ComfyUI/
└── models/
├── diffusion_models/
│ └── qwen_image_2.1_int8_convrot.safetensors
├── text_encoders/
│ ├── qwen3vl_8b_w4a8.safetensors
│ └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors # optional
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors
Чтобы повторить настройки официального шаблона, замените qwen3vl_8b_w4a8.safetensors на qwen3vl_8b_int8_convrot.safetensors. После копирования перезапустите ComfyUI: списки в нодах-загрузчиках обычно формируются при старте.
3. Импортируйте официальный процесс text-to-image
Откройте шаблон Qwen Image 2.1 text-to-image в панели Templates или скачайте и перетащите на canvas официальный T2I workflow JSON. В текущем шаблоне основной граф упакован в subgraph; стартовые значения — 1024×1024, 25 шагов, CFG 1 и связка euler + simple.
Проверьте загрузчики и параметры в таком порядке:
- В качестве diffusion model выберите
qwen_image_2.1_int8_convrot.safetensors. - В качестве основного text encoder выберите
qwen3vl_8b_w4a8.safetensorsилиqwen3vl_8b_int8_convrot.safetensors, тип —qwen_image. - В VAE выберите
qwen_image_2.1_vae_bf16.safetensors. - Для первого запуска оставьте
refine_promptравнымfalse. Селектор PE-модели в шаблоне относится только к улучшению промпта. - Для 8 ГБ начните с 768×768; для 12 ГБ и выше — с 1024×1024. Желательно, чтобы обе стороны делились на 32.
- Оставьте batch size 1 и CFG 1. Пока не добавляйте LoRA, ControlNet, референсные изображения и апскейл.
Первый prompt лучше сделать максимально простым, чтобы результат было легко проверить:
A red ceramic teapot on a wooden table, soft window light, plain background.
Не начинайте с 2K. Нативная поддержка 2K означает, что модель умеет генерировать 2048×2048 напрямую, но не обещает, что такой размер завершится на любой конфигурации с 8 или 12 ГБ.
4. Поставьте одну задачу в очередь, дождитесь конца и проверьте PNG
Нажмите Queue Prompt один раз. При первом запуске ComfyUI может загружать десятки гигабайт и перемещать компоненты между VRAM, системной RAM и CPU. Если превью не появилось сразу, смотрите терминал или log запуска, а не добавляйте одну и ту же задачу снова.
Первый запуск можно считать успешным только при четырёх признаках:
- Очередь завершилась без
model not found,missing node type,CUDA out of memoryи аварийного завершения процесса. - Нода
SaveImageAdvancedпоказывает изображение; завершившийся sampler сам по себе ещё не доказывает, что файл сохранён. - PNG появился в
ComfyUI/output/. В официальном шаблоне по умолчанию используется префиксQwen_image_2.1; если вы меняли ноду сохранения, ориентируйтесь на путь в ней. - Файл открывается, имеет ожидаемый размер и не является полностью чёрным, прозрачным или повреждённым.
На NVIDIA можно следить за памятью во втором терминале:
nvidia-smi -l 1
Запишите название diffusion-файла, текстового энкодера, размеры и замеченный пик памяти. Дальше меняйте по одному параметру: так будет понятно, какое именно изменение вызвало новую ошибку.
5. Исправляйте проблему по симптому, а не заменяйте всё сразу
Нода красная или показывает missing node type
Обновите ядро ComfyUI и зависимости, затем перезапустите программу. TextEncodeQwenImage21, ResolutionSelector и логический switch в официальном процессе относятся к ядру ComfyUI. Случайный сторонний пакет с похожим названием лишь усложнит диагностику.
Список моделей пуст или появляется model not found
Проверьте папку, расширение и точное имя файла, затем перезапустите ComfyUI. Частые ошибки: энкодер помещён в models/clip/, diffusion-модель — в models/checkpoints/, либо браузер переименовал повторную загрузку.
VRAM заканчивается до начала сэмплирования
Выключите улучшение промпта, замените основной INT8-энкодер на W4A8, оставьте batch 1 и закройте браузеры, игры и видеоредакторы, использующие GPU. На 8 ГБ вернитесь к 768×768; на 12 ГБ — к 1024×1024 без дополнительных веток.
OOM возникает при VAE decode или перед сохранением
Уменьшите ширину и высоту, затем поставьте одну новую задачу. Снижение числа шагов в первую очередь влияет на время; уменьшение разрешения заметнее снижает память latent и VAE decode.
Очередь будто зависла, но диск или CPU продолжают работать
Часто это загрузка или offload моделей, а не окончательный сбой. Дождитесь явного завершения либо сообщения об ошибке. Повторные клики только добавляют тяжёлые задачи. Если RAM уходит в swap и система почти перестаёт отвечать, отмените задачу, уменьшите конфигурацию и перезапустите ComfyUI.
Картинка бледная, пережжённая или разваливается по структуре
Убедитесь, что CFG всё ещё равен 1. В официальном шаблоне отмечено, что при CFG 1 negative prompt не используется. Переносить высокие CFG из привычного SDXL-процесса сюда не стоит.
1024 работает, а 2K всегда даёт OOM
Оставьте 1024 рабочей базой. Затем попробуйте 1280, 1536 и только после этого 2048 — по одной ступени, с batch 1 и выключенным улучшением промпта. Возможность модели и возможности памяти конкретного компьютера — разные ограничения.
Что выбирать владельцам 8 и 12 ГБ
На 8 ГБ цель первого запуска — подтвердить всю цепочку, а не включить каждый элемент шаблона. Возьмите INT8 diffusion, W4A8 main encoder и VAE, выключите PE, начните с 768×768 и batch 1. Если это не сработало, сначала проверьте актуальность ComfyUI и запас системной RAM, а уже затем переходите к GGUF. Не вставляйте неизвестный quant-файл в штатный граф в расчёте на полную взаимозаменяемость.
На 12 ГБ первой целью должно быть 1024×1024. Начните с W4A8, чтобы оставить запас, и только после стабильной картинки попробуйте INT8-энкодер из официального шаблона. Улучшение промпта — второй этап: оно загружает отдельную модель 9B для переписывания prompt, поэтому не добавляйте его, пока базовый граф падает.
Посты сообщества подтверждают лишь отдельные попытки, но не минимальные требования. Один пользователь написал, что запускает модель на ноутбучной RTX 5060 с 8 ГБ и ещё оптимизирует настройки; другой пользователь с RTX 3060 12 ГБ посоветовал владельцу 8 ГБ W4A8. Это первое сообщение и второй совет без одинаковых тестовых условий и полных логов, поэтому воспринимать их стоит как подсказки, а не гарантии.
GGUF — запасной путь для экономии памяти, а не официальный старт
Официальные шаблоны Qwen и Comfy Org используют .safetensors. Для GGUF нужен сторонний загрузчик, quant-файл именно для Qwen Image 2.1 и граф, собранный под этот загрузчик. Проект ComfyUI-GGUF прямо называет своё состояние work in progress и не подтверждает совместимость всех сторонних квантов Qwen.
Переходить к сообществу разумно только тогда, когда официальный вариант INT8/W4A8 всё ещё упирается в память:
- Обновите ComfyUI и установите
ComfyUI-GGUFчерез Manager либо из репозитория. - Найдите файл, явно созданный для Qwen Image 2.1. Проверьте автора, лицензию, hash и требуемый loader.
- Замените штатный diffusion loader на
Unet Loader (GGUF). Оставьте совместимые основной текстовый энкодер Qwen Image 2.1 и VAE. - Выберите точное имя файла и проверьте размер примерно до 1 Мп, CFG 1, batch 1.
- При ошибке вернитесь к инструкции именно этого quant. Не смешивайте в одной диагностике графы Qwen Image 1.x, Flux или обычного Stable Diffusion.
Один русскоязычный пользователь сообщил, что запустил qwen-image-2.1-UC-Q4_K_M.gguf в ComfyUI, но для установки ему понадобилась дополнительная помощь. Отдельный процесс сообщества с Q8_0 объединяет GGUF с официальными энкодером и VAE. Это показывает, что альтернативный путь существует, но не доказывает совместимость или безопасность произвольных файлов Q4/Q8.
Добавляйте улучшение промпта, 2K и редактирование после базового запуска
Когда базовая картинка стабильно сохраняется, расширяйте процесс в таком порядке:
- Улучшение промпта: скачайте
qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors, выберите его и включитеrefine_prompt. Для сравнения оставьте прежними seed, размеры и число шагов. - Большее разрешение: повышайте размеры ступенями, а не переходите сразу с 1024 на 2048×2048. Если нужен alpha channel, сохраняйте PNG.
- Редактирование изображения: используйте официальный Image Edit workflow. В нём для PE нужен файл
..._pe_i2i..., а не T2I. - Прозрачный фон: используйте официальную формулировку prompt для RGBA/transparent background и PNG. Сначала получите обычную непрозрачную картинку, чтобы прозрачность была единственной новой переменной.
Итоговая проверка
- Ядро ComfyUI, frontend-зависимости и шаблоны обновлены; после перезапуска нет красных core-нод.
- Diffusion model, основной text encoder и VAE лежат в правильных папках и видны под точными именами.
- Улучшение промпта выключено, batch равен 1, CFG равен 1; 8 ГБ начинают с 768, 12 ГБ — с 1024.
- В очереди только одна задача, а терминал завершает её без ошибок модели, ноды или OOM.
- Корректный PNG нужного размера появился в
ComfyUI/output/. - До включения PE, повышенного разрешения, редактирования или GGUF записаны рабочая комбинация весов, разрешение и наблюдавшийся пик памяти.
Если выполнены все шесть пунктов, у вас есть воспроизводимая локальная база Qwen Image 2.1. Любую дальнейшую оптимизацию делайте одним изменением относительно этой базы, а не заменяйте её большим графом, где источник сбоя невозможно определить.