Qwen Image 2.1 in ComfyUI: lokale Einrichtung nach VRAM
Eine vollständige Anleitung zur Auswahl offizieller Qwen-Image-2.1-Gewichte nach VRAM, zum Speichern der ersten PNG in ComfyUI, zur OOM-Fehlersuche und zur Einordnung von GGUF.
Inhalt

Der zuverlässigste Weg, Qwen Image 2.1 auf einer normalen Consumer-GPU zu starten, beginnt nicht mit der kleinsten auffindbaren GGUF-Datei. Aktualisieren Sie zuerst ComfyUI, laden Sie den offiziellen Text-to-Image-Workflow, kombinieren Sie das INT8-Diffusionsmodell mit einem passenden Qwen3-VL-Textencoder und dem VAE und erzeugen Sie anschließend ein kleines Bild, das tatsächlich gespeichert wird. Mit 8 oder 12 GB VRAM sollten BF16, 2K-Ausgabe und Prompt-Enhancement zunächst ausgeschaltet bleiben.
Weder Qwen noch Comfy Org nennen eine Mindest-VRAM-Zahl, die für jeden Rechner gilt. Die folgenden 8-GB- und 12-GB-Konfigurationen sind vorsichtige Startpunkte, keine Garantien: Arbeitsspeicher, Offloading, Treiber, Auflösung und andere GPU-Prozesse verändern den tatsächlichen Spitzenbedarf.
Zuerst die Gewichte wählen: Dateigröße ist nicht VRAM-Verbrauch
Mit Stand vom 28. September 2026 enthält das offizielle Comfy-Org-Modellrepository zwei Diffusionsgewichte, drei Haupt-Textencoder, ein VAE und zwei separate Prompt-Enhancer. Für das erste Bild benötigen Sie nur das Diffusionsmodell, einen Hauptencoder und das VAE. Die Datei qwen3.5_9b_..._pe_t2i ist ein optionaler Prompt-Enhancer und ersetzt nicht den Encoder qwen3vl_8b_....
| Rolle | Empfohlene Datei für den ersten Lauf | Downloadgröße ca. | Ordner |
|---|---|---|---|
| Diffusionsmodell | qwen_image_2.1_int8_convrot.safetensors | 7,26 GB | ComfyUI/models/diffusion_models/ |
| Haupt-Textencoder, speichersparender | qwen3vl_8b_w4a8.safetensors | 6,31 GB | ComfyUI/models/text_encoders/ |
| Haupt-Textencoder, Standard im offiziellen Template | qwen3vl_8b_int8_convrot.safetensors | 9,35 GB | ComfyUI/models/text_encoders/ |
| VAE | qwen_image_2.1_vae_bf16.safetensors | 0,68 GB | ComfyUI/models/vae/ |
| Optionaler T2I-Prompt-Enhancer | qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors | 9,47 GB | ComfyUI/models/text_encoders/ |
Diese Zahlen beschreiben Repository-Dateien, nicht den VRAM während der Ausführung. INT8-Diffusion + W4A8-Encoder + VAE ergeben etwa 14,24 GB Download; die Kombination INT8 + INT8 + VAE aus dem offiziellen Template liegt bei rund 17,28 GB. Der Prompt-Enhancer fügt etwa 9,47 GB Speicherplatz und eine weitere große Modell-Ladephase hinzu.
Praktische Startkonfigurationen für verschiedene VRAM-Stufen
| Verfügbarer VRAM | Zuerst testen | Einstellungen für das erste Bild | Erst nach Erfolg erweitern |
|---|---|---|---|
| 8 GB | INT8-Diffusion + W4A8-Hauptencoder + VAE; Prompt-Enhancement aus | 768×768 oder ungefähr bis 1 MP, Batch 1, CFG 1 | Danach 1024 testen; Community-GGUF nur erwägen, wenn der offizielle Weg weiter OOM erzeugt |
| 12 GB | INT8-Diffusion + W4A8-Hauptencoder; INT8-Encoder später testen | 1024×1024, Batch 1, CFG 1 | Enhancer aktivieren oder Auflösung erhöhen, jeweils nur eine Änderung |
| 16 GB und mehr | INT8-Diffusion + INT8-Encoder + VAE des offiziellen Templates | 1024×1024, 25 Schritte, CFG 1 | Prompt-Enhancement und 2K getrennt testen |
| Viel VRAM und RAM | Zuerst INT8 bestätigen, danach BF16-Komponenten vergleichen | Prompt, Seed und Abmessungen konstant halten | BF16 nur für einen kontrollierten Vergleich und bei akzeptablem Mehrverbrauch |
Die Zeilen für 8 und 12 GB minimieren den Aufwand bei der Fehlersuche; sie sind keine offiziellen Hardwareanforderungen. Qwen beschreibt Model-Offloading für knappen Speicher, während ComfyUI je nach Rechner entscheidet, welche Komponenten auf der GPU bleiben. Zwei Systeme mit derselben Grafikkarte können deshalb unterschiedlich reagieren.
1. ComfyUI aktualisieren, bevor Sie nach Custom Nodes suchen
Qwen Image 2.1 wird nativ von ComfyUI unterstützt. Der offizielle Workflow sollte keine Drittanbieter-Node-Pakete benötigen. Rote Nodes, ein fehlendes Qwen-Image-2.1-Template oder ein fehlender TextEncodeQwenImage21-Node bedeuten meist, dass Core oder mitgelieferte Abhängigkeiten veraltet sind.
- Windows Portable: Schließen Sie ComfyUI, führen Sie
ComfyUI_windows_portable/update/update_comfyui.bataus und starten Sie neu. Verwenden Sieupdate_comfyui_and_python_dependencies.batnicht als routinemäßige erste Wahl, weil es den gesamten Dependency-Stack neu installiert. - ComfyUI Desktop: Aktualisieren Sie die Engine unter Manage → Update. Der Stable-Kanal kann bei ganz neuen Modellen hinterherhinken; fehlen die Nodes weiterhin, verwenden Sie den verfügbaren Kanal
Latest on GitHuboder wechseln Sie zu Portable/manueller Installation. - Manuelle Git-Installation: Aktualisieren Sie Code und Abhängigkeiten in genau der Python-Umgebung, die ComfyUI ausführt, und starten Sie danach neu.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py
Der offizielle Update-Leitfaden weist darauf hin, dass git pull allein Frontend, Workflow-Templates und neue Nodes veraltet lassen kann. Die Abhängigkeiten aus requirements.txt gehören zum Update.
2. Jedes Modell in den Ordner seines Loaders legen
Laden Sie die gewählten Dateien aus dem offiziellen ComfyUI-Repository herunter. Behalten Sie die Dateinamen unverändert; ein vom Browser angehängtes (1) kann verhindern, dass das Template die genannte Datei findet.
Für einen speichersparenden ersten Lauf kann die Struktur so aussehen. Wählen Sie W4A8 oder INT8 als Hauptencoder:
ComfyUI/
└── models/
├── diffusion_models/
│ └── qwen_image_2.1_int8_convrot.safetensors
├── text_encoders/
│ ├── qwen3vl_8b_w4a8.safetensors
│ └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors # optional
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors
Für den Standard des offiziellen Templates ersetzen Sie qwen3vl_8b_w4a8.safetensors durch qwen3vl_8b_int8_convrot.safetensors. Starten Sie ComfyUI nach dem Kopieren neu; die Dropdowns der Loader werden normalerweise beim Start befüllt.
3. Den offiziellen Text-to-Image-Workflow importieren
Öffnen Sie das Qwen-Image-2.1-Text-to-Image-Template im Templates-Bereich oder laden Sie das offizielle T2I-Workflow-JSON herunter und ziehen Sie es auf die Arbeitsfläche. Das aktuelle Template kapselt den Hauptgraphen als Subgraph und startet mit 1024×1024, 25 Schritten, CFG 1 sowie euler + simple.
Prüfen Sie Loader und Einstellungen in dieser Reihenfolge:
- Wählen Sie
qwen_image_2.1_int8_convrot.safetensorsals Diffusionsmodell. - Wählen Sie
qwen3vl_8b_w4a8.safetensorsoderqwen3vl_8b_int8_convrot.safetensorsals Haupt-Textencoder mit dem Typqwen_image. - Wählen Sie
qwen_image_2.1_vae_bf16.safetensorsals VAE. - Lassen Sie
refine_promptbeim ersten Lauf auffalse. Der PE-Modellselektor ist nur für das Prompt-Enhancement gedacht. - Beginnen Sie mit 8 GB bei 768×768, mit 12 GB oder mehr bei 1024×1024. Beide Seiten sollten möglichst durch 32 teilbar sein.
- Behalten Sie Batch 1 und CFG 1. Fügen Sie noch kein LoRA, ControlNet, Referenzbild oder Upscaling hinzu.
Verwenden Sie bewusst einen einfachen ersten Prompt, damit ein gültiges Ergebnis leicht zu erkennen ist:
A red ceramic teapot on a wooden table, soft window light, plain background.
Starten Sie nicht mit 2K. Native 2K-Unterstützung bedeutet, dass das Modell direkt 2048×2048 erzeugen kann; sie garantiert nicht, dass jede 8- oder 12-GB-Konfiguration diesen Lauf beendet.
4. Einen Job einreihen, warten und die gespeicherte PNG prüfen
Klicken Sie einmal auf Queue Prompt. Beim ersten Lauf können viele Gigabyte geladen und Komponenten zwischen VRAM, RAM und CPU verschoben werden. Wenn noch keine Vorschau erscheint, beobachten Sie Terminal oder Start-Log, statt denselben Job mehrfach einzureihen.
Werten Sie den ersten Lauf erst dann als erfolgreich, wenn alle vier Signale vorhanden sind:
- Die Queue endet ohne
model not found,missing node type,CUDA out of memoryoder abgestürzten Prozess. SaveImageAdvancedzeigt das Bild; ein beendeter Sampler allein beweist nicht, dass die Datei gespeichert wurde.- Unter
ComfyUI/output/liegt eine PNG. Das offizielle Template verwendet standardmäßig das PräfixQwen_image_2.1; wenn Sie den Save-Node geändert haben, gilt der dort angezeigte Pfad. - Die PNG lässt sich öffnen, hat die erwarteten Abmessungen und ist weder vollständig schwarz noch vollständig transparent oder beschädigt.
Auf einem NVIDIA-System können Sie den Speicher in einem zweiten Terminal beobachten:
nvidia-smi -l 1
Notieren Sie Diffusionsdatei, Encoder, Abmessungen und beobachteten Peak. Ändern Sie später jeweils nur eine Variable, damit eine neue Störung einer Ursache zugeordnet werden kann.
5. Nach Symptom beheben, statt alles auszutauschen
Ein Node ist rot oder meldet missing node type
Aktualisieren Sie ComfyUI Core und die Abhängigkeiten und starten Sie neu. TextEncodeQwenImage21, ResolutionSelector und der Logik-Switch im offiziellen Workflow sind Core-Nodes. Ein fremdes Paket mit ähnlichem Namen kann die Fehlersuche erschweren.
Das Model-Dropdown ist leer oder meldet model not found
Prüfen Sie Ordner, Endung und exakten Dateinamen und starten Sie ComfyUI neu. Typische Fehler sind der Hauptencoder in models/clip/, das Diffusionsmodell in models/checkpoints/ oder eine durch den Browser umbenannte Datei.
Der VRAM reicht schon vor dem Sampling nicht
Schalten Sie Prompt-Enhancement aus, wechseln Sie beim Hauptencoder von INT8 zu W4A8, lassen Sie Batch 1 und schließen Sie GPU-intensive Browser, Spiele oder Videotools. Setzen Sie eine 8-GB-Karte auf 768×768 zurück; bei 12 GB auf 1024×1024 ohne optionale Zweige.
OOM tritt beim VAE-Decode oder kurz vor dem Speichern auf
Verringern Sie Breite und Höhe und reihen Sie einen neuen Einzeljob ein. Weniger Schritte beeinflussen vor allem die Laufzeit; niedrigere Auflösung reduziert direkter den Speicher für Latent und VAE-Decode.
Die Queue wirkt eingefroren, während Datenträger oder CPU arbeiten
Oft werden Modelle geladen oder ausgelagert, ohne dass ein endgültiger Fehler vorliegt. Warten Sie auf einen klaren Abschluss- oder Fehlerzustand. Wiederholte Klicks stapeln nur weitere große Jobs. Wenn der RAM in starkes Swapping läuft, brechen Sie ab, reduzieren die Konfiguration und starten ComfyUI neu.
Das Bild wirkt ausgewaschen, überschärft oder strukturell kaputt
Prüfen Sie, ob CFG weiterhin 1 ist. Das offizielle Template weist darauf hin, dass der negative Prompt bei CFG 1 nicht verwendet wird. Ein hoher CFG-Wert aus einem SDXL-Workflow ist hier kein guter Startpunkt.
1024 funktioniert, aber 2K führt immer zu OOM
Behalten Sie 1024 als funktionierende Basis. Testen Sie 1280, dann 1536 und erst danach 2048, jeweils eine Stufe, mit Batch 1 und ausgeschaltetem Prompt-Enhancement. Modellfähigkeit und lokaler Speicher sind zwei verschiedene Grenzen.
Was Nutzer mit 8 und 12 GB tatsächlich wählen sollten
Mit 8 GB geht es zunächst darum, die komplette Kette zu bestätigen, nicht jede Template-Funktion zu aktivieren. Verwenden Sie INT8-Diffusion, W4A8-Hauptencoder und VAE, schalten Sie PE aus und beginnen Sie bei 768×768 mit Batch 1. Falls das weiter scheitert, prüfen Sie zuerst den ComfyUI-Stand und ausreichenden RAM, bevor Sie zu GGUF wechseln. Setzen Sie keine unbekannte Quantisierung in den Standard-Workflow und nehmen Sie Austauschbarkeit an.
Mit 12 GB sollte 1024×1024 das erste Ziel sein. Starten Sie mit W4A8 für zusätzlichen Spielraum und testen Sie den INT8-Encoder aus dem offiziellen Template erst nach einem stabilen Basislauf. Prompt-Enhancement ist eine zweite Stufe: Es lädt ein weiteres 9B-Modell zum Umschreiben des Prompts und gehört nicht in einen Graphen, der noch grundsätzlich scheitert.
Community-Beiträge zeigen nur einzelne Versuche und definieren kein Minimum. Ein Nutzer schrieb, dass das Modell auf einer mobilen RTX 5060 mit 8 GB laufe, während er die Einstellungen noch optimiere; ein Nutzer mit RTX 3060 12 GB empfahl W4A8 für 8 GB. Das sind der erste Bericht und die zweite Empfehlung ohne kontrollierte Tests oder vollständige Logs — Hinweise, keine Garantien.
GGUF ist eine optionale Low-Memory-Route, nicht der offizielle Start
Die Qwen- und Comfy-Org-Templates verwenden .safetensors. Für GGUF benötigen Sie einen Drittanbieter-Loader, eine speziell für Qwen Image 2.1 erstellte Quantisierung und einen dafür aufgebauten Graphen. Das Projekt ComfyUI-GGUF bezeichnet sich als work in progress und zertifiziert nicht jede von Dritten veröffentlichte Qwen-Quantisierung.
Ziehen Sie die Community-Route erst in Betracht, wenn der offizielle INT8/W4A8-Weg weiterhin am Speicher scheitert:
- Aktualisieren Sie ComfyUI und installieren Sie
ComfyUI-GGUFüber den Manager oder aus dem Repository. - Besorgen Sie eine Datei, die ausdrücklich für Qwen Image 2.1 erstellt wurde. Prüfen Sie Herausgeber, Lizenz, Hash und benötigten Loader.
- Ersetzen Sie den Standard-Diffusionsloader durch
Unet Loader (GGUF). Behalten Sie einen Qwen-Image-2.1-kompatiblen Hauptencoder und das VAE. - Wählen Sie den exakten Dateinamen und testen Sie unter ungefähr 1 MP, CFG 1 und Batch 1.
- Bei einem Fehler folgen Sie den Hinweisen genau dieser Quantisierung. Vermischen Sie bei der Diagnose keine Graphen für Qwen Image 1.x, Flux oder generisches Stable Diffusion.
Ein russischsprachiger Nutzer meldete, qwen-image-2.1-UC-Q4_K_M.gguf in ComfyUI gestartet zu haben, brauchte dafür aber zusätzliche Hilfe. Ein separater Community-Q8_0-Workflow kombiniert GGUF mit offiziellem Encoder und VAE. Das zeigt, dass ein alternativer Weg existiert, beweist aber weder die Kompatibilität noch die Sicherheit beliebiger Q4/Q8-Dateien.
Prompt-Enhancement, 2K und Editing erst nach der Basis hinzufügen
Wenn das Basisbild stabil erzeugt und gespeichert wird, erweitern Sie den Graphen in dieser Reihenfolge:
- Prompt-Enhancement: Laden Sie
qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors, wählen Sie die Datei und aktivieren Sierefine_prompt. Halten Sie Seed, Abmessungen und Schritte für den Vergleich konstant. - Höhere Auflösung: Steigern Sie stufenweise, statt direkt von 1024 auf 2048×2048 zu springen. Speichern Sie als PNG, wenn ein Alphakanal benötigt wird.
- Bildbearbeitung: Wechseln Sie zum offiziellen Image-Edit-Workflow. Sein Prompt-Enhancer verwendet die Datei
..._pe_i2i..., nicht T2I. - Transparente Ausgabe: Verwenden Sie die offizielle Formulierung für RGBA/transparenten Hintergrund und speichern Sie als PNG. Bestätigen Sie zuerst ein normales deckendes Bild, damit Transparenz die einzige neue Variable ist.
Abschließende Abnahmeliste
- ComfyUI Core, Frontend-Abhängigkeiten und Workflow-Templates sind aktuell; nach dem Neustart bleibt kein Core-Node rot.
- Diffusionsmodell, Hauptencoder und VAE liegen in den richtigen Ordnern und erscheinen unter dem exakten Namen.
- Prompt-Enhancement ist aus, Batch ist 1 und CFG ist 1; 8 GB beginnt bei 768, 12 GB bei 1024.
- Es ist nur ein Job eingereiht und das Terminal beendet ihn ohne Modell-, Node- oder OOM-Fehler.
- Unter
ComfyUI/output/liegt eine gültige PNG mit den angeforderten Abmessungen. - Funktionierende Gewichtskombination, Auflösung und beobachteter Peak wurden notiert, bevor PE, höhere Auflösung, Editing oder GGUF hinzukommen.
Wenn alle sechs Punkte erfüllt sind, besitzen Sie eine reproduzierbare lokale Qwen-Image-2.1-Basis. Jede weitere Optimierung sollte genau ein Element dieser Basis ändern, statt sie durch einen großen Graphen zu ersetzen, dessen Fehlerursache sich nicht mehr isolieren lässt.