Qwen Image 2.1 + MiniMax H3: lokale Videopipeline mit Start- und Endbild
Erfahren Sie, wann vollständig lokales 768p genügt, wann hybrides 2K sinnvoll ist und wie Sie Qwen-Bilder erstellen, H3-Base lokal ausführen, gehostetes H3 mit identischen Eingaben vergleichen und Fehler eingrenzen.
Inhalt

Vielleicht erzeugen Sie mit Qwen bereits überzeugende Start- und Endbilder. Die eigentliche Frage ist, ob H3 sie als eine durchgehende Einstellung verbinden kann, ohne das Motiv zu wechseln, einen unerwünschten Schnitt einzubauen oder einen API-abhängigen 2K-Pfad als „lokal“ zu bezeichnen. Dieser Leitfaden gibt eine klare Reihenfolge vor: zuerst die vollständig lokale 768p-Kette nachweisen, nur bei echter 2K-Anforderung auf den Hybridpfad wechseln und lokales sowie gehostetes H3 mit identischen Eingaben vergleichen.
Der Einstieg: lokales 768p, solange 2K nicht zwingend ist
Wenn Sie die Übergabe prüfen, Dateien auf der eigenen Maschine halten oder unerwünschte Schnitte untersuchen wollen, beginnen Sie mit vollständig lokalem 768p. Hybrides 2K ist erst sinnvoll, wenn die Lieferung 2K zwingend verlangt und entfernte Aufrufe von H3-Context-IR und H3-Regenerate-2K akzeptabel sind.
| Ihr Ziel | Zuerst wählen | Warum | Wann sich die Empfehlung ändert |
|---|---|---|---|
| Nachweisen, dass die ganze Kette läuft | Vollständig lokales 768p | Weniger Variablen; Qwen- und H3-Probleme lassen sich leichter trennen | Erst wechseln, wenn 768p stabil ist und die Lieferung wirklich 2K braucht |
| Dateien auf der eigenen Maschine halten | Vollständig lokales 768p | Qwen-Bilder und H3-Base können lokal bleiben | Sind 2K Pflicht und entfernte APIs verboten, erfüllt der dokumentierte vollständige Pfad die Anforderung nicht; dann ist eine andere lokale 2K-Lösung nötig |
| Ein finales 2K-Video liefern | Hybrides 2K | Der offizielle vollständige Pfad hängt weiterhin von zwei gehosteten Modulen ab | Zu 768p oder einer anderen Lösung zurückkehren, wenn Dateien nicht extern verarbeitet werden dürfen |
| Zwischen lokalem und gehostetem H3 wählen | Zuerst lokales 768p nachweisen, dann gepaart vergleichen | Sonst vermischen sich Bereitstellungsfehler und Modellqualität | Eine Dauerlösung erst nach Wiederholungen mit mehreren Einstellungsarten festlegen |
Versprechen Sie keine Kompatibilität allein anhand des GPU-Namens. MiniMax’ SGLang-Beispiel verwendet vier GPUs, der öffentliche Lauf einen DGX Spark; beide nennen weder Mindest-VRAM noch belegen sie die Ausführbarkeit auf einer gewöhnlichen Consumer-GPU.
Was tatsächlich auf Ihrer Maschine bleiben kann
Qwen-Bilderzeugung und H3-Base in 768p können lokal bleiben; der offizielle vollständige 2K-Pfad nicht.
| Stufe | Lokal möglich? | Dokumentierte Grenze |
|---|---|---|
| Start- und Endbild mit Qwen Image 2.1 erzeugen und bearbeiten | Ja | Das offizielle Repository enthält QwenImage21Pipeline, lokale Diffusers-Beispiele, native 2K-Größen und bis zu 10 Referenzbilder |
| Start- und Endbild mit MiniMax H3-Base in Audio-Video umwandeln | Ja | Der offene Checkpoint FL2VA akzeptiert null, ein oder zwei Bilder; zwei Bilder aktivieren den Start-/Endbildmodus, lokal validiert wird in 768p |
| H3-Context-IR | Nicht als vollständige offizielle lokale Implementierung | MiniMax beschreibt es als gehostetes Vorverarbeitungs- und Orchestrierungssystem, das nicht Teil des Open-Source-Releases ist; verwenden Sie die API oder eine eigene Vorverarbeitung nach dem Prompting-Leitfaden |
| H3-Regenerate-2K | Nicht mit den derzeit offenen Komponenten | Das Modul ist nicht veröffentlicht; der offizielle vollständige 2K-Workflow ruft es per API auf |
| Vergleich mit gehostetem H3 | Nein | Ein Web-/API-Lauf ist per Definition remote und dient nur als gepaarte Kontrollgruppe |
MiniMax dokumentiert außerdem 4–15 Sekunden Ausgabe, 24 FPS, 32-kHz-Stereo und standardmäßig 768 Pixel an der kurzen Seite; 2K entsteht durch H3-Regenerate-2K. Das sind Modellgrenzen, keine Zusage, dass jede Konfiguration auf Ihrer Hardware lauffähig ist.
Ein öffentlicher Test belegt Machbarkeit, aber keinen allgemeinen Sieger
Nutzen Sie den Fall als Prüfdesign, nicht als Urteil, dass lokales H3 immer besser sei.
Der Filmemacher Sam Wasserman veröffentlichte einen lokalen Idee-zu-Bild-zu-Video-Lauf auf einem DGX Spark mit Qwen Image 2.1 und MiniMax H3. Das angehängte Ergebnis ist ungefähr acht Sekunden lang. In einem Folgebeitrag schreibt er, dass er denselben Prompt, dieselben Spezifikationen sowie dieselben Start- und Endbilder im kostenpflichtigen Web-H3 wiederverwendete. Nach seiner Einschätzung fügte das Web-Ergebnis einen unerwünschten Schnitt ein, während der lokale Lauf die geplante Abfolge beibehielt.
Das ist ein nützlicher Machbarkeitsnachweis und ein brauchbares Vergleichsdesign. Es ist kein Beleg dafür, dass lokales H3 generell besser ist. Die Beiträge nennen weder Installationsbefehle noch Spitzenspeicher, Generierungszeit, Audiobehandlung, Seeds oder Fehlversuche. Zudem beurteilt derselbe Autor genau eine Eingabe; es handelt sich nicht um eine unabhängige Replikation.
Schritt 1: die Idee auf eine durchgehende Einstellung reduzieren
Verlangen Sie einen Ort, eine Aktionskette und einen Endzustand. Schreiben Sie das als Einstellungsvertrag auf: eine kurze Spezifikation, mit der sich Anweisung und Ergebnis prüfen lassen.
| Feld | Festzulegender Inhalt |
|---|---|
| Motiv und Umgebung | Personen, Gegenstände, Kleidung, Hintergrund und Identitätsmerkmale, die stabil bleiben müssen |
| Startzustand | Position, Pose, Blick, Kameradistanz, Bildaufbau und Licht im Startbild |
| Endzustand | Nur die am Ende erlaubte Veränderung; nicht gleichzeitig Motiv, Ort und Kameraposition wechseln |
| Bewegungsablauf | Wie sich Motiv und gegebenenfalls Kamera bewegen und in welcher Reihenfolge Aktionen stattfinden |
| Kontinuitätsregeln | Eindeutige Vorgaben wie „eine durchgehende Einstellung“, „keine Schnitte“ und „kein Teleportieren“ |
| Ausgabespezifikation | Dauer, Seitenverhältnis und Bedarf an Dialog, Atmosphäre oder Musik |
| Negativvorgaben | Unerwünschte Figuren, Untertitel, Szenenwechsel, Hintergrundersatz oder Zusatzaktionen |
Soll der Test unerwünschte Schnitte erkennen, verlangen Sie nicht mehrere Orte, Zeitebenen oder eine Montage im selben Prompt. Sonst kann ein Schnitt eine vernünftige Interpretation der Anweisung und kein Modellfehler sein.
„Von der Tür zum Tisch gehen, die Tasse aufnehmen, kein Schnitt“ eignet sich für einen Start-/Endbildtest. „Von der Straße ins Büro wechseln und danach in die Kindheit zurückblenden“ braucht natürlicherweise mehrere Szenen und kann unerwünschte Schnitte nicht sauber testen.
Schritt 2: das Startbild erzeugen und daraus das Endbild bearbeiten
Erzeugen Sie nicht zwei unabhängige Bilder, sondern bearbeiten Sie das Startbild zum Endbild. So bleiben Identität, Kleidung, Komposition und Hintergrund leichter stabil, bevor H3 überhaupt beginnt.
Die offizielle Modell-ID lautet Qwen/Qwen-Image-2.1. Qwen dokumentiert eine visuelle Komponente mit 7B Parametern, lokale Diffusers-Unterstützung, Generierung und Bearbeitung, natives 2K sowie bis zu 10 Referenzbilder.
pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
pip install git+https://github.com/huggingface/diffusers
from pathlib import Path
import torch
from diffusers import QwenImage21Pipeline
first_prompt = Path("first_prompt.txt").read_text(encoding="utf-8").strip()
last_edit_prompt = Path("last_edit_prompt.txt").read_text(encoding="utf-8").strip()
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
first = pipe(
prompt=first_prompt,
width=2752,
height=1536,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
first.convert("RGB").save("first.png")
last = pipe(
prompt=last_edit_prompt,
image=first,
width=2752,
height=1536,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(43),
).images[0]
last.convert("RGB").save("last.png")
Der Code kombiniert die offiziellen Schnittstellen für Generierung und Einbild-Bearbeitung; first_prompt und last_edit_prompt liefern Sie selbst. Verwendet werden das dokumentierte 16:9-Format 2752 × 1536, 40 Schritte und undurchsichtige RGB-PNGs. Die öffentliche H3-Dokumentation beschreibt das Alpha-Verhalten bei dieser Übergabe nicht; undurchsichtige Bilder entfernen daher eine Variable, sofern RGBA nicht separat geprüft wurde.
Halten Sie mindestens fest:
- Modell-ID, Framework-Version, Startbild-Prompt und Bearbeitungs-Prompt für das Endbild;
- beide Seeds, Breite, Höhe, Schrittzahl und Referenzbildliste;
- SHA-256, Pixelmaße und Farbmodus beider Dateien;
- Stabilität von Identität, Kleidung, Komposition, Licht und Hintergrund;
- ob das Endbild nur den gewünschten Endzustand zeigt und nicht den gesamten Bewegungsablauf.
Qwen dokumentiert außerdem enable_model_cpu_offload() für begrenzten Grafikspeicher. Damit ist ein Offload-Pfad belegt; daraus folgen weder ein Mindest-VRAM noch eine Geschwindigkeitsgarantie für die kombinierte Pipeline.
Schritt 3: lokalem und gehostetem H3 dieselben Eingaben geben
Tragen Sie Parameter nicht aus dem Gedächtnis in zwei Oberflächen ein. Speichern Sie Bilder, Prompt und Ausgabeeinstellungen in einem Manifest; ein anderer Seed, eine andere Dauer oder ein umgeschriebener Prompt kann den gesamten Vergleich entwerten.
experiment_id: "qwen-h3-001"
qwen_model: "Qwen/Qwen-Image-2.1"
h3_model: "MiniMaxAI/MiniMax-H3"
h3_variant: "fl2va"
prompt_file: "prompt.txt"
first_frame: "first.png"
last_frame: "last.png"
prompt_sha256: "<sha256>"
first_frame_sha256: "<sha256>"
last_frame_sha256: "<sha256>"
duration_seconds: "<same value>"
aspect_ratio: "<same value>"
local_seed: "<record if exposed>"
hosted_seed: "<record or not_exposed>"
Sowohl lokaler als auch gehosteter Lauf lesen diesen Datensatz. Blendet die gehostete Oberfläche den Seed aus, schreibt den Prompt um oder begrenzt die Dauer, notieren Sie not_exposed oder speichern Sie den umgeschriebenen Prompt. Behaupten Sie keine Parameteridentität, wenn sie nicht überprüfbar ist. Ergebnisunterschiede werden erst interpretierbar, wenn sichtbare Eingaben kontrolliert sind.
Schritt 4: zuerst das lokale H3-Base-Ergebnis in 768p zum Laufen bringen
Nehmen Sie zuerst 768p ab und denken Sie danach über 2K nach. 2K-Standbilder aus Qwen machen das lokale H3-Base-Video nicht zu 2K.
MiniMax veröffentlicht zwei spezialisierte Checkpoints. Hier wird MiniMax-H3 Base FL2VA verwendet; es erzeugt in BF16 Audio-Video aus Text, Startbild, Endbild oder beiden Bildern. Offizieller Download und SGLang-Beispiel:
hf download MiniMaxAI/MiniMax-H3 \
--include "FL2VA/*" \
--local-dir MiniMax-H3
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
Der zweite Befehl ist MiniMax’ Vier-GPU-Beispiel. Er ist weder Wassermans veröffentlichte DGX-Spark-Konfiguration noch eine Mindestanforderung. Passen Sie ihn nur anhand der Framework-Dokumentation an und protokollieren Sie jede Änderung; stellen Sie das Beispiel nicht als Garantie für beliebige Rechner dar.
Beide Bilder für den SGLang-Prozess sichtbar machen
FL2VA akzeptiert eine oder zwei Bildbedingungen mit role: "keyframe". Der offizielle H3-Leitfaden von SGLang definiert frame_index: 0 als Startbild, frame_index: -1 als Endbild und [0, -1] als Kombination beider Randbilder. Das reproduzierbare MiniMax-Skript zeigt nur die Form mit dem Startbild; die folgende Anfrage verwendet dieselben Felder mit beiden Bildern.
Eine file://-URI wird vom SGLang-Serverprozess aufgelöst, nicht vom Terminal, das curl ausführt. Laufen beide auf demselben Host, funktionieren die absoluten Pfade aus realpath. Läuft SGLang in einem Container oder auf einem anderen Rechner, binden oder kopieren Sie beide Dateien dorthin und setzen FIRST_URI sowie LAST_URI auf Pfade, die der Server tatsächlich lesen kann.
Speichern Sie den Einstellungsvertrag in prompt.txt. Für vollständig lokales 768p kann die Datei Ihren eigenen strukturierten Prompt enthalten. Im hybriden 2K-Pfad kommt das Ergebnis von H3-Context-IR in dasselbe Feld prompt; anschließend geht die H3-Base-Ausgabe an H3-Regenerate-2K.
FL2VA absenden, auf Abschluss warten und MP4 speichern
Das Skript folgt dem dokumentierten asynchronen Ablauf: Es erstellt den Job mit POST /v1/videos und liest .id, fragt GET /v1/videos/{id} ab und ruft GET /v1/videos/{id}/content erst auf, wenn status den Wert completed hat. Das offizielle Cookbook behandelt failed als terminalen Fehler; jeder andere nicht leere Status bleibt in der Warteschleife.
set -euo pipefail
BASE_URL="${BASE_URL:-http://127.0.0.1:30010}"
FIRST_URI="${FIRST_URI:-file://$(realpath first.png)}"
LAST_URI="${LAST_URI:-file://$(realpath last.png)}"
PROMPT_FILE="${PROMPT_FILE:-prompt.txt}"
OUTPUT_FILE="${OUTPUT_FILE:-fl2va.mp4}"
payload=$(
jq -n \
--rawfile prompt "$PROMPT_FILE" \
--arg first "$FIRST_URI" \
--arg last "$LAST_URI" \
'{
model: "MiniMaxAI/MiniMax-H3",
task: "fl2va",
prompt: $prompt,
seconds: 8,
conditions: [
{
type: "image",
uri: $first,
role: "keyframe",
frame_index: 0
},
{
type: "image",
uri: $last,
role: "keyframe",
frame_index: -1
}
],
target: {
short_edge: 768,
aspect_ratio: "auto",
duration_seconds: 8
},
seed: 0
}'
)
response=$(
curl --fail-with-body --silent --show-error \
--request POST \
--url "$BASE_URL/v1/videos" \
--header 'Content-Type: application/json' \
--data-binary "$payload"
)
video_id=$(printf '%s\n' "$response" | jq -er '.id')
printf 'video_id=%s\n' "$video_id"
while true; do
task_json=$(
curl --fail-with-body --silent --show-error \
--request GET \
--url "$BASE_URL/v1/videos/$video_id"
)
status=$(printf '%s\n' "$task_json" | jq -er '.status')
printf 'status=%s\n' "$status"
case "$status" in
completed)
break
;;
failed)
printf '%s\n' "$task_json" | jq .
exit 1
;;
*)
sleep 1
;;
esac
done
curl --fail-with-body --silent --show-error --location \
--request GET \
--url "$BASE_URL/v1/videos/$video_id/content" \
--output "$OUTPUT_FILE"
test -s "$OUTPUT_FILE"
if command -v ffprobe >/dev/null 2>&1; then
ffprobe -v error \
-show_entries stream=codec_type,codec_name,r_frame_rate,sample_rate,channels \
-of default=noprint_wrappers=1 \
"$OUTPUT_FILE"
fi
printf 'saved=%s\n' "$OUTPUT_FILE"
curl --fail-with-body bricht bei einer Nicht-2xx-Antwort ab, und jq -e schlägt fehl, wenn .id oder .status fehlt. Bei failed gibt das Skript das vollständige Job-JSON aus und endet mit einem Fehlercode; zum Erfolg gehören außerdem ein erfolgreicher Download und eine nicht leere MP4-Datei.
Ist ffprobe installiert, zeigt das Skript auch die Medienströme an. Der dokumentierte SGLang-Ausgabevertrag ist eine MP4 mit H.264-Video bei 24 FPS und einer AAC-Stereospur mit 32 kHz. Meldet der Job completed, die Datei ist aber leer, nicht dekodierbar oder hat unerwartete Eigenschaften, beginnen Sie den gehosteten Vergleich noch nicht. Prüfen Sie zuerst das SGLang-Protokoll, die serverseitig sichtbaren Bild-URIs und das Anfrage-JSON.
Felder und Endpoints stammen aus dem offiziellen reproduzierbaren FL2VA-Skript von MiniMax, dem SGLang-Cookbook zu MiniMax-H3 und dem SGLang-Leitfaden zur Video-API. Der vollständig lokale Pfad endet hier mit einer H3-Base-MP4 in 768p; vollständiges 2K bleibt der zuvor beschriebene Hybridpfad.
Schritt 5: erst nach stabiler lokaler Kette mit gehostetem H3 vergleichen
Vergleichen Sie keine Qualität, solange der lokale Pfad noch fehlschlägt. Sonst lassen sich Bereitstellungsfehler, Eingabeunterschiede und Modellverhalten nicht trennen. Ändern Sie nur den Ausführungsort:
- Laden Sie byteidentische Start- und Endbilder hoch und prüfen Sie die Hashes.
- Verwenden Sie denselben Prompt, dieselbe Dauer, dasselbe Seitenverhältnis, dieselbe Sprache und Audioabsicht.
- Protokollieren Sie, ob Web/API den Prompt umschreibt, einen Seed zeigt oder H3-Context-IR verwendet.
- Bewahren Sie Originalausgaben auf; vor dem Vergleich weder schneiden noch neu kodieren oder Musik hinzufügen.
- Verbergen Sie die Herkunftsbezeichnung und bewerten Sie blind, damit Erwartungen wie „lokal muss besser sein“ oder „bezahlt muss besser sein“ weniger Einfluss haben.
Für einen Kostenvergleich erfassen Sie API-Rechnung, Maschinenbelegung und Stromverbrauch. Die Bezeichnungen „lokal“ und „bezahltes Web“ zeigen allein nicht, welcher Pfad für Ihre Last günstiger ist.
Schritt 6: mit einer Skala den passenden Pfad für Ihre Einstellungen wählen
Prüfen Sie zuerst, ob der Clip die kreative Aufgabe erfüllt, und vergleichen Sie erst danach Zeit und Hardware. Höhere Auflösung hilft wenig, wenn das Ergebnis ständig unerwünschte Schnitte einfügt.
| Kriterium | Prüfung | Zu protokollieren |
|---|---|---|
| Treue zum Startbild | Bleiben Motiv, Komposition und Schlüsselobjekte erhalten oder werden sie sofort ersetzt? | Abweichung und Zeitcode |
| Erreichen des Endbilds | Erreicht der Clip den Endzustand natürlich oder springt er abrupt zum Endbild? | Endzustand und Übergangsqualität |
| Kontinuität einer Einstellung | Gibt es unerwünschte Schnitte, Teleportationen, Szenenersatz oder Zeitsprünge? | Schnittzeiten und Vorher-/Nachher-Bilder |
| Identitäts- und Hintergrundstabilität | Bleiben Gesicht, Kleidung, Hände, Requisiten und Hintergrundgeometrie stabil? | Betroffenes Element und Dauer |
| Bewegungsablauf | Bewegen sich Motiv und Kamera in vereinbarter Reihenfolge und Richtung? | Richtungsfehler, Geschwindigkeitssprung oder Stillstand |
| Audio | Ist bei angefordertem Ton eine synchrone Spur ohne Knackser oder Fremdinhalte vorhanden? | Medieneigenschaften, Versatz und auffälliger Abschnitt |
| Ausgabespezifikation | Entsprechen Dauer, Seitenverhältnis, FPS und Auflösung den Einstellungen? | Tatsächliche Metadaten |
| Laufzeitressourcen | Wanduhrzeit, Spitzenspeicher des Beschleunigers, RAM und Wiederholungen | Rohprotokolle je Lauf, keine Schätzungen |
| Wiederholbarkeit | Tritt dasselbe Problem bei erneutem kontrolliertem Eingang auf? | Wiederholte Ergebnisse und sichtbare Zufallsparameter |
MiniMax gibt an, dass H3 32-kHz-Stereo erzeugen kann. Wassermans Beiträge sagen nicht, ob Audio aktiviert, erhalten oder nachbearbeitet wurde. Die eigene Ausgabe darf geprüft werden; der Fall ist jedoch keine Validierung der Audioqualität.
Die vorgelagerte Schicht korrigieren statt alles neu zu starten
Ein falsches Startbild gehört zu Qwen, ein Kontinuitätsproblem zu H3 und ein Auflösungsfehler beginnt mit der Wahl zwischen lokalem 768p und hybridem 2K. Schichtweise Diagnose spart mehr Zeit als gleichzeitige Änderungen aller Parameter.
| Symptom | Zuerst prüfen | Maßnahme |
|---|---|---|
| Das Startbild ist bereits falsch | Qwen-Bildstufe | Prompt, Referenzen und Seed korrigieren statt eine fehlerhafte Komposition in H3 zu reparieren |
| Identität oder Hintergrund wechseln im Endbild | Qwen-Übergabeobjekt | Vom Startbild aus bearbeiten, Änderungen reduzieren und stabile Referenzen wiederverwenden |
| Ein unerwarteter Schnitt erscheint | H3-Prompt und Bewegungsregeln | Eine durchgehende Einstellung verlangen, Montage-/Mehrszenen-Sprache entfernen und mit denselben Hashes wiederholen |
| Der Clip erreicht den Endzustand nicht | Dauer oder Bewegungsplan | Aktionskette verkürzen und Start–Ablauf–Ende klar definieren |
| Audio fehlt oder passt nicht | H3-Variante, Client und Container | Audio-Video-Checkpoint und Anfragepfad prüfen; Läufe ohne vergleichbares Audio als nicht vergleichbar markieren |
| Qwen hat zu wenig Speicher | Bildbereitstellung | Dokumentiertes CPU-Offload testen und Zeitwirkung messen; kein universelles Mindest-VRAM ableiten |
| H3 startet auf der Hardware nicht | H3-Bereitstellung | Framework-Leitfaden befolgen; das offizielle Beispiel nutzt vier GPUs, Consumer-Hardware ist nicht garantiert |
| Lokal endet bei 768p, 2K verlangt API | Workflow-Grenze | Das ist die dokumentierte Architektur, kein Fehler; 768p akzeptieren oder hybrides 2K wählen |
| Lokale und gehostete Ergebnisse weichen stark ab | Eingaben und Vorverarbeitung | Prompt-Umschreibung, Context-IR, Seed, Dauer, Format und Neukodierung prüfen, bevor das Modell verantwortlich gemacht wird |
Lokales oder gehostetes H3 für den Dauerbetrieb wählen
Entscheiden Sie anhand Ihres Einstellungssatzes, nicht anhand des schönsten Einzelbeispiels. Decken Sie statische Kamera, menschliche Bewegung, Objektverwandlung, Dialog und Atmosphäre ab und bewahren Sie Erfolge wie Fehler; trennen Sie diese Messwerte:
- Clipdauer, etwa die ungefähr acht Sekunden des öffentlichen Beispiels;
- Generierungszeit, also die Zeit von der Einreichung bis zur fertigen Datei, die dort nicht genannt wird;
- Modellspezifikationen aus der Herstellerdokumentation;
- tatsächliche Hardwarenutzung, auf Ihrem System gemessen statt aus dem Gerätenamen geraten;
- eine visuelle Beurteilung, die diesen Lauf beschreibt, aber keine allgemeine Gewinnrate ergibt.
Müssen Dateien auf Ihrer Maschine bleiben, behalten Sie lokales 768p als Standard. Muss die finale Ausgabe 2K sein und sind entfernte APIs akzeptabel, wählen Sie hybrides 2K. Ist Kontinuität am wichtigsten, bewerten Sie lokales und gehostetes H3 blind mit demselben Einstellungssatz und bevorzugen Sie den Pfad, der Ihre Skala konsistenter besteht. Der öffentliche Fall zeigt, dass der lokale Pfad läuft und in einem Test einen Schnitt vermied; er ersetzt keine Wiederholungen.
Diese acht Punkte vor dem Lauf prüfen
- Der Lauf ist entweder als „vollständig lokal 768p“ oder „hybrid 2K“ bezeichnet.
- Qwen-Modell, Prompts, Seeds, Maße und Referenzen sind für beide Bilder erfasst.
- Bilder und Prompt sind gehasht; beide H3-Läufe verwenden dieselben Eingaben.
- Der lokale Lauf nutzt
fl2vaund wird zunächst als H3-Base-768p-Ergebnis abgenommen. - Umschreibungen und verborgene Parameter des gehosteten Dienstes sind ehrlich dokumentiert.
- Originalvideos bleiben unbearbeitet und werden mit derselben Kontinuitäts-, Schnitt-, Audio- und Spezifikationsskala bewertet.
- Zeit, Spitzenspeicher, Wiederholungen und Fehler stammen aus Protokollen.
- Aussagen sind auf getestete Beispiele, Hardware und Prüftag begrenzt.
Fazit
Die Standardempfehlung ist klar: Start- und Endbild lokal mit Qwen Image 2.1 erstellen und danach lokales 768p mit MiniMax H3-Base fl2va nachweisen. Wechseln Sie nur bei zwingender 2K-Lieferung und akzeptablen entfernten APIs zu H3-Context-IR → lokalem H3-Base → H3-Regenerate-2K.
Frieren Sie in beiden Fällen Bilder, Prompt, Dauer und Seitenverhältnis ein und vergleichen Sie Kontinuität, unerwünschte Schnitte, Audio, Zeit und Hardwarenutzung mit identischen Eingaben. So wird aus einer schönen Demonstration ein prüfbarer Arbeitsablauf, den Sie bewusst übernehmen können.
Referenzen
- Offizielles Repository von Qwen Image 2.1
- Offizielle Open-Source-Ankündigung zu MiniMax H3
- Offizielle reproduzierbare FL2VA-Anfrage für MiniMax H3
- Offizielles SGLang-Cookbook zu MiniMax-H3
- SGLang-Diffusion-Leitfaden zur Video-API
- Lokaler End-to-End-Lauf von Sam Wasserman
- Web-H3-Vergleich desselben Autors mit denselben Eingaben
Fakten geprüft am 26. September 2026.