Einladen & verdienen

So funktionieren Einladungsboni

Teile deinen Einladungslink. Registriert sich ein Freund darüber und lädt Guthaben auf, erhältst du die angezeigte Prämie für seine weiteren Aufladungen.

Qwen Image 2.1 + MiniMax H3: lokale Videopipeline mit Start- und Endbild

Erfahren Sie, wann vollständig lokales 768p genügt, wann hybrides 2K sinnvoll ist und wie Sie Qwen-Bilder erstellen, H3-Base lokal ausführen, gehostetes H3 mit identischen Eingaben vergleichen und Fehler eingrenzen.

Inhalt
Qwen Image 2.1 + MiniMax H3: lokale Videopipeline mit Start- und Endbild

Vielleicht erzeugen Sie mit Qwen bereits überzeugende Start- und Endbilder. Die eigentliche Frage ist, ob H3 sie als eine durchgehende Einstellung verbinden kann, ohne das Motiv zu wechseln, einen unerwünschten Schnitt einzubauen oder einen API-abhängigen 2K-Pfad als „lokal“ zu bezeichnen. Dieser Leitfaden gibt eine klare Reihenfolge vor: zuerst die vollständig lokale 768p-Kette nachweisen, nur bei echter 2K-Anforderung auf den Hybridpfad wechseln und lokales sowie gehostetes H3 mit identischen Eingaben vergleichen.

Der Einstieg: lokales 768p, solange 2K nicht zwingend ist

Wenn Sie die Übergabe prüfen, Dateien auf der eigenen Maschine halten oder unerwünschte Schnitte untersuchen wollen, beginnen Sie mit vollständig lokalem 768p. Hybrides 2K ist erst sinnvoll, wenn die Lieferung 2K zwingend verlangt und entfernte Aufrufe von H3-Context-IR und H3-Regenerate-2K akzeptabel sind.

Ihr ZielZuerst wählenWarumWann sich die Empfehlung ändert
Nachweisen, dass die ganze Kette läuftVollständig lokales 768pWeniger Variablen; Qwen- und H3-Probleme lassen sich leichter trennenErst wechseln, wenn 768p stabil ist und die Lieferung wirklich 2K braucht
Dateien auf der eigenen Maschine haltenVollständig lokales 768pQwen-Bilder und H3-Base können lokal bleibenSind 2K Pflicht und entfernte APIs verboten, erfüllt der dokumentierte vollständige Pfad die Anforderung nicht; dann ist eine andere lokale 2K-Lösung nötig
Ein finales 2K-Video liefernHybrides 2KDer offizielle vollständige Pfad hängt weiterhin von zwei gehosteten Modulen abZu 768p oder einer anderen Lösung zurückkehren, wenn Dateien nicht extern verarbeitet werden dürfen
Zwischen lokalem und gehostetem H3 wählenZuerst lokales 768p nachweisen, dann gepaart vergleichenSonst vermischen sich Bereitstellungsfehler und ModellqualitätEine Dauerlösung erst nach Wiederholungen mit mehreren Einstellungsarten festlegen

Versprechen Sie keine Kompatibilität allein anhand des GPU-Namens. MiniMax’ SGLang-Beispiel verwendet vier GPUs, der öffentliche Lauf einen DGX Spark; beide nennen weder Mindest-VRAM noch belegen sie die Ausführbarkeit auf einer gewöhnlichen Consumer-GPU.

Was tatsächlich auf Ihrer Maschine bleiben kann

Qwen-Bilderzeugung und H3-Base in 768p können lokal bleiben; der offizielle vollständige 2K-Pfad nicht.

StufeLokal möglich?Dokumentierte Grenze
Start- und Endbild mit Qwen Image 2.1 erzeugen und bearbeitenJaDas offizielle Repository enthält QwenImage21Pipeline, lokale Diffusers-Beispiele, native 2K-Größen und bis zu 10 Referenzbilder
Start- und Endbild mit MiniMax H3-Base in Audio-Video umwandelnJaDer offene Checkpoint FL2VA akzeptiert null, ein oder zwei Bilder; zwei Bilder aktivieren den Start-/Endbildmodus, lokal validiert wird in 768p
H3-Context-IRNicht als vollständige offizielle lokale ImplementierungMiniMax beschreibt es als gehostetes Vorverarbeitungs- und Orchestrierungssystem, das nicht Teil des Open-Source-Releases ist; verwenden Sie die API oder eine eigene Vorverarbeitung nach dem Prompting-Leitfaden
H3-Regenerate-2KNicht mit den derzeit offenen KomponentenDas Modul ist nicht veröffentlicht; der offizielle vollständige 2K-Workflow ruft es per API auf
Vergleich mit gehostetem H3NeinEin Web-/API-Lauf ist per Definition remote und dient nur als gepaarte Kontrollgruppe

MiniMax dokumentiert außerdem 4–15 Sekunden Ausgabe, 24 FPS, 32-kHz-Stereo und standardmäßig 768 Pixel an der kurzen Seite; 2K entsteht durch H3-Regenerate-2K. Das sind Modellgrenzen, keine Zusage, dass jede Konfiguration auf Ihrer Hardware lauffähig ist.

Ein öffentlicher Test belegt Machbarkeit, aber keinen allgemeinen Sieger

Nutzen Sie den Fall als Prüfdesign, nicht als Urteil, dass lokales H3 immer besser sei.

Der Filmemacher Sam Wasserman veröffentlichte einen lokalen Idee-zu-Bild-zu-Video-Lauf auf einem DGX Spark mit Qwen Image 2.1 und MiniMax H3. Das angehängte Ergebnis ist ungefähr acht Sekunden lang. In einem Folgebeitrag schreibt er, dass er denselben Prompt, dieselben Spezifikationen sowie dieselben Start- und Endbilder im kostenpflichtigen Web-H3 wiederverwendete. Nach seiner Einschätzung fügte das Web-Ergebnis einen unerwünschten Schnitt ein, während der lokale Lauf die geplante Abfolge beibehielt.

Das ist ein nützlicher Machbarkeitsnachweis und ein brauchbares Vergleichsdesign. Es ist kein Beleg dafür, dass lokales H3 generell besser ist. Die Beiträge nennen weder Installationsbefehle noch Spitzenspeicher, Generierungszeit, Audiobehandlung, Seeds oder Fehlversuche. Zudem beurteilt derselbe Autor genau eine Eingabe; es handelt sich nicht um eine unabhängige Replikation.

Schritt 1: die Idee auf eine durchgehende Einstellung reduzieren

Verlangen Sie einen Ort, eine Aktionskette und einen Endzustand. Schreiben Sie das als Einstellungsvertrag auf: eine kurze Spezifikation, mit der sich Anweisung und Ergebnis prüfen lassen.

FeldFestzulegender Inhalt
Motiv und UmgebungPersonen, Gegenstände, Kleidung, Hintergrund und Identitätsmerkmale, die stabil bleiben müssen
StartzustandPosition, Pose, Blick, Kameradistanz, Bildaufbau und Licht im Startbild
EndzustandNur die am Ende erlaubte Veränderung; nicht gleichzeitig Motiv, Ort und Kameraposition wechseln
BewegungsablaufWie sich Motiv und gegebenenfalls Kamera bewegen und in welcher Reihenfolge Aktionen stattfinden
KontinuitätsregelnEindeutige Vorgaben wie „eine durchgehende Einstellung“, „keine Schnitte“ und „kein Teleportieren“
AusgabespezifikationDauer, Seitenverhältnis und Bedarf an Dialog, Atmosphäre oder Musik
NegativvorgabenUnerwünschte Figuren, Untertitel, Szenenwechsel, Hintergrundersatz oder Zusatzaktionen

Soll der Test unerwünschte Schnitte erkennen, verlangen Sie nicht mehrere Orte, Zeitebenen oder eine Montage im selben Prompt. Sonst kann ein Schnitt eine vernünftige Interpretation der Anweisung und kein Modellfehler sein.

„Von der Tür zum Tisch gehen, die Tasse aufnehmen, kein Schnitt“ eignet sich für einen Start-/Endbildtest. „Von der Straße ins Büro wechseln und danach in die Kindheit zurückblenden“ braucht natürlicherweise mehrere Szenen und kann unerwünschte Schnitte nicht sauber testen.

Schritt 2: das Startbild erzeugen und daraus das Endbild bearbeiten

Erzeugen Sie nicht zwei unabhängige Bilder, sondern bearbeiten Sie das Startbild zum Endbild. So bleiben Identität, Kleidung, Komposition und Hintergrund leichter stabil, bevor H3 überhaupt beginnt.

Die offizielle Modell-ID lautet Qwen/Qwen-Image-2.1. Qwen dokumentiert eine visuelle Komponente mit 7B Parametern, lokale Diffusers-Unterstützung, Generierung und Bearbeitung, natives 2K sowie bis zu 10 Referenzbilder.

pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
pip install git+https://github.com/huggingface/diffusers
from pathlib import Path

import torch
from diffusers import QwenImage21Pipeline

first_prompt = Path("first_prompt.txt").read_text(encoding="utf-8").strip()
last_edit_prompt = Path("last_edit_prompt.txt").read_text(encoding="utf-8").strip()

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

first = pipe(
    prompt=first_prompt,
    width=2752,
    height=1536,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]
first.convert("RGB").save("first.png")

last = pipe(
    prompt=last_edit_prompt,
    image=first,
    width=2752,
    height=1536,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(43),
).images[0]
last.convert("RGB").save("last.png")

Der Code kombiniert die offiziellen Schnittstellen für Generierung und Einbild-Bearbeitung; first_prompt und last_edit_prompt liefern Sie selbst. Verwendet werden das dokumentierte 16:9-Format 2752 × 1536, 40 Schritte und undurchsichtige RGB-PNGs. Die öffentliche H3-Dokumentation beschreibt das Alpha-Verhalten bei dieser Übergabe nicht; undurchsichtige Bilder entfernen daher eine Variable, sofern RGBA nicht separat geprüft wurde.

Halten Sie mindestens fest:

  • Modell-ID, Framework-Version, Startbild-Prompt und Bearbeitungs-Prompt für das Endbild;
  • beide Seeds, Breite, Höhe, Schrittzahl und Referenzbildliste;
  • SHA-256, Pixelmaße und Farbmodus beider Dateien;
  • Stabilität von Identität, Kleidung, Komposition, Licht und Hintergrund;
  • ob das Endbild nur den gewünschten Endzustand zeigt und nicht den gesamten Bewegungsablauf.

Qwen dokumentiert außerdem enable_model_cpu_offload() für begrenzten Grafikspeicher. Damit ist ein Offload-Pfad belegt; daraus folgen weder ein Mindest-VRAM noch eine Geschwindigkeitsgarantie für die kombinierte Pipeline.

Schritt 3: lokalem und gehostetem H3 dieselben Eingaben geben

Tragen Sie Parameter nicht aus dem Gedächtnis in zwei Oberflächen ein. Speichern Sie Bilder, Prompt und Ausgabeeinstellungen in einem Manifest; ein anderer Seed, eine andere Dauer oder ein umgeschriebener Prompt kann den gesamten Vergleich entwerten.

experiment_id: "qwen-h3-001"
qwen_model: "Qwen/Qwen-Image-2.1"
h3_model: "MiniMaxAI/MiniMax-H3"
h3_variant: "fl2va"
prompt_file: "prompt.txt"
first_frame: "first.png"
last_frame: "last.png"
prompt_sha256: "<sha256>"
first_frame_sha256: "<sha256>"
last_frame_sha256: "<sha256>"
duration_seconds: "<same value>"
aspect_ratio: "<same value>"
local_seed: "<record if exposed>"
hosted_seed: "<record or not_exposed>"

Sowohl lokaler als auch gehosteter Lauf lesen diesen Datensatz. Blendet die gehostete Oberfläche den Seed aus, schreibt den Prompt um oder begrenzt die Dauer, notieren Sie not_exposed oder speichern Sie den umgeschriebenen Prompt. Behaupten Sie keine Parameteridentität, wenn sie nicht überprüfbar ist. Ergebnisunterschiede werden erst interpretierbar, wenn sichtbare Eingaben kontrolliert sind.

Schritt 4: zuerst das lokale H3-Base-Ergebnis in 768p zum Laufen bringen

Nehmen Sie zuerst 768p ab und denken Sie danach über 2K nach. 2K-Standbilder aus Qwen machen das lokale H3-Base-Video nicht zu 2K.

MiniMax veröffentlicht zwei spezialisierte Checkpoints. Hier wird MiniMax-H3 Base FL2VA verwendet; es erzeugt in BF16 Audio-Video aus Text, Startbild, Endbild oder beiden Bildern. Offizieller Download und SGLang-Beispiel:

hf download MiniMaxAI/MiniMax-H3 \
  --include "FL2VA/*" \
  --local-dir MiniMax-H3

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

Der zweite Befehl ist MiniMax’ Vier-GPU-Beispiel. Er ist weder Wassermans veröffentlichte DGX-Spark-Konfiguration noch eine Mindestanforderung. Passen Sie ihn nur anhand der Framework-Dokumentation an und protokollieren Sie jede Änderung; stellen Sie das Beispiel nicht als Garantie für beliebige Rechner dar.

Beide Bilder für den SGLang-Prozess sichtbar machen

FL2VA akzeptiert eine oder zwei Bildbedingungen mit role: "keyframe". Der offizielle H3-Leitfaden von SGLang definiert frame_index: 0 als Startbild, frame_index: -1 als Endbild und [0, -1] als Kombination beider Randbilder. Das reproduzierbare MiniMax-Skript zeigt nur die Form mit dem Startbild; die folgende Anfrage verwendet dieselben Felder mit beiden Bildern.

Eine file://-URI wird vom SGLang-Serverprozess aufgelöst, nicht vom Terminal, das curl ausführt. Laufen beide auf demselben Host, funktionieren die absoluten Pfade aus realpath. Läuft SGLang in einem Container oder auf einem anderen Rechner, binden oder kopieren Sie beide Dateien dorthin und setzen FIRST_URI sowie LAST_URI auf Pfade, die der Server tatsächlich lesen kann.

Speichern Sie den Einstellungsvertrag in prompt.txt. Für vollständig lokales 768p kann die Datei Ihren eigenen strukturierten Prompt enthalten. Im hybriden 2K-Pfad kommt das Ergebnis von H3-Context-IR in dasselbe Feld prompt; anschließend geht die H3-Base-Ausgabe an H3-Regenerate-2K.

FL2VA absenden, auf Abschluss warten und MP4 speichern

Das Skript folgt dem dokumentierten asynchronen Ablauf: Es erstellt den Job mit POST /v1/videos und liest .id, fragt GET /v1/videos/{id} ab und ruft GET /v1/videos/{id}/content erst auf, wenn status den Wert completed hat. Das offizielle Cookbook behandelt failed als terminalen Fehler; jeder andere nicht leere Status bleibt in der Warteschleife.

set -euo pipefail

BASE_URL="${BASE_URL:-http://127.0.0.1:30010}"
FIRST_URI="${FIRST_URI:-file://$(realpath first.png)}"
LAST_URI="${LAST_URI:-file://$(realpath last.png)}"
PROMPT_FILE="${PROMPT_FILE:-prompt.txt}"
OUTPUT_FILE="${OUTPUT_FILE:-fl2va.mp4}"

payload=$(
  jq -n \
    --rawfile prompt "$PROMPT_FILE" \
    --arg first "$FIRST_URI" \
    --arg last "$LAST_URI" \
    '{
      model: "MiniMaxAI/MiniMax-H3",
      task: "fl2va",
      prompt: $prompt,
      seconds: 8,
      conditions: [
        {
          type: "image",
          uri: $first,
          role: "keyframe",
          frame_index: 0
        },
        {
          type: "image",
          uri: $last,
          role: "keyframe",
          frame_index: -1
        }
      ],
      target: {
        short_edge: 768,
        aspect_ratio: "auto",
        duration_seconds: 8
      },
      seed: 0
    }'
)

response=$(
  curl --fail-with-body --silent --show-error \
    --request POST \
    --url "$BASE_URL/v1/videos" \
    --header 'Content-Type: application/json' \
    --data-binary "$payload"
)

video_id=$(printf '%s\n' "$response" | jq -er '.id')
printf 'video_id=%s\n' "$video_id"

while true; do
  task_json=$(
    curl --fail-with-body --silent --show-error \
      --request GET \
      --url "$BASE_URL/v1/videos/$video_id"
  )
  status=$(printf '%s\n' "$task_json" | jq -er '.status')
  printf 'status=%s\n' "$status"

  case "$status" in
    completed)
      break
      ;;
    failed)
      printf '%s\n' "$task_json" | jq .
      exit 1
      ;;
    *)
      sleep 1
      ;;
  esac
done

curl --fail-with-body --silent --show-error --location \
  --request GET \
  --url "$BASE_URL/v1/videos/$video_id/content" \
  --output "$OUTPUT_FILE"

test -s "$OUTPUT_FILE"

if command -v ffprobe >/dev/null 2>&1; then
  ffprobe -v error \
    -show_entries stream=codec_type,codec_name,r_frame_rate,sample_rate,channels \
    -of default=noprint_wrappers=1 \
    "$OUTPUT_FILE"
fi

printf 'saved=%s\n' "$OUTPUT_FILE"

curl --fail-with-body bricht bei einer Nicht-2xx-Antwort ab, und jq -e schlägt fehl, wenn .id oder .status fehlt. Bei failed gibt das Skript das vollständige Job-JSON aus und endet mit einem Fehlercode; zum Erfolg gehören außerdem ein erfolgreicher Download und eine nicht leere MP4-Datei.

Ist ffprobe installiert, zeigt das Skript auch die Medienströme an. Der dokumentierte SGLang-Ausgabevertrag ist eine MP4 mit H.264-Video bei 24 FPS und einer AAC-Stereospur mit 32 kHz. Meldet der Job completed, die Datei ist aber leer, nicht dekodierbar oder hat unerwartete Eigenschaften, beginnen Sie den gehosteten Vergleich noch nicht. Prüfen Sie zuerst das SGLang-Protokoll, die serverseitig sichtbaren Bild-URIs und das Anfrage-JSON.

Felder und Endpoints stammen aus dem offiziellen reproduzierbaren FL2VA-Skript von MiniMax, dem SGLang-Cookbook zu MiniMax-H3 und dem SGLang-Leitfaden zur Video-API. Der vollständig lokale Pfad endet hier mit einer H3-Base-MP4 in 768p; vollständiges 2K bleibt der zuvor beschriebene Hybridpfad.

Schritt 5: erst nach stabiler lokaler Kette mit gehostetem H3 vergleichen

Vergleichen Sie keine Qualität, solange der lokale Pfad noch fehlschlägt. Sonst lassen sich Bereitstellungsfehler, Eingabeunterschiede und Modellverhalten nicht trennen. Ändern Sie nur den Ausführungsort:

  1. Laden Sie byteidentische Start- und Endbilder hoch und prüfen Sie die Hashes.
  2. Verwenden Sie denselben Prompt, dieselbe Dauer, dasselbe Seitenverhältnis, dieselbe Sprache und Audioabsicht.
  3. Protokollieren Sie, ob Web/API den Prompt umschreibt, einen Seed zeigt oder H3-Context-IR verwendet.
  4. Bewahren Sie Originalausgaben auf; vor dem Vergleich weder schneiden noch neu kodieren oder Musik hinzufügen.
  5. Verbergen Sie die Herkunftsbezeichnung und bewerten Sie blind, damit Erwartungen wie „lokal muss besser sein“ oder „bezahlt muss besser sein“ weniger Einfluss haben.

Für einen Kostenvergleich erfassen Sie API-Rechnung, Maschinenbelegung und Stromverbrauch. Die Bezeichnungen „lokal“ und „bezahltes Web“ zeigen allein nicht, welcher Pfad für Ihre Last günstiger ist.

Schritt 6: mit einer Skala den passenden Pfad für Ihre Einstellungen wählen

Prüfen Sie zuerst, ob der Clip die kreative Aufgabe erfüllt, und vergleichen Sie erst danach Zeit und Hardware. Höhere Auflösung hilft wenig, wenn das Ergebnis ständig unerwünschte Schnitte einfügt.

KriteriumPrüfungZu protokollieren
Treue zum StartbildBleiben Motiv, Komposition und Schlüsselobjekte erhalten oder werden sie sofort ersetzt?Abweichung und Zeitcode
Erreichen des EndbildsErreicht der Clip den Endzustand natürlich oder springt er abrupt zum Endbild?Endzustand und Übergangsqualität
Kontinuität einer EinstellungGibt es unerwünschte Schnitte, Teleportationen, Szenenersatz oder Zeitsprünge?Schnittzeiten und Vorher-/Nachher-Bilder
Identitäts- und HintergrundstabilitätBleiben Gesicht, Kleidung, Hände, Requisiten und Hintergrundgeometrie stabil?Betroffenes Element und Dauer
BewegungsablaufBewegen sich Motiv und Kamera in vereinbarter Reihenfolge und Richtung?Richtungsfehler, Geschwindigkeitssprung oder Stillstand
AudioIst bei angefordertem Ton eine synchrone Spur ohne Knackser oder Fremdinhalte vorhanden?Medieneigenschaften, Versatz und auffälliger Abschnitt
AusgabespezifikationEntsprechen Dauer, Seitenverhältnis, FPS und Auflösung den Einstellungen?Tatsächliche Metadaten
LaufzeitressourcenWanduhrzeit, Spitzenspeicher des Beschleunigers, RAM und WiederholungenRohprotokolle je Lauf, keine Schätzungen
WiederholbarkeitTritt dasselbe Problem bei erneutem kontrolliertem Eingang auf?Wiederholte Ergebnisse und sichtbare Zufallsparameter

MiniMax gibt an, dass H3 32-kHz-Stereo erzeugen kann. Wassermans Beiträge sagen nicht, ob Audio aktiviert, erhalten oder nachbearbeitet wurde. Die eigene Ausgabe darf geprüft werden; der Fall ist jedoch keine Validierung der Audioqualität.

Die vorgelagerte Schicht korrigieren statt alles neu zu starten

Ein falsches Startbild gehört zu Qwen, ein Kontinuitätsproblem zu H3 und ein Auflösungsfehler beginnt mit der Wahl zwischen lokalem 768p und hybridem 2K. Schichtweise Diagnose spart mehr Zeit als gleichzeitige Änderungen aller Parameter.

SymptomZuerst prüfenMaßnahme
Das Startbild ist bereits falschQwen-BildstufePrompt, Referenzen und Seed korrigieren statt eine fehlerhafte Komposition in H3 zu reparieren
Identität oder Hintergrund wechseln im EndbildQwen-ÜbergabeobjektVom Startbild aus bearbeiten, Änderungen reduzieren und stabile Referenzen wiederverwenden
Ein unerwarteter Schnitt erscheintH3-Prompt und BewegungsregelnEine durchgehende Einstellung verlangen, Montage-/Mehrszenen-Sprache entfernen und mit denselben Hashes wiederholen
Der Clip erreicht den Endzustand nichtDauer oder BewegungsplanAktionskette verkürzen und Start–Ablauf–Ende klar definieren
Audio fehlt oder passt nichtH3-Variante, Client und ContainerAudio-Video-Checkpoint und Anfragepfad prüfen; Läufe ohne vergleichbares Audio als nicht vergleichbar markieren
Qwen hat zu wenig SpeicherBildbereitstellungDokumentiertes CPU-Offload testen und Zeitwirkung messen; kein universelles Mindest-VRAM ableiten
H3 startet auf der Hardware nichtH3-BereitstellungFramework-Leitfaden befolgen; das offizielle Beispiel nutzt vier GPUs, Consumer-Hardware ist nicht garantiert
Lokal endet bei 768p, 2K verlangt APIWorkflow-GrenzeDas ist die dokumentierte Architektur, kein Fehler; 768p akzeptieren oder hybrides 2K wählen
Lokale und gehostete Ergebnisse weichen stark abEingaben und VorverarbeitungPrompt-Umschreibung, Context-IR, Seed, Dauer, Format und Neukodierung prüfen, bevor das Modell verantwortlich gemacht wird

Lokales oder gehostetes H3 für den Dauerbetrieb wählen

Entscheiden Sie anhand Ihres Einstellungssatzes, nicht anhand des schönsten Einzelbeispiels. Decken Sie statische Kamera, menschliche Bewegung, Objektverwandlung, Dialog und Atmosphäre ab und bewahren Sie Erfolge wie Fehler; trennen Sie diese Messwerte:

  • Clipdauer, etwa die ungefähr acht Sekunden des öffentlichen Beispiels;
  • Generierungszeit, also die Zeit von der Einreichung bis zur fertigen Datei, die dort nicht genannt wird;
  • Modellspezifikationen aus der Herstellerdokumentation;
  • tatsächliche Hardwarenutzung, auf Ihrem System gemessen statt aus dem Gerätenamen geraten;
  • eine visuelle Beurteilung, die diesen Lauf beschreibt, aber keine allgemeine Gewinnrate ergibt.

Müssen Dateien auf Ihrer Maschine bleiben, behalten Sie lokales 768p als Standard. Muss die finale Ausgabe 2K sein und sind entfernte APIs akzeptabel, wählen Sie hybrides 2K. Ist Kontinuität am wichtigsten, bewerten Sie lokales und gehostetes H3 blind mit demselben Einstellungssatz und bevorzugen Sie den Pfad, der Ihre Skala konsistenter besteht. Der öffentliche Fall zeigt, dass der lokale Pfad läuft und in einem Test einen Schnitt vermied; er ersetzt keine Wiederholungen.

Diese acht Punkte vor dem Lauf prüfen

  • Der Lauf ist entweder als „vollständig lokal 768p“ oder „hybrid 2K“ bezeichnet.
  • Qwen-Modell, Prompts, Seeds, Maße und Referenzen sind für beide Bilder erfasst.
  • Bilder und Prompt sind gehasht; beide H3-Läufe verwenden dieselben Eingaben.
  • Der lokale Lauf nutzt fl2va und wird zunächst als H3-Base-768p-Ergebnis abgenommen.
  • Umschreibungen und verborgene Parameter des gehosteten Dienstes sind ehrlich dokumentiert.
  • Originalvideos bleiben unbearbeitet und werden mit derselben Kontinuitäts-, Schnitt-, Audio- und Spezifikationsskala bewertet.
  • Zeit, Spitzenspeicher, Wiederholungen und Fehler stammen aus Protokollen.
  • Aussagen sind auf getestete Beispiele, Hardware und Prüftag begrenzt.

Fazit

Die Standardempfehlung ist klar: Start- und Endbild lokal mit Qwen Image 2.1 erstellen und danach lokales 768p mit MiniMax H3-Base fl2va nachweisen. Wechseln Sie nur bei zwingender 2K-Lieferung und akzeptablen entfernten APIs zu H3-Context-IR → lokalem H3-Base → H3-Regenerate-2K.

Frieren Sie in beiden Fällen Bilder, Prompt, Dauer und Seitenverhältnis ein und vergleichen Sie Kontinuität, unerwünschte Schnitte, Audio, Zeit und Hardwarenutzung mit identischen Eingaben. So wird aus einer schönen Demonstration ein prüfbarer Arbeitsablauf, den Sie bewusst übernehmen können.

Referenzen

Fakten geprüft am 26. September 2026.

Bereit, Ihren LLM-Workflow zu optimieren?

Verbinden Sie Modelle über eine API, verwalten Sie Schlüssel und behalten Sie KI-Kosten im Blick.

Kostenlos starten