초대하고 적립

초대 보상 안내

초대 링크를 공유하세요. 친구가 링크로 가입하고 충전하면 이후 충전마다 표시된 보상을 받을 수 있습니다.

Qwen Image 2.1 + MiniMax H3: 로컬 시작·끝 프레임 비디오 파이프라인

완전 로컬 768p와 하이브리드 2K를 선택하는 조건, Qwen 프레임 생성, H3-Base 로컬 실행, 동일 입력의 호스팅 비교, 실패 원인 분리를 설명합니다.

목차
Qwen Image 2.1 + MiniMax H3: 로컬 시작·끝 프레임 비디오 파이프라인

Qwen으로 시작 프레임과 끝 프레임을 잘 만들더라도, 진짜 어려운 문제는 H3가 두 프레임 사이를 하나의 연속 숏으로 연결하느냐입니다. 인물이나 배경을 바꾸지 않고, 원치 않는 컷을 넣지 않으며, API에 의존하는 2K 경로를 “로컬”이라고 부르지 않아야 합니다. 먼저 완전 로컬 768p를 성립시킨 뒤 실제 납품 요건이 있을 때만 하이브리드 2K로 전환하고, 같은 입력으로 로컬 H3와 호스팅 H3를 비교하는 방법을 설명합니다.

먼저 결론: 2K가 꼭 필요하지 않다면 로컬 768p부터 시작한다

프레임 전달을 검증하거나, 자산을 자신의 장비에 두거나, 원치 않는 컷의 원인을 찾는 것이 목적이라면 완전 로컬 768p를 먼저 선택하십시오. 최종 납품에 2K가 필수이고 H3-Context-IR 및 H3-Regenerate-2K의 원격 API 호출을 허용할 수 있을 때만 하이브리드 2K를 선택합니다.

목표먼저 선택할 경로이유권장안이 바뀌는 조건
전체 체인이 동작하는지 확인완전 로컬 768p변수가 적어 Qwen 문제와 H3 문제를 분리하기 쉽다768p가 안정되고 납품에 실제로 2K가 필요할 때
자산을 자신의 장비 밖으로 보내지 않기완전 로컬 768pQwen 프레임과 H3-Base를 로컬에 둘 수 있다2K가 필수이면서 원격 API가 금지된다면 문서화된 전체 2K 경로는 조건을 충족하지 않으므로 다른 로컬 2K 수단이 필요하다
최종 영상을 2K로 납품하이브리드 2K공식 전체 2K 경로는 두 호스팅 모듈에 의존한다자산을 원격으로 보낼 수 없으면 768p 또는 다른 방식으로 돌아간다
로컬 H3와 호스팅 H3 중 선택먼저 로컬 768p를 성립시킨 뒤 페어 비교그렇지 않으면 배포 오류와 모델 품질이 섞인다여러 숏 유형에서 반복한 뒤 장기 경로를 정한다

GPU 이름만 보고 호환성을 약속하지 마십시오. MiniMax의 SGLang 예제는 GPU 4개를 사용하고 공개 실행은 DGX Spark였지만, 둘 다 최소 VRAM을 제시하거나 일반 소비자 GPU 동작을 증명하지 않습니다.

실제로 자신의 장비에 남길 수 있는 단계

Qwen 프레임 생성과 H3-Base 768p는 로컬로 유지할 수 있지만, 공식 전체 2K 경로는 그렇지 않습니다.

단계로컬 실행 가능 여부문서화된 경계
Qwen Image 2.1로 시작·끝 프레임 생성 및 편집가능공식 저장소는 QwenImage21Pipeline, 로컬 Diffusers 예제, 네이티브 2K 크기, 최대 10개 참조 이미지를 제공
MiniMax H3-Base로 시작·끝 프레임을 오디오·비디오로 변환가능공개 FL2VA 체크포인트는 이미지 0개, 1개, 2개를 받으며, 2개는 시작·끝 프레임 모드가 된다. 로컬 검증 출력은 768p
H3-Context-IR공식 전체 구현의 로컬 실행은 불가MiniMax는 이를 호스팅 전처리·오케스트레이션 시스템으로 설명하며 오픈 릴리스에 포함하지 않았다. API를 쓰거나 prompting guide를 바탕으로 자체 전처리를 구성해야 함
H3-Regenerate-2K현재 공개 구성요소만으로는 불가모듈은 아직 오픈소스가 아니며 공식 전체 2K 워크플로에서 API로 호출
호스팅 H3 비교불가Web/API 실행은 원격이며 동일 입력의 대조군으로만 사용

MiniMax는 출력 길이 4–15초, 24 FPS, 32 kHz 스테레오, 기본 짧은 변 768픽셀도 문서화합니다. 2K는 H3-Regenerate-2K가 만듭니다. 이는 모델의 사양 경계이지, 모든 설정이 사용자의 하드웨어에서 동작한다는 보장은 아닙니다.

공개 테스트 하나는 실행 가능성을 보여 줄 뿐, 보편적 승자를 정하지 않는다

이 사례는 비교 설계의 참고로 사용하고, 로컬 H3가 항상 더 낫다는 결론으로 사용하지 마십시오.

영상 제작자 Sam Wasserman은 DGX Spark에서 Qwen Image 2.1과 MiniMax H3를 사용한 로컬 “아이디어→이미지→비디오” 실행을 게시했습니다. 첨부 결과는 약 8초입니다. 후속 글에서는 같은 prompt, 같은 specifications, 같은 시작·끝 프레임을 유료 Web H3에 다시 사용했다고 밝혔습니다. 그의 판단으로는 웹 결과에 원치 않는 컷이 추가됐고, 로컬 결과는 의도한 순서를 유지했습니다.

이는 실행 가능성을 보여 주는 사례이자 유용한 비교 설계입니다. 그러나 로컬 H3가 일반적으로 더 낫다는 증거는 아닙니다. 게시물에는 설치 명령, 최대 메모리, 생성 시간, 오디오 처리, seed, 실패 시도가 공개되지 않았습니다. 동일 저자가 한 입력을 평가한 것이며 독립 재현도 아닙니다.

1단계: 아이디어를 하나의 연속 숏으로 줄이기

장소 하나, 동작 흐름 하나, 최종 상태 하나만 요구하십시오. 이를 숏 계약, 즉 지시와 결과를 확인할 수 있는 짧은 사양으로 작성합니다.

항목정의할 내용
주체와 배경사람, 사물, 의상, 배경, 유지해야 할 정체성 특징
시작 상태시작 프레임의 위치, 자세, 시선, 카메라 거리, 구도, 조명
끝 상태마지막에 허용되는 변화만 정의. 주체·장소·카메라 위치를 동시에 바꾸지 않기
이동 경로주체와 카메라의 움직임, 행동 순서
연속성 제약“하나의 연속 숏”, “컷 없음”, “순간이동 없음” 같은 명시적 조건
출력 사양길이, 화면비, 대사·환경음·음악 필요 여부
금지 요소불필요한 인물, 자막, 장면 전환, 배경 교체, 추가 행동

원치 않는 컷을 검출하려는 시험이라면 한 prompt에 여러 장소, 시간대, 몽타주를 요구하지 마십시오. 그렇지 않으면 컷이 모델 오류가 아니라 지시의 합리적 해석일 수 있습니다.

예를 들어 “문에서 테이블까지 걸어가 컵을 들고, 컷은 없다”는 시작·끝 프레임 테스트에 적합합니다. “거리에서 사무실로 이동하고 어린 시절을 회상한다”는 여러 장면이 자연스럽게 필요하므로 원치 않는 컷을 깨끗하게 시험할 수 없습니다.

2단계: 시작 프레임을 만든 뒤 편집해서 끝 프레임 만들기

서로 독립적인 두 prompt로 두 이미지를 만들지 말고, 시작 프레임을 편집해 끝 프레임을 만드십시오. H3를 시작하기 전부터 인물, 의상, 구도, 배경을 유지하기 쉬워집니다.

공식 모델 ID는 Qwen/Qwen-Image-2.1입니다. Qwen은 7B 시각 생성 구성요소, 로컬 Diffusers, 생성과 편집, 네이티브 2K, 최대 10개 참조 이미지를 문서화합니다.

pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
pip install git+https://github.com/huggingface/diffusers
from pathlib import Path

import torch
from diffusers import QwenImage21Pipeline

first_prompt = Path("first_prompt.txt").read_text(encoding="utf-8").strip()
last_edit_prompt = Path("last_edit_prompt.txt").read_text(encoding="utf-8").strip()

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

first = pipe(
    prompt=first_prompt,
    width=2752,
    height=1536,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]
first.convert("RGB").save("first.png")

last = pipe(
    prompt=last_edit_prompt,
    image=first,
    width=2752,
    height=1536,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(43),
).images[0]
last.convert("RGB").save("last.png")

이 코드는 공식 생성 인터페이스와 단일 이미지 편집을 결합하며 first_prompt와 last_edit_prompt는 사용자가 제공합니다. 문서화된 16:9 2K 크기 2752 × 1536, 40 steps, 불투명 RGB PNG를 사용합니다. H3의 공개 설명은 이 전달에서 alpha 채널 처리를 명시하지 않으므로, RGBA를 별도로 검증하지 않았다면 불투명 프레임으로 변수 하나를 줄일 수 있습니다.

최소한 다음을 기록합니다.

  • 모델 ID, framework version, 시작 prompt, 끝 편집 prompt
  • 두 seed, width, height, inference steps, 참조 이미지 목록
  • 두 파일의 SHA-256, 픽셀 크기, color mode
  • 인물, 의상, 구도, 조명, 배경의 일관성
  • 끝 프레임이 최종 상태만 보여 주고 전체 동작을 한 장에 넣지 않았는지

Qwen은 제한된 GPU 메모리를 위해 enable_model_cpu_offload()도 문서화합니다. 이는 offload 경로가 있다는 뜻이지, 최소 VRAM이나 속도를 보장한다는 뜻은 아닙니다.

3단계: 로컬 H3와 호스팅 H3에 같은 입력 제공하기

두 화면에 기억으로 파라미터를 다시 입력하지 마십시오. 이미지, prompt, 출력 설정을 하나의 manifest에 저장합니다. seed, 길이, 재작성된 prompt가 하나만 달라도 전체 비교가 무의미해질 수 있습니다.

experiment_id: "qwen-h3-001"
qwen_model: "Qwen/Qwen-Image-2.1"
h3_model: "MiniMaxAI/MiniMax-H3"
h3_variant: "fl2va"
prompt_file: "prompt.txt"
first_frame: "first.png"
last_frame: "last.png"
prompt_sha256: "<sha256>"
first_frame_sha256: "<sha256>"
last_frame_sha256: "<sha256>"
duration_seconds: "<same value>"
aspect_ratio: "<same value>"
local_seed: "<record if exposed>"
hosted_seed: "<record or not_exposed>"

로컬과 호스팅 실행 모두 이 기록을 읽어야 합니다. 호스팅 UI가 seed를 숨기거나 prompt를 재작성하거나 길이를 제한하면 not_exposed라고 기록하거나 재작성된 prompt를 저장합니다. 검증할 수 없는 값을 동일하다고 가정하지 마십시오. 보이는 입력이 통제돼야 결과 차이를 해석할 수 있습니다.

4단계: 먼저 H3-Base 로컬 768p를 성립시키기

2K를 생각하기 전에 768p 결과부터 검수하십시오. Qwen 정지 이미지가 2K라고 해서 로컬 H3-Base 비디오가 2K가 되는 것은 아닙니다.

MiniMax는 작업별 체크포인트 두 개를 공개합니다. 여기서는 MiniMax-H3 Base FL2VA를 사용하며, 텍스트, 시작 프레임, 끝 프레임 또는 두 프레임에서 BF16 오디오·비디오를 생성합니다. 공식 다운로드와 SGLang 예제는 다음과 같습니다.

hf download MiniMaxAI/MiniMax-H3 \
  --include "FL2VA/*" \
  --local-dir MiniMax-H3

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

두 번째 명령은 MiniMax의 GPU 4개 예제입니다. Wasserman이 공개한 DGX Spark 설정도 아니고 최소 요구사항도 아닙니다. 선택한 framework 문서에 따라 조정하고 모든 변경을 기록하십시오. 모든 장비에서 실행된다는 증거로 사용해서는 안 됩니다.

SGLang 프로세스에서 두 프레임을 볼 수 있게 만들기

FL2VA의 conditions에는 role: "keyframe" 이미지 한 장 또는 두 장을 넣을 수 있습니다. SGLang 공식 H3 가이드는 frame_index: 0을 시작 프레임, frame_index: -1을 끝 프레임, [0, -1]을 시작·끝 프레임 조합으로 정의합니다. MiniMax 재현 스크립트는 시작 프레임 한 장 형식을 보여 주므로, 아래 요청은 같은 fields에 두 이미지를 넣습니다.

file:// URI는 curl을 실행하는 터미널이 아니라 SGLang 서버 프로세스가 해석합니다. 둘이 같은 호스트에 있으면 realpath의 절대 경로를 사용할 수 있습니다. SGLang이 컨테이너나 다른 머신에서 실행되면 두 파일을 그 환경에 mount 또는 copy하고, FIRST_URI와 LAST_URI를 서버가 실제로 읽을 수 있는 경로로 바꾸십시오.

숏 계약은 prompt.txt에 저장합니다. 완전 로컬 768p에서는 직접 정리한 구조화 prompt를 사용할 수 있습니다. 하이브리드 2K 경로에서는 H3-Context-IR 결과를 같은 prompt field에 넣고, H3-Base 출력을 H3-Regenerate-2K로 보냅니다.

FL2VA를 제출하고 완료를 기다린 뒤 MP4 저장하기

아래 스크립트는 문서화된 비동기 lifecycle을 따릅니다. POST /v1/videos로 job을 만들고 .id를 읽은 뒤 GET /v1/videos/{id}를 poll하며, status가 completed가 된 뒤에만 GET /v1/videos/{id}/content를 호출합니다. 공식 cookbook은 failed를 종료 실패로 처리하며, 그 밖의 비어 있지 않은 status에서는 계속 기다립니다.

set -euo pipefail

BASE_URL="${BASE_URL:-http://127.0.0.1:30010}"
FIRST_URI="${FIRST_URI:-file://$(realpath first.png)}"
LAST_URI="${LAST_URI:-file://$(realpath last.png)}"
PROMPT_FILE="${PROMPT_FILE:-prompt.txt}"
OUTPUT_FILE="${OUTPUT_FILE:-fl2va.mp4}"

payload=$(
  jq -n \
    --rawfile prompt "$PROMPT_FILE" \
    --arg first "$FIRST_URI" \
    --arg last "$LAST_URI" \
    '{
      model: "MiniMaxAI/MiniMax-H3",
      task: "fl2va",
      prompt: $prompt,
      seconds: 8,
      conditions: [
        {
          type: "image",
          uri: $first,
          role: "keyframe",
          frame_index: 0
        },
        {
          type: "image",
          uri: $last,
          role: "keyframe",
          frame_index: -1
        }
      ],
      target: {
        short_edge: 768,
        aspect_ratio: "auto",
        duration_seconds: 8
      },
      seed: 0
    }'
)

response=$(
  curl --fail-with-body --silent --show-error \
    --request POST \
    --url "$BASE_URL/v1/videos" \
    --header 'Content-Type: application/json' \
    --data-binary "$payload"
)

video_id=$(printf '%s\n' "$response" | jq -er '.id')
printf 'video_id=%s\n' "$video_id"

while true; do
  task_json=$(
    curl --fail-with-body --silent --show-error \
      --request GET \
      --url "$BASE_URL/v1/videos/$video_id"
  )
  status=$(printf '%s\n' "$task_json" | jq -er '.status')
  printf 'status=%s\n' "$status"

  case "$status" in
    completed)
      break
      ;;
    failed)
      printf '%s\n' "$task_json" | jq .
      exit 1
      ;;
    *)
      sleep 1
      ;;
  esac
done

curl --fail-with-body --silent --show-error --location \
  --request GET \
  --url "$BASE_URL/v1/videos/$video_id/content" \
  --output "$OUTPUT_FILE"

test -s "$OUTPUT_FILE"

if command -v ffprobe >/dev/null 2>&1; then
  ffprobe -v error \
    -show_entries stream=codec_type,codec_name,r_frame_rate,sample_rate,channels \
    -of default=noprint_wrappers=1 \
    "$OUTPUT_FILE"
fi

printf 'saved=%s\n' "$OUTPUT_FILE"

curl --fail-with-body는 2xx가 아닌 응답에서 중단하고, .id 또는 .status가 없으면 jq -e가 실패합니다. failed이면 스크립트가 전체 job JSON을 출력한 뒤 0이 아닌 코드로 종료합니다. 성공 경로에서도 content 다운로드가 성공하고 MP4가 비어 있지 않아야 합니다.

ffprobe가 설치되어 있으면 media stream도 출력합니다. SGLang이 문서화한 출력 contract는 H.264 비디오 24 FPS와 AAC 스테레오 32 kHz 트랙이 들어 있는 MP4입니다. job이 completed인데도 파일이 비어 있거나 decode되지 않거나 media 속성이 예상과 다르면 호스팅 비교로 넘어가지 말고 SGLang log, 서버에서 보이는 이미지 URI, 요청 JSON을 먼저 확인하십시오.

fields와 endpoints는 MiniMax 공식 재현용 FL2VA 스크립트, SGLang MiniMax-H3 cookbook, SGLang video API 가이드를 근거로 합니다. 완전 로컬 경로는 여기서 H3-Base 768p MP4를 얻으며 끝나고, 완전한 2K는 앞서 설명한 하이브리드 경로를 따릅니다.

5단계: 로컬 체인이 안정된 뒤 호스팅 H3와 비교하기

로컬 체인이 아직 실패하는 동안 품질을 비교하지 마십시오. 배포 오류, 입력 차이, 모델 동작을 분리할 수 없게 됩니다. 실행 위치만 바꿉니다.

  1. 바이트가 동일한 두 프레임을 업로드하고 hash를 확인합니다.
  2. 같은 prompt, 길이, 화면비, 언어, 오디오 의도를 사용합니다.
  3. Web/API가 prompt를 재작성하는지, seed를 노출하는지, H3-Context-IR을 쓰는지 기록합니다.
  4. 원본 출력을 보존하고 비교 전에 편집·재인코딩·음악 추가를 하지 않습니다.
  5. 출처 표시를 가리고 블라인드 평가하여 “로컬이 더 좋다” 또는 “유료가 더 좋다”는 기대를 줄입니다.

비용을 비교하려면 실제 API 청구액, 장비 점유 시간, 전력 사용량을 기록하십시오. “로컬”과 “유료 Web”이라는 이름만으로는 자신의 작업에서 어느 쪽이 더 저렴한지 알 수 없습니다.

6단계: 하나의 평가표로 자신의 숏에 맞는 경로 선택하기

먼저 영상이 창작 작업을 완료했는지 확인하고, 그다음 시간과 하드웨어를 비교하십시오. 해상도가 더 높아도 원치 않는 컷이 반복되면 제작에는 더 나쁜 선택일 수 있습니다.

기준확인 방법기록할 내용
시작 프레임 충실도시작이 주체, 구도, 핵심 물체를 유지하는가, 즉시 다른 화면으로 바꾸는가편차와 시각
끝 프레임 도달지정한 최종 상태로 자연스럽게 가는가, 끝 이미지로 갑자기 전환하는가최종 상태와 전환 품질
단일 숏 연속성요청하지 않은 컷, 순간이동, 장면 교체, 시간 점프가 있는가컷 시각과 전후 캡처
인물·배경 안정성얼굴, 의상, 손, 소품, 배경 구조가 안정적인가영향을 받은 대상과 지속 시간
이동 경로주체와 카메라가 합의한 순서·방향으로 움직이는가방향 오류, 속도 점프, 멈춤
오디오요청한 경우 트랙이 있고 동기화되며 팝 노이즈나 무관한 내용이 없는가미디어 정보, 동기화 오차, 이상 구간
출력 사양길이, 화면비, FPS, 해상도가 설정과 맞는가실제 metadata
실행 자원wall-clock 생성 시간, 최대 accelerator memory, system memory, retries추정이 아닌 각 실행의 raw log
반복성같은 통제 입력을 다시 실행할 때 문제가 반복되는가반복 결과와 공개된 random parameters

MiniMax는 H3가 32 kHz 스테레오를 생성할 수 있다고 설명합니다. Wasserman의 게시물은 오디오를 켰는지, 보존했는지, 후처리했는지 밝히지 않습니다. 자신의 출력을 검사할 수는 있지만 그 사례를 음질 검증으로 인용할 수는 없습니다.

전체를 다시 돌리지 말고 상위 단계부터 고치기

시작 프레임 오류는 Qwen, 연속성 문제는 H3, 해상도 불일치는 로컬 768p와 하이브리드 2K 선택부터 확인합니다. 계층별 진단이 모든 파라미터를 동시에 바꾸는 것보다 빠릅니다.

증상먼저 확인할 계층조치
시작 프레임부터 잘못됨Qwen 이미지 단계H3에서 보정하지 말고 prompt, 참조, seed를 수정
끝 프레임에서 인물이나 배경이 바뀜Qwen 전달 자산독립 생성 대신 시작 프레임에서 편집하고 변화 수를 줄이며 안정적 참조 재사용
예상치 못한 컷이 생김H3 prompt와 동작 제약하나의 연속 숏을 명시하고 몽타주·다중 장면 표현을 제거한 뒤 같은 hash로 재실행
최종 상태에 도달하지 않음길이 또는 동작 계획행동 사슬을 줄이고 시작–과정–끝 순서를 명확히 함
오디오가 없거나 맞지 않음H3 변형, client, container오디오·비디오 체크포인트와 요청 경로를 확인하고 동등한 오디오가 없으면 비교 불가로 표시
Qwen 메모리 부족이미지 배포공식 CPU offload를 시도하고 속도 영향을 측정. 보편적인 최소 VRAM을 추정하지 않음
현재 장비에서 H3가 시작되지 않음H3 배포framework 배포 가이드 확인. 공식 예제는 GPU 4개이며 소비자 장비는 보장되지 않음
로컬은 768p이고 2K에 API가 필요워크플로 경계문서화된 구조이며 오류가 아님. 768p를 수용하거나 하이브리드 2K 선택
로컬과 호스팅 결과가 크게 다름입력과 전처리prompt 재작성, Context-IR, seed, 길이, 화면비, 재인코딩을 먼저 확인

장기 사용에서 로컬 H3와 호스팅 H3를 고르는 방법

가장 잘 나온 한 샘플이 아니라 자신의 숏 집합으로 결정하십시오. 고정 카메라, 사람 동작, 물체 변형, 대사, 환경음을 포함하고 성공과 실패를 모두 보존하며 다음 값을 분리해 기록합니다.

  • 클립 길이: 공개 사례의 약 8초 같은 값
  • 생성 시간: 제출부터 파일 완성까지의 wall-clock 시간. 사례에서는 미공개
  • 모델 사양: 공급자 문서가 지원하는 범위
  • 실제 하드웨어 사용량: 장비 이름에서 추정하지 않고 직접 측정한 값
  • 한 번의 시각 평가: 그 실행은 설명하지만 전체 승률로 바꿀 수 없음

자산을 자신의 장비 밖으로 보낼 수 없다면 로컬 768p를 기본으로 유지하십시오. 최종 납품에 2K가 필수이고 원격 API가 허용된다면 하이브리드 2K를 선택합니다. 연속성이 가장 중요하다면 같은 숏 집합에서 로컬 H3와 호스팅 H3를 블라인드 평가하고, 평가표를 더 안정적으로 통과하는 경로를 우선하십시오. 공개 사례는 로컬 경로가 동작하고 동일 입력 한 번에서 원치 않는 컷을 피했다는 점만 보여 주며 반복 테스트를 대신하지 않습니다.

실행 전에 확인할 8가지

  • 실행을 “완전 로컬 768p” 또는 “하이브리드 2K” 중 하나로 표시했다.
  • 두 프레임의 Qwen 모델, prompts, seeds, 크기, 참조를 기록했다.
  • 이미지와 prompt에 hash가 있고 두 H3 실행이 같은 입력을 사용한다.
  • 로컬 실행은 fl2va를 사용하고 먼저 H3-Base 768p 결과로 검수한다.
  • 호스팅의 prompt 재작성과 숨겨진 parameters를 사실대로 기록했다.
  • 원본 비디오는 편집하지 않고 같은 연속성·컷·오디오·사양 표로 평가한다.
  • 시간, 최대 메모리, retries, failures는 로그에서 가져왔다.
  • 결론을 테스트 샘플, 하드웨어, 확인 날짜에 한정했다.

결론

기본 권장안은 분명합니다. Qwen Image 2.1로 시작·끝 프레임을 로컬 생성하고, MiniMax H3-Base fl2va로 로컬 768p를 먼저 성립시키십시오. 2K가 필수이고 원격 API를 허용할 수 있을 때만 H3-Context-IR → 로컬 H3-Base → H3-Regenerate-2K로 전환합니다.

어느 경로를 선택하든 프레임, prompt, 길이, 화면비를 고정하고 같은 입력으로 연속성, 원치 않는 컷, 오디오, 시간, 하드웨어 사용량을 비교하십시오. 그러면 보기 좋은 데모가 검증하고 비교해 채택 여부를 결정할 수 있는 작업 흐름이 됩니다.

참고 링크

사실 확인일: 2026년 9월 26일.

LLM 워크플로를 최적화할 준비가 되셨나요?

하나의 API로 모델을 연결하고 키와 AI 비용을 관리하세요.

무료로 시작하기