코딩용 Qwen3.8-Max: 가격, 벤치마크, 도구 설정

코딩에서 Qwen3.8-Max를 평가하기 위한 API 가격, 벤치마크, Qwen Code 및 Claude Code 설정과 Hosted Model ID와 공개 weights의 차이입니다.

Qwen3.8-Max의 stable release는 2026년 8월 3일 Hosted Model ID qwen3.8-max로 나왔습니다. 8월 13일에는 Qwen이 Qwen3.8-2.4T-A95B weights도 공개했습니다. 이 둘은 서로 다른 배포 경로를 뜻합니다. 전자는 API provider의 model field에 넣고, 후자는 자체 inference를 위한 weights repository를 가리킵니다.

자체 GPU infrastructure를 운영하지 않고 Hosted model을 시험하고 싶다면, 8월 13일 BetterToken catalog에는 qwen3.8-max가 input 100만 token당 1.84,output100token1.84, output 100만 token당 5.52로 표시되어 있었습니다. 자신의 API Key를 만들고 짧은 request를 실행한 뒤 Workspace에서 Model ID와 usage를 확인하세요. 이는 날짜가 있는 price snapshot이므로 production 사용 전 catalog를 다시 확인해야 합니다.

preview 이후 달라진 점

공식 Qwen repository에는 post-trained model Qwen3.8-2.4T-A95B의 weights와 configuration이 공개되어 있습니다. 총 2.4조 parameter, 950억 active parameter, 262,144 token의 native context와 1,010,000까지의 확장을 제공합니다. repository는 vLLM, SGLang, TokenSpeed와 호환됩니다.

Hosted model qwen3.8-max는 이 규모를 기반으로 하지만, Qwen은 vision input, non-thinking, 공식 tools, 기본 100만 token context를 별도로 명시합니다. 따라서 API configuration에서 qwen3.8-max 대신 Qwen3.8-2.4T-A95B를 넣거나 local inference가 Hosted API와 완전히 같다고 보면 안 됩니다.

선택이름지정 위치얻는 것
Hosted APIqwen3.8-maxAPI provider directory의 Model ID fieldmanaged inference와 추가 hosted capabilities
자체 inferenceQwen3.8-2.4T-A95Binference engine repository와 configurationQwen3.8-Max License weights와 infrastructure 제어
이전 previewqwen3.8-max-preview새 stable configuration에는 사용하지 않음다른 contract를 가진 과거 API variant

Preview는 Token Plan과 초기 configuration에서 qwen3.8-max-preview로 나타났습니다. 이 버전에는 stable contract에 포함되지 않는 thinking restriction이 기록되어 있었습니다. 실무적인 migration은 Model ID를 교체하고 key type과 endpoint를 확인한 뒤 최소 request를 다시 실행하는 것입니다. region을 확인하지 않고 model string만 바꾸면 401, 404, 또는 model not found가 될 수 있습니다.

공개 weights를 로컬에서 실행할 수 있나

형식상 가능합니다. repository에 자체 inference용 weights와 configuration이 있습니다. 하지만 실제로는 보통 workstation GPU에 올리는 모델이 아니라 server deployment입니다. MoE는 매 step에 950억 parameter를 활성화하지만, 저장하고 배포하고 loading해야 할 데이터는 더 많고 KV cache, precision, quantization, inference engine memory도 더해집니다.

active parameter 수만 보고 hardware를 산정하지 마세요. 먼저 engine, precision, context length, 허용 가능한 speed를 고르고 hardware guide를 확인한 다음 별도의 memory estimate를 만드세요. 한 번의 coding test라면 Hosted API가 대개 준비가 적습니다. local option은 team이 sharding, update, monitoring을 실제로 운영할 수 있을 때 적합합니다.

Weights에는 Apache 2.0이 아닌 별도의 Qwen3.8-Max License가 적용됩니다. 사용과 수정은 허용하지만 대형 commercial product, Model as a Service, AI Work Assistant에 대한 추가 조건이 있습니다. public 또는 commercial deployment 전에는 자신의 scenario에 맞춰 전문을 검토하세요.

Qwen3.8-Max 가격은 얼마인가

Alibaba Model Studio는 region별 가격을 공개합니다. 원래 currency로 계산하고 환산값을 공식 tariff처럼 제시하지 마세요.

  • Beijing / Global: input 100만 token당 CNY 12, output 100만 token당 CNY 36.
  • Singapore: input 100만 token당 CNY 14.988, output 100만 token당 CNY 44.965.

input 200,000 token과 output 20,000 token의 Beijing 계산은 다음과 같습니다.

0.2 × 12 + 0.02 × 36 = CNY 3.12.

Singapore에서 같은 volume은 CNY 3.8969입니다. 이는 Model Studio pay-as-you-go 계산입니다. Token Plan, subscription, third-party gateway는 billing unit이 다르므로 같은 비교 행에 두면 안 됩니다.

BetterToken card에서 같은 profile은 날짜가 있는 snapshot 기준으로 다음 금액이었습니다.

0.2 × $1.84 + 0.02 × $5.52 = $0.4784.

최종 금액을 직접 비교할 수는 없습니다. 한 table은 CNY, 다른 하나는 USD이고 cache와 access 조건도 다릅니다. 유용한 결론은 먼저 구체적인 provider와 region을 선택하고, 그 다음 같은 token profile을 각각 계산하는 것입니다. 가격, model availability, key group은 dynamic한 사실이므로 사용 전에 다시 확인해야 합니다.

공식 benchmark table 읽는 법

Qwen release는 다음 coding results를 제시합니다.

  • Terminal-Bench 2.1: 86.6.
  • SWE-bench Pro: 67.7.
  • DeepSWE 1.1: 56.6.
  • FrontierSWE: 73.5.
  • PaperBench: 93.0.
  • QwenSWEBench: 80.7.

이는 vendor-reported data입니다. Terminal-Bench 2.1에 대해 Qwen은 Claude Code, avg@10, 5시간 timeout, max_tokens=131072를 명시합니다. SWE-bench Pro에는 Claude Code, temperature=1.0, top_p=0.95, 256K context가 적혀 있고 이 footnote에 별도 timeout은 없습니다. 경쟁 모델의 여러 행은 각사의 best published result를 사용했습니다. 일부 set은 Qwen 소유이며 external reproduction이 없습니다.

이 숫자에서 하나의 ranking을 만들 수는 없습니다. PaperBench 93.0이 실제 repository의 issue fix를 자동으로 더 잘 해결한다는 뜻은 아닙니다. 먼저 test가 측정하는 ability를 보고, 그 다음 harness, effort, attempt 수, assessment method를 확인하세요.

한 독립 test가 보여 준 것

Trilogy AI는 같은 architectural analysis task에서 Qwen preview와 Kimi K3를 비교했습니다. 269 files의 frozen repository, 같은 time limit, 같은 result type을 사용했습니다. StackPerf는 Kimi 우위의 80 대 83이었습니다. Qwen은 error 없이 44 tool calls를 했고, Kimi는 회복된 두 failure를 포함해 53 calls를 했습니다.

이는 유용한 process snapshot이지만 한 task의 한 run일 뿐입니다. 작은 score 차이가 다른 tool behavior를 동반할 수 있음을 보여 줄 뿐, 모든 coding scenario에서 한 model이 낫다는 증거는 아닙니다.

Qwen3.8-Max를 시험할 만한 경우

다음 task라면 model을 비교에 넣을 가치가 있습니다.

  • 많은 files를 읽고 architectural picture를 구성해야 할 때.
  • tools로 multi-step plan을 실행해야 할 때.
  • text, image, document를 하나의 context에서 다뤄야 할 때.
  • diff를 준비하고 여러 readiness condition을 확인해야 할 때.
  • business rule과 code를 오래 같은 context에 유지해야 할 때.

작은 edit라면 low reasoning과 더 높은 reasoning을 비교하세요. quality improvement가 latency와 output token을 상쇄하지 못하면 heavy mode가 default가 되어서는 안 됩니다.

Qwen Code 설정

먼저 Model Studio console에서 region을 선택하고 API-KEY page를 열어 그 region의 일반 pay-as-you-go key를 만듭니다. Token Plan key는 별도 section에서 생성되며 pay-as-you-go endpoint와 교환할 수 없습니다. 새 key는 만든 직후 복사하고 environment variable에 저장합니다.

export DASHSCOPE_API_KEY="YOUR_API_KEY"

Qwen Code는 modelProviders와 OpenAI-compatible provider를 지원합니다. 모든 project에 적용하려면 ~/.qwen/settings.json을 열고, 하나의 repository만 적용하려면 root의 .qwen/settings.json을 사용합니다. JSON에는 key 자체가 아니라 variable name을 넣습니다.

{ "modelProviders": { "openai": [ { "id": "qwen3.8-max", "name": "Qwen3.8-Max", "baseUrl": "https://dashscope-us.aliyuncs.com/compatible-mode/v1", "envKey": "DASHSCOPE_API_KEY" } ] } }

위 endpoint는 US region의 공식 example입니다. Beijing, Singapore, Tokyo, Frankfurt에서는 Model Studio table의 address를 사용하고 같은 region의 key를 써야 합니다. Project file은 user file을 덮어쓰므로 unexpected model이 나오면 두 level을 모두 확인하세요.

Qwen Code documentation은 provider configuration을 atomic으로 설명합니다. Nested generationConfig와 다른 fields는 key별 merge가 아니라 전체 replace됩니다. 변경 전에 기존 provider records를 저장하고 diff를 확인하여 다른 model의 working setting을 지우지 않도록 하세요.

File을 저장하고 Qwen Code를 restart한 뒤 qwen3.8-max를 선택합니다. 한 file에 대한 read request를 보내고 response나 metadata에서 model name을 확인합니다. 그 다음에만 change를 허용하세요.

Claude Code 설정

Model Studio는 Anthropic-compatible endpoint를 제공합니다. US region의 최소 example은 다음과 같습니다.

export ANTHROPIC_BASE_URL="https://dashscope-us.aliyuncs.com/apps/anthropic" export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY" export ANTHROPIC_MODEL="qwen3.8-max"

다른 region에서는 Base URL을 공식 regional address로 바꾸고 대응하는 key를 사용합니다. Restart 후 file을 바꾸지 않는 짧은 task를 주고 실제 Model ID를 확인하세요. Token Plan key와 pay-as-you-go endpoint를 섞지 마세요.

Anthropic-compatible은 protocol compatibility를 뜻합니다. Qwen이 Anthropic model이 되는 것도, Claude Code에서 behavior가 동일해지는 것도 아닙니다. 대상 client에서 tool call, file write, error recovery, usage를 확인해야 합니다.

이미 기록된 error 분류하기

Qwen Code issue #7332는 preview에 관한 것입니다. Internal request가 당시 thinking만 받던 model에 enable_thinking=false를 보내 400을 받았습니다. Migration에는 유용한 signal이지만 현재 stable API를 설명하지는 않습니다.

Qwen3 issue #1883에서는 Anthropic-compatible endpoint user가 agent가 relative path를 직접 /tmp에 쓰려 한다고 보고했고, absolute path가 workaround가 되었습니다. Qwen Code issue #7489에서는 VS Code Companion이 image name 링크를 넣었지만 image 자체를 transfer하지 않았습니다. 두 경우 모두 client version과 harness에 의존합니다.

이런 문제는 네 layer로 분리합니다.

  1. API가 Model ID와 key를 받는다.
  2. Client가 thinking과 tools를 올바르게 전달한다.
  3. Harness가 path와 attachment를 올바르게 resolve한다.
  4. Model이 instruction을 따른다.

모든 것을 곧바로 “model error”라고 부르면 configuration 수정이 어려워집니다.

자신의 task로 model 시험하기

서로 다른 종류의 repository 또는 issue 세 개를 고릅니다. Commit, tools, time limit, PASS criteria를 freeze합니다. 각 run에서 다음을 기록하세요.

  • reasoning mode.
  • Input과 output token.
  • 첫 유용한 change까지 걸린 시간.
  • Tool call 수와 error 수.
  • Test result.
  • Manual correction 수.

이 test는 일반 leaderboard보다 유용합니다. Code를 작성하는 ability뿐 아니라 완료된 task의 cost, 즉 team이 실제로 지불하는 것을 보여 줍니다.

LLM 워크플로를 최적화할 준비가 되셨나요?

하나의 API로 모델을 연결하고 키와 AI 비용을 관리하세요.