Coding向けKimi K3:コスト、Benchmark、Tool設定
API cost、vendor benchmark、tool設定、scope・latency・token使用量の具体的なcheckから、Kimi K3がcodingに適するか評価します。
目次
Kimi K3は、長時間のcoding run、大規模repository、codeとvisual inputを組み合わせるtaskの候補です。ただし、leaderboardだけで選ぶのは危険です。結果はharness、reasoning effort、endpoint、taskによって変わります。Always-on thinkingにより、短いloopが想定より遅く、コストも高くなる場合があります。
試す前に現在のモデル価格を確認してください。
| Workload | Kimi K3で確認すること | 別modelを選ぶタイミング |
|---|---|---|
| 大規模repositoryでの長いagent run | Scopeを守り、verificationまで完了するか | Taskを不必要に広げる、または繰り返しmanual interventionが必要なとき |
| 頻繁な小規模edit | Response timeとreasoning outputのcost | 軽量modelが同じ結果をより速く出せるとき |
| Codeとvisual input | Native visionが実際のacceptance testを改善するか | Imageがpass conditionに影響しないとき |
Moonshot AIが公開したもの
Official Kimi K3 repositoryでは、総parameter数2.8 trillion、tokenごとのactivated parameter数104 billionのsparse MoE modelと説明されています。1,048,576-tokenのcontext window、native text・image・video input、常時有効なthinkingをsupportします。
大きなcontext windowはcapacityであり、repository内のすべてのtokenが適切に利用される保証ではありません。実用的なevaluationでは、agentが正しいfileを見つけるか、scopeを守るか、tool errorから回復するか、budget内で完了するかを確認します。
Test前にAPI costを計算する
料金とavailabilityは変わるため、test当日に選択したproviderのcatalogを確認してください。1回のrunは実際のinputとoutput tokenにそれぞれのcurrent rateを掛けて見積もります。cache-hit rateが別にある場合はconfirmed cached volumeだけに適用し、provider間でdiscountを移さないでください。
計算には古い比較ではなくcurrent rateを使ってください。 BetterTokenの現在の価格を開く
Official APIでもcompatible providerでも、total costはinputだけでは決まりません。長いreasoningはoutputとして課金され、主な費用になることがあります。
Coding benchmarkはharnessと一緒に読む
Moonshotが報告したKimi K3のscoreには、Terminal-Bench 2.1の88.3、DeepSWEの67.5、ProgramBenchの77.8、FrontierSWEの81.2、SWE-Marathonの42.0、Kimi Code Bench 2.0の72.9が含まれます。これらはvendor-reported resultです。Repositoryによると、Kimi K3はmax reasoning effortを使い、一部のcoding evaluationではKimi Code harnessを使う一方、competitorは別のpublished harnessを使う場合があります。
比較に使う単位は次のとおりです。
model + harness + effort + endpoint + task。
Scoreだけでは、agentが何tokenを使ったか、指定fileのscopeを守ったか、人が何回redirectしたかは分かりません。
Kimi K3をcoding toolへ接続する
Moonshotは、Claude Code、Codex CLI、OpenCodeについて別々のofficial guideを公開しています。1つのconfigurationが3つのtoolでそのまま動くとは考えないでください。
- Toolとdocumented protocol pathを選び、別clientのendpointを流用しない。
- Toolのcredential mechanismからAPI keyを入力し、以下のdocumentationどおりにrequired endpointとmodelを設定する。
- Clientをrestartしてread-only taskを1つ実行し、file変更を許可する前にeffective model、Base URL、usageを確認する。
Claude Code向けにdocumented international Anthropic-compatible setupで使う値は次のとおりです。
export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="kimi-k3[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="kimi-k3[1m]"
export CLAUDE_CODE_SUBAGENT_MODEL="kimi-k3[1m]"
Clientをrestartし、/statusを実行してeffective Base URLとmodelを確認します。Keyをcommitしたり、issueへ貼り付けたりしないでください。
Moonshot Open PlatformとKimi Codeのkeyを別platformのBase URLと混在させないでください。Domainとkey typeが異なるため、このconfigurationでの401はmodelの品質を示しません。
MoonshotはResponses APIをsupportしているため、Codexはlocal proxyやprotocol conversionなしでKimi K3へ直接接続します。Keyはconfig.tomlではなくKIMI_API_KEYに保存し、~/.codex/config.tomlへ次を追加します。
model = "kimi-k3"
model_provider = "kimi"
model_context_window = 1048576
[model_providers.kimi]
name = "Kimi"
base_url = "https://api.moonshot.ai/v1"
env_key = "KIMI_API_KEY"
wire_api = "responses"
Codexを完全にrestartし、current modelがkimi-k3であることを確認してから、fileを変更しない短いrequestを送ります。DesktopとCLIは同じuser configを読みます。Codexにはbuilt-in video channelがないため、videoにはdocumented direct Kimi APIを使ってください。
OpenCodeではopencode auth loginを実行し、Moonshot AIを選び、credential dialogからkeyを入力します。その後、/modelsと/variantsでKimi K3とeffortを選択します。Read-only taskから始め、provider dashboardでmodelとusageを確認してください。
User reportをtest caseへ変える
MoonshotAI/kimi-codeのissue #1911では、userがhang、弱いinterruption、scope expansionを報告しています。#2031では、作者がinput Tokens 18.3 millionのsessionを報告しています。これは別々の2件のuser reportであり、全体のerror rateやindependent reproductionではありません。Explicit file boundary、iteration limit、cancellation、token accounting、failed tool callからのrecoveryをtestする理由として扱います。
代表的なtaskを5つ用意します。Local bug、multi-file change、test追加、repository search、visual-input taskです。Commit、prompt、tool、timeout、acceptance testを固定し、input、cache、output、reasoning、duration、manual intervention、scope violationを記録します。その結果から、Kimi K3がdefault agent、難しいtask用model、fallbackのどれに適するかを判断できます。