Coding向けKimi K3:コスト、Benchmark、Tool設定
API cost、vendor benchmark、tool設定、scope・latency・token使用量の具体的なcheckから、Kimi K3がcodingに適するか評価します。
Kimi K3は、長時間のcoding run、大規模repository、codeとvisual inputを組み合わせるtaskの候補です。ただし、leaderboardだけで選ぶのは危険です。結果はharness、reasoning effort、endpoint、taskによって変わります。Always-on thinkingにより、短いloopが想定より遅く、コストも高くなる場合があります。
Budgetを管理しながらmodelを試したい場合は、 現在のaccess pathをKimi K3 APIページで、現在のpriceとavailabilityをBetterToken catalogで確認してください。自分のAPI keyを作り、客観的なpass conditionがある短いtaskを1つ実行するところから始めます。
Moonshot AIが公開したもの
Official Kimi K3 repositoryでは、総parameter数2.8 trillion、tokenごとのactivated parameter数104 billionのsparse MoE modelと説明されています。1,048,576-tokenのcontext window、native text・image input、常時有効なthinkingをsupportします。APIにはlow、high、maxのreasoning effortがあり、documentation上のdefaultはmaxです。
大きなcontext windowはcapacityであり、repository内のすべてのtokenが適切に利用される保証ではありません。実用的なevaluationでは、agentが正しいfileを見つけるか、scopeを守るか、tool errorから回復するか、budget内で完了するかを確認します。
Test前にAPI costを計算する
2026年8月21日に確認したMoonshotのKimi K3 pricingでは、cache-hit input tokenはmillionあたり3.00、output tokenはmillionあたり$15.00で、reasoningもoutputに含まれます。
200,000 uncached input tokenと20,000 output tokenの場合:
0.2 × $3.00 + 0.02 × $15.00 = $0.90。
200,000 input tokenがすべてcache hitなら、同じtoken構成のcostは$0.36です。Full cache reuseは境界条件であり、予測値ではありません。Tool result、file change、conversation historyによって再利用可能なprefixは変化しやすいため、nominal context sizeから推測せず、cache hit、miss、output、reasoningを記録してください。
Coding benchmarkはharnessと一緒に読む
Moonshotが報告したKimi K3のscoreには、Terminal-Bench 2.1の88.3、DeepSWEの67.5、ProgramBenchの77.8、FrontierSWEの81.2、SWE-Marathonの42.0、Kimi Code Bench 2.0の72.9が含まれます。これらはvendor-reported resultです。Repositoryによると、Kimi K3はmax reasoning effortを使い、一部のcoding evaluationではKimi Code harnessを使う一方、competitorは別のpublished harnessを使う場合があります。
比較に使う単位は次のとおりです。
model + harness + effort + endpoint + task。
Scoreだけでは、agentが何tokenを使ったか、指定fileのscopeを守ったか、人が何回redirectしたかは分かりません。
Kimi K3をcoding toolへ接続する
Moonshotは、Claude Code、Codex CLI、OpenCodeについて別々のofficial guideを公開しています。1つのconfigurationが3つのtoolでそのまま動くとは考えないでください。
- Toolとdocumented protocol pathを選び、別clientのendpointを流用しない。
- Toolのcredential mechanismからAPI keyを入力し、以下のdocumentationどおりにrequired endpointとmodelを設定する。
- Clientをrestartしてread-only taskを1つ実行し、file変更を許可する前にeffective model、Base URL、usageを確認する。
Claude Code向けにdocumented international Anthropic-compatible setupで使う値は次のとおりです。
Clientをrestartし、/statusを実行してeffective Base URLとmodelを確認します。Keyをcommitしたり、issueへ貼り付けたりしないでください。
Codex CLIはResponses APIを使いますが、Kimi K3が公開するのはChat Completionsです。Moonshot guideでは、この2つのcontractをつなぐlocal routerとしてCC Switchを使います。このrouterは独立したtrusted componentとして扱い、file変更を許可する前にsource、update process、credential storage、active routeを検証してください。
OpenCodeではopencode auth loginを実行し、Moonshot AIを選び、credential dialogからkeyを入力します。その後、/modelsと/variantsでKimi K3とeffortを選択します。Read-only taskから始め、provider dashboardでmodelとusageを確認してください。
User reportをtest caseへ変える
MoonshotAI/kimi-codeのissue #1911と#2031では、特定sessionでのhang、弱いinterruption、scope expansion、通常より大きなinput-token consumptionが報告されています。これらは全userに対するerror rateではありません。Explicit file boundary、iteration limit、cancellation、token accounting、failed tool callからのrecoveryをtestする理由として扱います。
代表的なtaskを5つ用意します。Local bug、multi-file change、test追加、repository search、visual-input taskです。Commit、prompt、tool、timeout、acceptance testを固定し、input、cache、output、reasoning、duration、manual intervention、scope violationを記録します。その結果から、Kimi K3がdefault agent、難しいtask用model、fallbackのどれに適するかを判断できます。