招待して報酬

招待報酬の仕組み

招待リンクを共有します。友だちがリンクから登録してチャージすると、その後のチャージごとに表示された報酬を受け取れます。

Coding向けKimi K3:コスト、Benchmark、Tool設定

API cost、vendor benchmark、tool設定、scope・latency・token使用量の具体的なcheckから、Kimi K3がcodingに適するか評価します。

目次

Kimi K3は、長時間のcoding run、大規模repository、codeとvisual inputを組み合わせるtaskの候補です。ただし、leaderboardだけで選ぶのは危険です。結果はharness、reasoning effort、endpoint、taskによって変わります。Always-on thinkingにより、短いloopが想定より遅く、コストも高くなる場合があります。

試す前に現在のモデル価格を確認してください。

WorkloadKimi K3で確認すること別modelを選ぶタイミング
大規模repositoryでの長いagent runScopeを守り、verificationまで完了するかTaskを不必要に広げる、または繰り返しmanual interventionが必要なとき
頻繁な小規模editResponse timeとreasoning outputのcost軽量modelが同じ結果をより速く出せるとき
Codeとvisual inputNative visionが実際のacceptance testを改善するかImageがpass conditionに影響しないとき

Moonshot AIが公開したもの

Official Kimi K3 repositoryでは、総parameter数2.8 trillion、tokenごとのactivated parameter数104 billionのsparse MoE modelと説明されています。1,048,576-tokenのcontext window、native text・image・video input、常時有効なthinkingをsupportします。

大きなcontext windowはcapacityであり、repository内のすべてのtokenが適切に利用される保証ではありません。実用的なevaluationでは、agentが正しいfileを見つけるか、scopeを守るか、tool errorから回復するか、budget内で完了するかを確認します。

Test前にAPI costを計算する

料金とavailabilityは変わるため、test当日に選択したproviderのcatalogを確認してください。1回のrunは実際のinputとoutput tokenにそれぞれのcurrent rateを掛けて見積もります。cache-hit rateが別にある場合はconfirmed cached volumeだけに適用し、provider間でdiscountを移さないでください。

計算には古い比較ではなくcurrent rateを使ってください。 BetterTokenの現在の価格を開く

Official APIでもcompatible providerでも、total costはinputだけでは決まりません。長いreasoningはoutputとして課金され、主な費用になることがあります。

Coding benchmarkはharnessと一緒に読む

Moonshotが報告したKimi K3のscoreには、Terminal-Bench 2.1の88.3、DeepSWEの67.5、ProgramBenchの77.8、FrontierSWEの81.2、SWE-Marathonの42.0、Kimi Code Bench 2.0の72.9が含まれます。これらはvendor-reported resultです。Repositoryによると、Kimi K3はmax reasoning effortを使い、一部のcoding evaluationではKimi Code harnessを使う一方、competitorは別のpublished harnessを使う場合があります。

比較に使う単位は次のとおりです。

model + harness + effort + endpoint + task。

Scoreだけでは、agentが何tokenを使ったか、指定fileのscopeを守ったか、人が何回redirectしたかは分かりません。

Kimi K3をcoding toolへ接続する

Moonshotは、Claude Code、Codex CLI、OpenCodeについて別々のofficial guideを公開しています。1つのconfigurationが3つのtoolでそのまま動くとは考えないでください。

  1. Toolとdocumented protocol pathを選び、別clientのendpointを流用しない。
  2. Toolのcredential mechanismからAPI keyを入力し、以下のdocumentationどおりにrequired endpointとmodelを設定する。
  3. Clientをrestartしてread-only taskを1つ実行し、file変更を許可する前にeffective model、Base URL、usageを確認する。

Claude Code向けにdocumented international Anthropic-compatible setupで使う値は次のとおりです。

export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="kimi-k3[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="kimi-k3[1m]"
export CLAUDE_CODE_SUBAGENT_MODEL="kimi-k3[1m]"

Clientをrestartし、/statusを実行してeffective Base URLとmodelを確認します。Keyをcommitしたり、issueへ貼り付けたりしないでください。

Moonshot Open PlatformとKimi Codeのkeyを別platformのBase URLと混在させないでください。Domainとkey typeが異なるため、このconfigurationでの401はmodelの品質を示しません。

MoonshotはResponses APIをsupportしているため、Codexはlocal proxyやprotocol conversionなしでKimi K3へ直接接続します。Keyはconfig.tomlではなくKIMI_API_KEYに保存し、~/.codex/config.tomlへ次を追加します。

model = "kimi-k3"
model_provider = "kimi"
model_context_window = 1048576

[model_providers.kimi]
name = "Kimi"
base_url = "https://api.moonshot.ai/v1"
env_key = "KIMI_API_KEY"
wire_api = "responses"

Codexを完全にrestartし、current modelがkimi-k3であることを確認してから、fileを変更しない短いrequestを送ります。DesktopとCLIは同じuser configを読みます。Codexにはbuilt-in video channelがないため、videoにはdocumented direct Kimi APIを使ってください。

OpenCodeではopencode auth loginを実行し、Moonshot AIを選び、credential dialogからkeyを入力します。その後、/modelsと/variantsでKimi K3とeffortを選択します。Read-only taskから始め、provider dashboardでmodelとusageを確認してください。

User reportをtest caseへ変える

MoonshotAI/kimi-codeのissue #1911では、userがhang、弱いinterruption、scope expansionを報告しています。#2031では、作者がinput Tokens 18.3 millionのsessionを報告しています。これは別々の2件のuser reportであり、全体のerror rateやindependent reproductionではありません。Explicit file boundary、iteration limit、cancellation、token accounting、failed tool callからのrecoveryをtestする理由として扱います。

代表的なtaskを5つ用意します。Local bug、multi-file change、test追加、repository search、visual-input taskです。Commit、prompt、tool、timeout、acceptance testを固定し、input、cache、output、reasoning、duration、manual intervention、scope violationを記録します。その結果から、Kimi K3がdefault agent、難しいtask用model、fallbackのどれに適するかを判断できます。

Sources

LLM ワークフローを最適化しませんか?

単一 API でモデルを接続し、キーと AI コストを管理できます。

無料で始める