Kimi K3 para programação: custo, benchmarks e configuração
Avalie o Kimi K3 para programação por custo da API, benchmarks do vendor, configuração de ferramentas e testes de escopo, latência e tokens.
Conteúdo
O Kimi K3 é candidato para execuções longas de programação, repositórios grandes e tarefas que combinam código com input visual. Escolhê-lo apenas pela posição em um leaderboard é arriscado: os resultados dependem do harness, do reasoning effort, do endpoint e da tarefa. O thinking sempre ativo também pode tornar loops curtos mais lentos e caros do que o esperado.
Confira o preço atual do modelo antes do teste.
| Seu workload | O que verificar com o Kimi K3 | Quando escolher outro modelo |
|---|---|---|
| Execução longa de um agent em repositório grande | Se ele respeita o escopo e conclui a verificação | Quando amplia a tarefa ou exige intervenções repetidas |
| Pequenas edições frequentes | Tempo de resposta e custo do reasoning output | Quando um modelo mais leve chega ao mesmo resultado mais rápido |
| Código com input visual | Se a visão nativa melhora seu teste de aceitação real | Quando a imagem não afeta a condição de aprovação |
O que a Moonshot AI lançou
O repositório oficial do Kimi K3 descreve um modelo MoE esparso com 2.8 trilhões de parâmetros no total e 104 bilhões ativados por token. Ele oferece janela de contexto de 1,048,576 tokens, input nativo de texto, imagem e vídeo e thinking sempre habilitado.
Uma janela de contexto grande representa capacidade, não a garantia de que cada token de um repositório será bem aproveitado. Uma avaliação útil deve conferir se o agent encontra os arquivos corretos, respeita o escopo, se recupera após erros de tools e termina dentro do orçamento.
Calcule o custo da API antes do teste
Preços e disponibilidade mudam; consulte o catálogo do provider escolhido no dia do teste. Para estimar uma execução, multiplique os tokens reais de input e output pelas taxas atuais correspondentes. Se houver taxa separada para cache hit, aplique-a somente ao volume confirmado em cache; não transfira desconto entre providers.
Use taxas atuais no cálculo, não uma comparação antiga. Abrir preços atuais da BetterToken
Tanto na API oficial quanto em provider compatível, o custo total não depende apenas do input: reasoning longo é cobrado como output e pode ser a principal despesa.
Leia benchmarks de programação junto com o harness
A Moonshot informa resultados do Kimi K3 que incluem 88.3 no Terminal-Bench 2.1, 67.5 no DeepSWE, 77.8 no ProgramBench, 81.2 no FrontierSWE, 42.0 no SWE-Marathon e 72.9 no Kimi Code Bench 2.0. São resultados reportados pelo vendor. O repositório observa que o Kimi K3 usa reasoning effort max e que algumas avaliações de programação usam o harness do Kimi Code, enquanto concorrentes podem usar outros harnesses publicados.
A unidade de comparação útil é:
model + harness + effort + endpoint + task.
Uma pontuação não informa quantos tokens o agent usou, se permaneceu nos arquivos solicitados nem quantas vezes uma pessoa precisou redirecioná-lo.
Conecte o Kimi K3 a ferramentas de programação
A Moonshot publica guias oficiais separados para Claude Code, Codex CLI e OpenCode. Não presuma que uma configuração funciona sem alterações nas três ferramentas.
- Escolha a ferramenta e o caminho de protocolo documentado para ela; não reutilize o endpoint de outro cliente.
- Insira a API key pelo mecanismo de credenciais da ferramenta e configure o endpoint e o modelo exigidos exatamente como documentado abaixo.
- Reinicie o cliente, execute uma tarefa read-only e verifique o modelo efetivo, a Base URL e o uso antes de permitir alterações em arquivos.
No Claude Code, a configuração internacional Anthropic-compatible documentada usa:
export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="kimi-k3[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="kimi-k3[1m]"
export CLAUDE_CODE_SUBAGENT_MODEL="kimi-k3[1m]"
Reinicie o cliente, execute /status e confirme a Base URL e o modelo efetivos. Não faça commit da key nem a cole em uma issue.
Não misture keys da Moonshot Open Platform e do Kimi Code com a Base URL de outra plataforma. Os domínios e tipos de key são diferentes; um 401 nessa configuração não diz nada sobre a qualidade do modelo.
A Moonshot suporta a Responses API, portanto o Codex conecta-se diretamente ao Kimi K3 sem proxy local ou conversão de protocolo. Guarde a chave em KIMI_API_KEY, não em config.toml, e adicione isto a ~/.codex/config.toml:
model = "kimi-k3"
model_provider = "kimi"
model_context_window = 1048576
[model_providers.kimi]
name = "Kimi"
base_url = "https://api.moonshot.ai/v1"
env_key = "KIMI_API_KEY"
wire_api = "responses"
Reinicie o Codex por completo, confirme kimi-k3 como modelo atual e envie uma solicitação curta sem alterar arquivos. Desktop e CLI leem a mesma configuração de usuário. O Codex não tem canal de vídeo integrado; para vídeo use a API direta da Kimi documentada.
No OpenCode, execute opencode auth login, escolha Moonshot AI, forneça a key na caixa de credenciais e use /models e /variants para selecionar o Kimi K3 e seu effort. Comece com uma tarefa read-only e verifique modelo e uso no dashboard do provider.
Transforme relatos de usuários em casos de teste
Na issue #1911, um usuário descreveu travamentos, interrupção fraca e expansão de escopo. Na #2031, o autor relatou uma sessão com 18,3 milhões de tokens de entrada. São dois relatos de usuários separados, não uma reprodução independente nem uma estatística de toda a modelo. Eles justificam testar limites explícitos de arquivos, limites de iteração, cancelamento, contabilização de tokens e recuperação após uma tool call com falha.
Prepare cinco tarefas representativas: um bug local, uma mudança em vários arquivos, a adição de um teste, uma busca no repositório e uma tarefa com input visual. Congele commit, prompt, tools, timeout e teste de aceitação. Registre input, cache, output, reasoning, duração, intervenções manuais e violações de escopo. O resultado mostrará se o Kimi K3 se encaixa como agent padrão, modelo para tarefas difíceis ou fallback.