Kimi K3 para programação: custo, benchmarks e configuração
Avalie o Kimi K3 para programação por custo da API, benchmarks do vendor, configuração de ferramentas e testes de escopo, latência e tokens.
O Kimi K3 é candidato para execuções longas de programação, repositórios grandes e tarefas que combinam código com input visual. Escolhê-lo apenas pela posição em um leaderboard é arriscado: os resultados dependem do harness, do reasoning effort, do endpoint e da tarefa. O thinking sempre ativo também pode tornar loops curtos mais lentos e caros do que o esperado.
Quer testar o modelo com um orçamento controlado? Use a página da API do Kimi K3 para conferir o caminho de acesso atual e o catálogo da BetterToken para verificar preço e disponibilidade. Crie sua própria API Key e comece com uma tarefa curta que tenha uma condição objetiva de aprovação.
O que a Moonshot AI lançou
O repositório oficial do Kimi K3 descreve um modelo MoE esparso com 2.8 trilhões de parâmetros no total e 104 bilhões ativados por token. Ele oferece janela de contexto de 1,048,576 tokens, input nativo de texto e imagem e thinking sempre habilitado. A API expõe reasoning effort low, high e max, sendo max o padrão documentado.
Uma janela de contexto grande representa capacidade, não a garantia de que cada token de um repositório será bem aproveitado. Uma avaliação útil deve conferir se o agent encontra os arquivos corretos, respeita o escopo, se recupera após erros de tools e termina dentro do orçamento.
Calcule o custo da API antes do teste
Conforme verificado em 21 de agosto de 2026, a tabela de preços do Kimi K3 da Moonshot informa 3.00 por milhão de tokens de input com cache miss e $15.00 por milhão de tokens de output, incluindo reasoning.
Para 200,000 tokens de input sem cache e 20,000 tokens de output:
0.2 × $3.00 + 0.02 × $15.00 = $0.90.
Se todos os 200,000 tokens de input fossem cache hits, o mesmo perfil de tokens custaria $0.36. O reaproveitamento total do cache é um caso-limite, não uma previsão. Resultados de tools, mudanças em arquivos e histórico da conversa costumam alterar o prefixo reutilizável. Registre cache hits, misses, output e reasoning em vez de estimar pelo tamanho nominal do contexto.
Leia benchmarks de programação junto com o harness
A Moonshot informa resultados do Kimi K3 que incluem 88.3 no Terminal-Bench 2.1, 67.5 no DeepSWE, 77.8 no ProgramBench, 81.2 no FrontierSWE, 42.0 no SWE-Marathon e 72.9 no Kimi Code Bench 2.0. São resultados reportados pelo vendor. O repositório observa que o Kimi K3 usa reasoning effort max e que algumas avaliações de programação usam o harness do Kimi Code, enquanto concorrentes podem usar outros harnesses publicados.
A unidade de comparação útil é:
model + harness + effort + endpoint + task.
Uma pontuação não informa quantos tokens o agent usou, se permaneceu nos arquivos solicitados nem quantas vezes uma pessoa precisou redirecioná-lo.
Conecte o Kimi K3 a ferramentas de programação
A Moonshot publica guias oficiais separados para Claude Code, Codex CLI e OpenCode. Não presuma que uma configuração funciona sem alterações nas três ferramentas.
- Escolha a ferramenta e o caminho de protocolo documentado para ela; não reutilize o endpoint de outro cliente.
- Insira a API key pelo mecanismo de credenciais da ferramenta e configure o endpoint e o modelo exigidos exatamente como documentado abaixo.
- Reinicie o cliente, execute uma tarefa read-only e verifique o modelo efetivo, a Base URL e o uso antes de permitir alterações em arquivos.
No Claude Code, a configuração internacional Anthropic-compatible documentada usa:
Reinicie o cliente, execute /status e confirme a Base URL e o modelo efetivos. Não faça commit da key nem a cole em uma issue.
O Codex CLI usa a Responses API, enquanto o Kimi K3 expõe Chat Completions. O guia da Moonshot usa o CC Switch como router local entre esses contratos. Trate esse router como um componente confiável separado: verifique código-fonte, processo de atualização, armazenamento de credenciais e rota ativa antes de permitir alterações em arquivos.
No OpenCode, execute opencode auth login, escolha Moonshot AI, forneça a key na caixa de credenciais e use /models e /variants para selecionar o Kimi K3 e seu effort. Comece com uma tarefa read-only e verifique modelo e uso no dashboard do provider.
Transforme relatos de usuários em casos de teste
As issues #1911 e #2031 do MoonshotAI/kimi-code descrevem travamentos, interrupção fraca, expansão de escopo e consumo de input tokens excepcionalmente alto em sessões específicas. Esses relatos não representam uma taxa de erro para todos os usuários. Eles justificam testar limites explícitos de arquivos, limites de iteração, cancelamento, contabilização de tokens e recuperação após uma tool call com falha.
Prepare cinco tarefas representativas: um bug local, uma mudança em vários arquivos, a adição de um teste, uma busca no repositório e uma tarefa com input visual. Congele commit, prompt, tools, timeout e teste de aceitação. Registre input, cache, output, reasoning, duração, intervenções manuais e violações de escopo. O resultado mostrará se o Kimi K3 se encaixa como agent padrão, modelo para tarefas difíceis ou fallback.