Convide e ganhe

Como funcionam as recompensas

Compartilhe seu link. Quando um amigo se cadastrar por ele e adicionar saldo, você receberá a recompensa exibida nas recargas posteriores.

Kimi K3 para programação: custo, benchmarks e configuração

Avalie o Kimi K3 para programação por custo da API, benchmarks do vendor, configuração de ferramentas e testes de escopo, latência e tokens.

Conteúdo

O Kimi K3 é candidato para execuções longas de programação, repositórios grandes e tarefas que combinam código com input visual. Escolhê-lo apenas pela posição em um leaderboard é arriscado: os resultados dependem do harness, do reasoning effort, do endpoint e da tarefa. O thinking sempre ativo também pode tornar loops curtos mais lentos e caros do que o esperado.

Confira o preço atual do modelo antes do teste.

Seu workloadO que verificar com o Kimi K3Quando escolher outro modelo
Execução longa de um agent em repositório grandeSe ele respeita o escopo e conclui a verificaçãoQuando amplia a tarefa ou exige intervenções repetidas
Pequenas edições frequentesTempo de resposta e custo do reasoning outputQuando um modelo mais leve chega ao mesmo resultado mais rápido
Código com input visualSe a visão nativa melhora seu teste de aceitação realQuando a imagem não afeta a condição de aprovação

O que a Moonshot AI lançou

O repositório oficial do Kimi K3 descreve um modelo MoE esparso com 2.8 trilhões de parâmetros no total e 104 bilhões ativados por token. Ele oferece janela de contexto de 1,048,576 tokens, input nativo de texto, imagem e vídeo e thinking sempre habilitado.

Uma janela de contexto grande representa capacidade, não a garantia de que cada token de um repositório será bem aproveitado. Uma avaliação útil deve conferir se o agent encontra os arquivos corretos, respeita o escopo, se recupera após erros de tools e termina dentro do orçamento.

Calcule o custo da API antes do teste

Preços e disponibilidade mudam; consulte o catálogo do provider escolhido no dia do teste. Para estimar uma execução, multiplique os tokens reais de input e output pelas taxas atuais correspondentes. Se houver taxa separada para cache hit, aplique-a somente ao volume confirmado em cache; não transfira desconto entre providers.

Use taxas atuais no cálculo, não uma comparação antiga. Abrir preços atuais da BetterToken

Tanto na API oficial quanto em provider compatível, o custo total não depende apenas do input: reasoning longo é cobrado como output e pode ser a principal despesa.

Leia benchmarks de programação junto com o harness

A Moonshot informa resultados do Kimi K3 que incluem 88.3 no Terminal-Bench 2.1, 67.5 no DeepSWE, 77.8 no ProgramBench, 81.2 no FrontierSWE, 42.0 no SWE-Marathon e 72.9 no Kimi Code Bench 2.0. São resultados reportados pelo vendor. O repositório observa que o Kimi K3 usa reasoning effort max e que algumas avaliações de programação usam o harness do Kimi Code, enquanto concorrentes podem usar outros harnesses publicados.

A unidade de comparação útil é:

model + harness + effort + endpoint + task.

Uma pontuação não informa quantos tokens o agent usou, se permaneceu nos arquivos solicitados nem quantas vezes uma pessoa precisou redirecioná-lo.

Conecte o Kimi K3 a ferramentas de programação

A Moonshot publica guias oficiais separados para Claude Code, Codex CLI e OpenCode. Não presuma que uma configuração funciona sem alterações nas três ferramentas.

  1. Escolha a ferramenta e o caminho de protocolo documentado para ela; não reutilize o endpoint de outro cliente.
  2. Insira a API key pelo mecanismo de credenciais da ferramenta e configure o endpoint e o modelo exigidos exatamente como documentado abaixo.
  3. Reinicie o cliente, execute uma tarefa read-only e verifique o modelo efetivo, a Base URL e o uso antes de permitir alterações em arquivos.

No Claude Code, a configuração internacional Anthropic-compatible documentada usa:

export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="kimi-k3[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="kimi-k3[1m]"
export CLAUDE_CODE_SUBAGENT_MODEL="kimi-k3[1m]"

Reinicie o cliente, execute /status e confirme a Base URL e o modelo efetivos. Não faça commit da key nem a cole em uma issue.

Não misture keys da Moonshot Open Platform e do Kimi Code com a Base URL de outra plataforma. Os domínios e tipos de key são diferentes; um 401 nessa configuração não diz nada sobre a qualidade do modelo.

A Moonshot suporta a Responses API, portanto o Codex conecta-se diretamente ao Kimi K3 sem proxy local ou conversão de protocolo. Guarde a chave em KIMI_API_KEY, não em config.toml, e adicione isto a ~/.codex/config.toml:

model = "kimi-k3"
model_provider = "kimi"
model_context_window = 1048576

[model_providers.kimi]
name = "Kimi"
base_url = "https://api.moonshot.ai/v1"
env_key = "KIMI_API_KEY"
wire_api = "responses"

Reinicie o Codex por completo, confirme kimi-k3 como modelo atual e envie uma solicitação curta sem alterar arquivos. Desktop e CLI leem a mesma configuração de usuário. O Codex não tem canal de vídeo integrado; para vídeo use a API direta da Kimi documentada.

No OpenCode, execute opencode auth login, escolha Moonshot AI, forneça a key na caixa de credenciais e use /models e /variants para selecionar o Kimi K3 e seu effort. Comece com uma tarefa read-only e verifique modelo e uso no dashboard do provider.

Transforme relatos de usuários em casos de teste

Na issue #1911, um usuário descreveu travamentos, interrupção fraca e expansão de escopo. Na #2031, o autor relatou uma sessão com 18,3 milhões de tokens de entrada. São dois relatos de usuários separados, não uma reprodução independente nem uma estatística de toda a modelo. Eles justificam testar limites explícitos de arquivos, limites de iteração, cancelamento, contabilização de tokens e recuperação após uma tool call com falha.

Prepare cinco tarefas representativas: um bug local, uma mudança em vários arquivos, a adição de um teste, uma busca no repositório e uma tarefa com input visual. Congele commit, prompt, tools, timeout e teste de aceitação. Registre input, cache, output, reasoning, duração, intervenções manuais e violações de escopo. O resultado mostrará se o Kimi K3 se encaixa como agent padrão, modelo para tarefas difíceis ou fallback.

Fontes

Quer otimizar seu fluxo de trabalho com LLMs?

Conecte modelos por uma única API, gerencie chaves e controle os gastos com IA.

Começar grátis