Kimi K3 para programar: costes, benchmarks y configuración de herramientas

Una evaluación práctica de Kimi K3 para programar basada en costes de API, benchmarks del proveedor, configuración de herramientas y comprobaciones concretas de alcance, latencia y consumo de tokens.

Kimi K3 puede ser una opción para sesiones de programación largas, repositorios grandes y tareas que combinan código con entradas visuales. Elegirlo solo por una tabla de clasificación es arriesgado: los resultados dependen del entorno de evaluación, el esfuerzo de razonamiento, el endpoint y la tarea. Además, su razonamiento siempre activo puede hacer que los ciclos cortos sean más lentos y costosos de lo esperado.

¿Quieres probar el modelo con un presupuesto controlado? Consulta la página de la API de Kimi K3 para comprobar la vía de acceso actual y el catálogo de BetterToken para ver el precio y la disponibilidad vigentes. Crea tu propia clave de API y empieza con una tarea corta que tenga un criterio de aprobación objetivo.

Tu carga de trabajoQué comprobar con Kimi K3Cuándo elegir otro modelo
Ejecución larga de un agente en un repositorio grandeSi se mantiene dentro del alcance y completa la verificaciónSi amplía la tarea o requiere intervenciones repetidas
Cambios pequeños y frecuentesEl tiempo de respuesta y el coste de la salida de razonamientoSi un modelo más ligero logra el mismo resultado más rápido
Código con entrada visualSi la visión nativa mejora tu prueba de aceptación realSi la imagen no influye en el criterio de aprobación

Qué publicó Moonshot AI

El repositorio oficial de Kimi K3 describe un modelo MoE disperso con 2,8 billones de parámetros totales y 104.000 millones activados por token. Admite una ventana de contexto de 1.048.576 tokens, entrada nativa de texto e imagen y un modo de razonamiento que permanece habilitado. La API ofrece esfuerzos de razonamiento low, high y max; max es el valor predeterminado documentado.

Una ventana de contexto grande representa capacidad, no garantiza que se aproveche bien cada token de un repositorio. Una evaluación útil debe comprobar si el agente encuentra los archivos correctos, respeta el alcance, se recupera tras errores de herramientas y termina dentro del presupuesto.

Calcula el coste de la API antes de la prueba

A fecha de 21 de agosto de 2026, la tarifa de Kimi K3 de Moonshot indica 0,30 dólares por millón de tokens de entrada encontrados en caché, 3,00 dólares por millón de tokens de entrada no encontrados en caché y 15,00 dólares por millón de tokens de salida, incluido el razonamiento.

Para 200.000 tokens de entrada sin caché y 20.000 tokens de salida:

0.2 × $3.00 + 0.02 × $15.00 = $0.90.

Si los 200.000 tokens de entrada fueran aciertos de caché, el mismo patrón de tokens costaría 0,36 dólares. La reutilización total de la caché es un caso límite, no una previsión. Los resultados de las herramientas, los cambios en archivos y el historial de la conversación suelen modificar el prefijo reutilizable. Registra los aciertos y fallos de caché, la salida y el razonamiento, en lugar de calcular el coste a partir del tamaño nominal del contexto.

Interpreta los benchmarks de programación junto con su entorno

Moonshot comunica para Kimi K3 resultados que incluyen 88,3 en Terminal-Bench 2.1, 67,5 en DeepSWE, 77,8 en ProgramBench, 81,2 en FrontierSWE, 42,0 en SWE-Marathon y 72,9 en Kimi Code Bench 2.0. Son resultados comunicados por el proveedor. El repositorio señala que Kimi K3 utiliza el esfuerzo de razonamiento max y que algunas evaluaciones de programación usan el entorno Kimi Code, mientras que los competidores pueden utilizar otros entornos publicados.

La unidad de comparación útil es:

model + harness + effort + endpoint + task.

Una puntuación no indica cuántos tokens consumió el agente, si se limitó a los archivos solicitados o cuántas veces tuvo que redirigirlo una persona.

Conecta Kimi K3 a herramientas de programación

Moonshot publica guías oficiales independientes para Claude Code, Codex CLI y OpenCode. No des por sentado que una configuración funcionará sin cambios en las tres herramientas.

  1. Elige la herramienta y la ruta de protocolo indicada en su documentación; no reutilices el endpoint de otro cliente.
  2. Introduce la clave de API mediante el mecanismo de credenciales de la herramienta y configura el endpoint y el modelo requeridos exactamente como se documenta a continuación.
  3. Reinicia el cliente, ejecuta una tarea de solo lectura y verifica el modelo y la Base URL efectivos, además del consumo, antes de permitir cambios en archivos.

Para Claude Code, la configuración internacional documentada y compatible con Anthropic utiliza:

export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic" export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY" export ANTHROPIC_MODEL="kimi-k3[1m]"

Reinicia el cliente, ejecuta /status y confirma la Base URL y el modelo efectivos. No incluyas la clave en un commit ni la pegues en una incidencia.

Codex CLI utiliza la API Responses, mientras que Kimi K3 expone Chat Completions. La guía de Moonshot usa CC Switch como router local entre esos contratos. Trata ese router como un componente de confianza independiente: comprueba su código fuente, proceso de actualización, almacenamiento de credenciales y ruta activa antes de permitir cambios en archivos.

Para OpenCode, ejecuta opencode auth login, elige Moonshot AI e introduce la clave en el diálogo de credenciales. Después, usa /models y /variants para seleccionar Kimi K3 y su esfuerzo. Empieza con una tarea de solo lectura y comprueba el modelo y el uso en el panel del proveedor.

Convierte los informes de usuarios en casos de prueba

Las incidencias #1911 y #2031 de MoonshotAI/kimi-code describen bloqueos, interrupciones poco eficaces, ampliación del alcance y un consumo de tokens de entrada inusualmente alto en sesiones concretas. Estos informes no representan una tasa de error para todos los usuarios. Son motivos para probar límites de archivos explícitos, límites de iteraciones, cancelación, contabilidad de tokens y recuperación tras una llamada fallida a una herramienta.

Prepara cinco tareas representativas: un error local, un cambio en varios archivos, la incorporación de una prueba, una búsqueda en el repositorio y una tarea con entrada visual. Fija el commit, el prompt, las herramientas, el tiempo de espera y la prueba de aceptación. Registra la entrada, la caché, la salida, el razonamiento, la duración, las intervenciones manuales y las infracciones del alcance. El resultado mostrará si Kimi K3 encaja como agente predeterminado, como modelo para tareas difíciles o como alternativa.

¿Quieres optimizar tu flujo de trabajo con LLM?

Conecta modelos mediante una API, gestiona claves y controla el gasto en IA.