Kimi K3 para programar: costes, benchmarks y configuración de herramientas
Una evaluación práctica de Kimi K3 para programar basada en costes de API, benchmarks del proveedor, configuración de herramientas y comprobaciones concretas de alcance, latencia y consumo de tokens.
Índice
Kimi K3 puede ser una opción para sesiones de programación largas, repositorios grandes y tareas que combinan código con entradas visuales. Elegirlo solo por una tabla de clasificación es arriesgado: los resultados dependen del entorno de evaluación, el esfuerzo de razonamiento, el endpoint y la tarea. Además, su razonamiento siempre activo puede hacer que los ciclos cortos sean más lentos y costosos de lo esperado.
Compruebe el precio actual del modelo antes de probarlo.
| Tu carga de trabajo | Qué comprobar con Kimi K3 | Cuándo elegir otro modelo |
|---|---|---|
| Ejecución larga de un agente en un repositorio grande | Si se mantiene dentro del alcance y completa la verificación | Si amplía la tarea o requiere intervenciones repetidas |
| Cambios pequeños y frecuentes | El tiempo de respuesta y el coste de la salida de razonamiento | Si un modelo más ligero logra el mismo resultado más rápido |
| Código con entrada visual | Si la visión nativa mejora tu prueba de aceptación real | Si la imagen no influye en el criterio de aprobación |
Qué publicó Moonshot AI
El repositorio oficial de Kimi K3 describe un modelo MoE disperso con 2,8 billones de parámetros totales y 104.000 millones activados por token. Admite una ventana de contexto de 1.048.576 tokens, entrada nativa de texto, imagen y vídeo y un modo de razonamiento que permanece habilitado.
Una ventana de contexto grande representa capacidad, no garantiza que se aproveche bien cada token de un repositorio. Una evaluación útil debe comprobar si el agente encuentra los archivos correctos, respeta el alcance, se recupera tras errores de herramientas y termina dentro del presupuesto.
Calcula el coste de la API antes de la prueba
Las tarifas y la disponibilidad cambian: consulta el catálogo del proveedor elegido el día de la prueba. Para estimar una ejecución, multiplica los tokens reales de entrada y salida por las tarifas actuales correspondientes. Si hay una tarifa separada para cache hit, aplícala solo al volumen confirmado en caché; no traslades descuentos entre proveedores.
Usa tarifas actuales para el cálculo, no una comparación antigua. Abrir precios actuales de BetterToken
Tanto en la API oficial como en un proveedor compatible, el coste total no depende solo de la entrada: el razonamiento largo se factura como salida y puede ser el gasto principal.
Interpreta los benchmarks de programación junto con su entorno
Moonshot comunica para Kimi K3 resultados que incluyen 88,3 en Terminal-Bench 2.1, 67,5 en DeepSWE, 77,8 en ProgramBench, 81,2 en FrontierSWE, 42,0 en SWE-Marathon y 72,9 en Kimi Code Bench 2.0. Son resultados comunicados por el proveedor. El repositorio señala que Kimi K3 utiliza el esfuerzo de razonamiento max y que algunas evaluaciones de programación usan el entorno Kimi Code, mientras que los competidores pueden utilizar otros entornos publicados.
La unidad de comparación útil es:
model + harness + effort + endpoint + task.
Una puntuación no indica cuántos tokens consumió el agente, si se limitó a los archivos solicitados o cuántas veces tuvo que redirigirlo una persona.
Conecta Kimi K3 a herramientas de programación
Moonshot publica guías oficiales independientes para Claude Code, Codex CLI y OpenCode. No des por sentado que una configuración funcionará sin cambios en las tres herramientas.
- Elige la herramienta y la ruta de protocolo indicada en su documentación; no reutilices el endpoint de otro cliente.
- Introduce la clave de API mediante el mecanismo de credenciales de la herramienta y configura el endpoint y el modelo requeridos exactamente como se documenta a continuación.
- Reinicia el cliente, ejecuta una tarea de solo lectura y verifica el modelo y la Base URL efectivos, además del consumo, antes de permitir cambios en archivos.
Para Claude Code, la configuración internacional documentada y compatible con Anthropic utiliza:
export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="kimi-k3[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="kimi-k3[1m]"
export CLAUDE_CODE_SUBAGENT_MODEL="kimi-k3[1m]"
Reinicia el cliente, ejecuta /status y confirma la Base URL y el modelo efectivos. No incluyas la clave en un commit ni la pegues en una incidencia.
No mezcles claves de Moonshot Open Platform y Kimi Code con la Base URL de otra plataforma. Los dominios y tipos de clave son distintos; un 401 en esta configuración no dice nada sobre la calidad del modelo.
Moonshot admite la API Responses, así que Codex se conecta directamente a Kimi K3 sin proxy local ni conversión de protocolo. Guarda la clave en KIMI_API_KEY, no en config.toml, y añade esto a ~/.codex/config.toml:
model = "kimi-k3"
model_provider = "kimi"
model_context_window = 1048576
[model_providers.kimi]
name = "Kimi"
base_url = "https://api.moonshot.ai/v1"
env_key = "KIMI_API_KEY"
wire_api = "responses"
Reinicia Codex por completo, confirma que el modelo actual es kimi-k3 y envía una petición breve sin cambiar archivos. Desktop y CLI leen la misma configuración de usuario. Codex no tiene canal de vídeo integrado; para vídeo usa la API directa de Kimi documentada.
Para OpenCode, ejecuta opencode auth login, elige Moonshot AI e introduce la clave en el diálogo de credenciales. Después, usa /models y /variants para seleccionar Kimi K3 y su esfuerzo. Empieza con una tarea de solo lectura y comprueba el modelo y el uso en el panel del proveedor.
Convierte los informes de usuarios en casos de prueba
En la incidencia #1911, un usuario describió bloqueos, una respuesta débil a la interrupción y ampliación del alcance. En la #2031, el autor informó de una sesión con 18,3 millones de tokens de entrada. Son dos informes de usuarios distintos, no una reproducción independiente ni una tasa de error para todos los usuarios. Son motivos para probar límites de archivos explícitos, límites de iteraciones, cancelación, contabilidad de tokens y recuperación tras una llamada fallida a una herramienta.
Prepara cinco tareas representativas: un error local, un cambio en varios archivos, la incorporación de una prueba, una búsqueda en el repositorio y una tarea con entrada visual. Fija el commit, el prompt, las herramientas, el tiempo de espera y la prueba de aceptación. Registra la entrada, la caché, la salida, el razonamiento, la duración, las intervenciones manuales y las infracciones del alcance. El resultado mostrará si Kimi K3 encaja como agente predeterminado, como modelo para tareas difíciles o como alternativa.