Kimi K3 pour le code : coûts, benchmarks et configuration des outils
Une évaluation pratique de Kimi K3 pour le code, fondée sur les coûts API, les benchmarks du fournisseur, la configuration des outils et des contrôles concrets du périmètre, de la latence et des tokens.
Sommaire
Kimi K3 peut convenir aux longues sessions de code, aux grands dépôts et aux tâches qui associent du code à une entrée visuelle. Le choisir sur la seule base d’un classement est risqué : les résultats dépendent du harnais, de l’effort de raisonnement, de l’endpoint et de la tâche. Son mode de réflexion toujours actif peut aussi rendre les boucles courtes plus lentes et plus coûteuses que prévu.
Vérifiez le prix actuel du modèle avant le test.
| Votre charge de travail | Ce qu’il faut vérifier avec Kimi K3 | Quand choisir un autre modèle |
|---|---|---|
| Longue exécution d’un agent dans un grand dépôt | S’il respecte le périmètre et termine la vérification | S’il élargit la tâche ou exige des interventions répétées |
| Petites modifications fréquentes | Le temps de réponse et le coût de la sortie de raisonnement | Si un modèle plus léger obtient le même résultat plus vite |
| Code avec entrée visuelle | Si la vision native améliore votre véritable test d’acceptation | Si l’image n’influe pas sur le critère de réussite |
Ce que Moonshot AI a publié
Le dépôt officiel de Kimi K3 décrit un modèle MoE clairsemé de 2,8 billions de paramètres au total, dont 104 milliards sont activés par token. Il prend en charge une fenêtre de contexte de 1 048 576 tokens, les entrées natives de texte, d’image et de vidéo, ainsi qu’un mode de réflexion qui reste activé.
Une grande fenêtre de contexte représente une capacité, pas la garantie que chaque token d’un dépôt sera bien exploité. Une évaluation utile doit vérifier si l’agent trouve les bons fichiers, respecte le périmètre, récupère après une erreur d’outil et termine dans les limites du budget.
Calculer le coût de l’API avant le test
Les tarifs et la disponibilité changent : consultez le catalogue du fournisseur choisi le jour du test. Pour estimer une exécution, multipliez les tokens d’entrée et de sortie réellement utilisés par les tarifs actuels correspondants. S’il existe un tarif distinct pour les cache hits, appliquez-le seulement au volume mis en cache confirmé ; ne transférez pas une remise d’un fournisseur à l’autre.
Utilisez les tarifs actuels, pas une ancienne comparaison. Ouvrir les prix actuels de BetterToken
Avec l’API officielle comme avec un fournisseur compatible, le coût total ne dépend pas seulement de l’entrée : un long raisonnement est facturé en sortie et peut devenir la dépense principale.
Lire les benchmarks de code avec leur harnais
Moonshot publie notamment les scores suivants pour Kimi K3 : 88,3 à Terminal-Bench 2.1, 67,5 à DeepSWE, 77,8 à ProgramBench, 81,2 à FrontierSWE, 42,0 à SWE-Marathon et 72,9 à Kimi Code Bench 2.0. Il s’agit de résultats communiqués par le fournisseur. Le dépôt précise que Kimi K3 utilise l’effort de raisonnement max et que certaines évaluations de code emploient le harnais Kimi Code, tandis que les concurrents peuvent utiliser d’autres harnais publiés.
L’unité de comparaison pertinente est :
model + harness + effort + endpoint + task.
Un score ne précise ni le nombre de tokens consommés par l’agent, ni s’il est resté dans les fichiers demandés, ni le nombre de réorientations humaines nécessaires.
Connecter Kimi K3 aux outils de code
Moonshot publie des guides officiels distincts pour Claude Code, Codex CLI et OpenCode. Ne supposez pas qu’une même configuration fonctionne sans changement dans les trois outils.
- Choisissez l’outil et le chemin de protocole indiqué dans sa documentation ; ne réutilisez pas l’endpoint d’un autre client.
- Saisissez la clé API au moyen du mécanisme d’identification de l’outil, puis configurez l’endpoint et le modèle requis exactement comme indiqué ci-dessous.
- Redémarrez le client, exécutez une tâche en lecture seule, puis vérifiez le modèle et la Base URL réellement utilisés ainsi que la consommation avant d’autoriser toute modification de fichier.
Pour Claude Code, la configuration internationale compatible avec Anthropic documentée utilise :
export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="kimi-k3[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="kimi-k3[1m]"
export CLAUDE_CODE_SUBAGENT_MODEL="kimi-k3[1m]"
Redémarrez le client, exécutez /status, puis confirmez la Base URL et le modèle effectivement utilisés. Ne commitez pas la clé et ne la collez pas dans une issue.
Ne mélangez pas les clés de Moonshot Open Platform et de Kimi Code avec la Base URL d’une autre plateforme. Les domaines et types de clés diffèrent ; un 401 dans cette configuration ne dit rien de la qualité du modèle.
Moonshot prend en charge l’API Responses : Codex se connecte donc directement à Kimi K3, sans proxy local ni conversion de protocole. Conservez la clé dans KIMI_API_KEY, pas dans config.toml, puis ajoutez ceci à ~/.codex/config.toml :
model = "kimi-k3"
model_provider = "kimi"
model_context_window = 1048576
[model_providers.kimi]
name = "Kimi"
base_url = "https://api.moonshot.ai/v1"
env_key = "KIMI_API_KEY"
wire_api = "responses"
Redémarrez complètement Codex, confirmez que le modèle actif est kimi-k3, puis envoyez une courte requête sans modifier de fichiers. Desktop et CLI lisent la même configuration utilisateur. Codex n’a pas de canal vidéo intégré ; utilisez pour la vidéo l’API Kimi directe documentée.
Pour OpenCode, exécutez opencode auth login, choisissez Moonshot AI, puis saisissez la clé dans la boîte de dialogue des identifiants. Utilisez ensuite /models et /variants pour sélectionner Kimi K3 et son niveau d’effort. Commencez par une tâche en lecture seule et vérifiez le modèle et l’utilisation dans le tableau de bord du fournisseur.
Transformer les retours d’utilisateurs en cas de test
Dans l’issue #1911, un utilisateur décrit des blocages, une interruption peu fiable et un élargissement du périmètre. Dans la #2031, l’auteur signale une session avec 18,3 millions de tokens d’entrée. Ce sont deux témoignages distincts, pas une reproduction indépendante ni une statistique sur l’ensemble du modèle. Ils justifient de tester des limites de fichiers explicites, un nombre maximal d’itérations, l’annulation, le décompte des tokens et la reprise après l’échec d’un appel d’outil.
Préparez cinq tâches représentatives : un bug local, une modification de plusieurs fichiers, l’ajout d’un test, une recherche dans le dépôt et une tâche avec entrée visuelle. Figez le commit, le prompt, les outils, le délai d’expiration et le test d’acceptation. Relevez l’entrée, le cache, la sortie, le raisonnement, la durée, les interventions manuelles et les violations du périmètre. Le résultat indiquera si Kimi K3 convient comme agent par défaut, comme modèle pour les tâches difficiles ou comme solution de repli.