Invitez et gagnez

Fonctionnement des récompenses

Partagez votre lien. Lorsqu’un ami s’inscrit avec ce lien et recharge son solde, vous recevez la récompense affichée sur ses recharges ultérieures.

Kimi K3 pour le code : coûts, benchmarks et configuration des outils

Une évaluation pratique de Kimi K3 pour le code, fondée sur les coûts API, les benchmarks du fournisseur, la configuration des outils et des contrôles concrets du périmètre, de la latence et des tokens.

Sommaire

Kimi K3 peut convenir aux longues sessions de code, aux grands dépôts et aux tâches qui associent du code à une entrée visuelle. Le choisir sur la seule base d’un classement est risqué : les résultats dépendent du harnais, de l’effort de raisonnement, de l’endpoint et de la tâche. Son mode de réflexion toujours actif peut aussi rendre les boucles courtes plus lentes et plus coûteuses que prévu.

Vérifiez le prix actuel du modèle avant le test.

Votre charge de travailCe qu’il faut vérifier avec Kimi K3Quand choisir un autre modèle
Longue exécution d’un agent dans un grand dépôtS’il respecte le périmètre et termine la vérificationS’il élargit la tâche ou exige des interventions répétées
Petites modifications fréquentesLe temps de réponse et le coût de la sortie de raisonnementSi un modèle plus léger obtient le même résultat plus vite
Code avec entrée visuelleSi la vision native améliore votre véritable test d’acceptationSi l’image n’influe pas sur le critère de réussite

Ce que Moonshot AI a publié

Le dépôt officiel de Kimi K3 décrit un modèle MoE clairsemé de 2,8 billions de paramètres au total, dont 104 milliards sont activés par token. Il prend en charge une fenêtre de contexte de 1 048 576 tokens, les entrées natives de texte, d’image et de vidéo, ainsi qu’un mode de réflexion qui reste activé.

Une grande fenêtre de contexte représente une capacité, pas la garantie que chaque token d’un dépôt sera bien exploité. Une évaluation utile doit vérifier si l’agent trouve les bons fichiers, respecte le périmètre, récupère après une erreur d’outil et termine dans les limites du budget.

Calculer le coût de l’API avant le test

Les tarifs et la disponibilité changent : consultez le catalogue du fournisseur choisi le jour du test. Pour estimer une exécution, multipliez les tokens d’entrée et de sortie réellement utilisés par les tarifs actuels correspondants. S’il existe un tarif distinct pour les cache hits, appliquez-le seulement au volume mis en cache confirmé ; ne transférez pas une remise d’un fournisseur à l’autre.

Utilisez les tarifs actuels, pas une ancienne comparaison. Ouvrir les prix actuels de BetterToken

Avec l’API officielle comme avec un fournisseur compatible, le coût total ne dépend pas seulement de l’entrée : un long raisonnement est facturé en sortie et peut devenir la dépense principale.

Lire les benchmarks de code avec leur harnais

Moonshot publie notamment les scores suivants pour Kimi K3 : 88,3 à Terminal-Bench 2.1, 67,5 à DeepSWE, 77,8 à ProgramBench, 81,2 à FrontierSWE, 42,0 à SWE-Marathon et 72,9 à Kimi Code Bench 2.0. Il s’agit de résultats communiqués par le fournisseur. Le dépôt précise que Kimi K3 utilise l’effort de raisonnement max et que certaines évaluations de code emploient le harnais Kimi Code, tandis que les concurrents peuvent utiliser d’autres harnais publiés.

L’unité de comparaison pertinente est :

model + harness + effort + endpoint + task.

Un score ne précise ni le nombre de tokens consommés par l’agent, ni s’il est resté dans les fichiers demandés, ni le nombre de réorientations humaines nécessaires.

Connecter Kimi K3 aux outils de code

Moonshot publie des guides officiels distincts pour Claude Code, Codex CLI et OpenCode. Ne supposez pas qu’une même configuration fonctionne sans changement dans les trois outils.

  1. Choisissez l’outil et le chemin de protocole indiqué dans sa documentation ; ne réutilisez pas l’endpoint d’un autre client.
  2. Saisissez la clé API au moyen du mécanisme d’identification de l’outil, puis configurez l’endpoint et le modèle requis exactement comme indiqué ci-dessous.
  3. Redémarrez le client, exécutez une tâche en lecture seule, puis vérifiez le modèle et la Base URL réellement utilisés ainsi que la consommation avant d’autoriser toute modification de fichier.

Pour Claude Code, la configuration internationale compatible avec Anthropic documentée utilise :

export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="kimi-k3[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="kimi-k3[1m]"
export CLAUDE_CODE_SUBAGENT_MODEL="kimi-k3[1m]"

Redémarrez le client, exécutez /status, puis confirmez la Base URL et le modèle effectivement utilisés. Ne commitez pas la clé et ne la collez pas dans une issue.

Ne mélangez pas les clés de Moonshot Open Platform et de Kimi Code avec la Base URL d’une autre plateforme. Les domaines et types de clés diffèrent ; un 401 dans cette configuration ne dit rien de la qualité du modèle.

Moonshot prend en charge l’API Responses : Codex se connecte donc directement à Kimi K3, sans proxy local ni conversion de protocole. Conservez la clé dans KIMI_API_KEY, pas dans config.toml, puis ajoutez ceci à ~/.codex/config.toml :

model = "kimi-k3"
model_provider = "kimi"
model_context_window = 1048576

[model_providers.kimi]
name = "Kimi"
base_url = "https://api.moonshot.ai/v1"
env_key = "KIMI_API_KEY"
wire_api = "responses"

Redémarrez complètement Codex, confirmez que le modèle actif est kimi-k3, puis envoyez une courte requête sans modifier de fichiers. Desktop et CLI lisent la même configuration utilisateur. Codex n’a pas de canal vidéo intégré ; utilisez pour la vidéo l’API Kimi directe documentée.

Pour OpenCode, exécutez opencode auth login, choisissez Moonshot AI, puis saisissez la clé dans la boîte de dialogue des identifiants. Utilisez ensuite /models et /variants pour sélectionner Kimi K3 et son niveau d’effort. Commencez par une tâche en lecture seule et vérifiez le modèle et l’utilisation dans le tableau de bord du fournisseur.

Transformer les retours d’utilisateurs en cas de test

Dans l’issue #1911, un utilisateur décrit des blocages, une interruption peu fiable et un élargissement du périmètre. Dans la #2031, l’auteur signale une session avec 18,3 millions de tokens d’entrée. Ce sont deux témoignages distincts, pas une reproduction indépendante ni une statistique sur l’ensemble du modèle. Ils justifient de tester des limites de fichiers explicites, un nombre maximal d’itérations, l’annulation, le décompte des tokens et la reprise après l’échec d’un appel d’outil.

Préparez cinq tâches représentatives : un bug local, une modification de plusieurs fichiers, l’ajout d’un test, une recherche dans le dépôt et une tâche avec entrée visuelle. Figez le commit, le prompt, les outils, le délai d’expiration et le test d’acceptation. Relevez l’entrée, le cache, la sortie, le raisonnement, la durée, les interventions manuelles et les violations du périmètre. Le résultat indiquera si Kimi K3 convient comme agent par défaut, comme modèle pour les tâches difficiles ou comme solution de repli.

Sources

Prêt à optimiser votre workflow LLM ?

Connectez vos modèles via une API unique, gérez les clés et maîtrisez vos dépenses d’IA.

Commencer gratuitement