Coût de contexte d'un agent IA : mesurer les prompts et tool calls répétés
Guide pratique pour mesurer et optimiser les coûts de contexte dans les agents IA multi-étapes : profils de tool schemas, mesure de baseline et validation.
Lors du développement d'agents autonomes d'IA (Claude Code, Cline, Roo Code ou pipelines multi-étapes internes), les équipes observent fréquemment une explosion des factures d'API. Ce phénomène provient de la transmission cumulative du contexte : à chaque cycle de raisonnement, le modèle relit l'intégralité du prompt système, la liste complète des schémas d'outils (tool schemas), l'historique de discussion et les sorties brutes des fonctions exécutées.
Pour maîtriser vos coûts sans dégrader la qualité, il est essentiel d'établir une référence (baseline) sur une tâche test et d'optimiser l'environnement agentique variable par variable.
Anatomie du contexte d'un agent IA : où vont vos jetons ?
La fenêtre de contexte d'un agent à chaque étape comprend quatre composants distincts :
- Instructions système (System Prompt) : Règles de style, contraintes de sécurité et directives globales.
- Schémas d'outils (Tool Schemas) : Spécifications JSON de toutes les fonctions connectées. Avec 20 outils, la définition de leurs schémas est réinjectée à chaque étape, consommant 3 000 à 15 000 jetons par appel.
- Historique des messages : Journal cumulé des instructions utilisateur et des réponses intermédiaires de l'agent.
- Sorties d'outils (Tool Outputs) : Contenu des fichiers lus, logs du terminal et réponses d'API.
Sur une séquence de 10 étapes, un contexte de base de 15 000 jetons sera facturé 10 fois en jetons d'entrée si le prompt caching n'est pas utilisé.
Tableau comparatif des composants de contexte et de leur optimisation
Guide étape par étape : mesurer la baseline et réduire les dépenses
Adoptez cette méthodologie d'évaluation à variable unique :
Étape 1. Fixer une tâche test reproductible
Sélectionnez un scénario de développement précis avec un critère de validation strict (par exemple : « localiser une fonction dans le dépôt, ajouter la gestion d'un cas limite et exécuter la suite de tests avec succès »).
Étape 2. Mesurer la Baseline (Entrée, Sortie, Cache)
Exécutez la tâche avec la configuration par défaut de l'agent et notez :
- Le nombre d'itérations réalisées (ex. 10 étapes) ;
- Le volume de jetons d'entrée (input, environ 150 000 jetons) ;
- Le volume de jetons générés (output, environ 2 500 jetons) ;
- Les lectures en cache (cached tokens) ;
- Le coût calculé selon les tarifs actifs.
À titre d'exemple, avec un tarif de 3,00 par exécution.
Au 2026-08-22, les tarifs officiels par million de jetons sont consultables sur la page des prix BetterToken. Le tableau de bord BetterToken Dashboard détaille la consommation de jetons étape par étape.
Étape 3. Tester une seule variable à la fois
Réalisez des exécutions de test en modifiant un seul paramètre par essai :
- Expérience A (Filtrage d'outils) : Limitez l'agent à 3 outils essentiels (read_file, replace_content, run_test) au lieu de 15 outils globaux (économie jusqu'à 8 000 jetons par étape).
- Expérience B (Troncature des sorties) : Limitez les logs de terminal aux 50 premières lignes de l'erreur plutôt qu'à 2 000 lignes brutes.
- Expérience C (Prompt Caching) : Placez le prompt système et les schémas au début du contexte pour abaisser le coût de lecture en cache à environ 0,30 $ par million de jetons.
Étape 4. Comparer l'impact économique et la qualité
Comparez les résultats avec la baseline. Si le taux de succès des tests reste identique et que la consommation d'entrée baisse de 40 à 60 %, déployez la modification.
Recommandations d'architecture pour agents IA
- Créer des sous-agents dédiés : Évitez de confier tous les outils à un seul agent. Créez des agents spécialisés en lecture seule pour la phase d'exploration.
- Stabiliser les préfixes de requêtes : Placez les instructions statiques en tête de prompt pour maximiser le prompt caching (jusqu'à 90 % de réduction sur la lecture).
- Définir un plafond d'itérations : Limitez strictement le nombre de cycles (ex. 15 étapes max) pour stopper les boucles d'erreurs infinies.
Pièges courants à éviter
- Piège : Définitions de schémas incomplètes. Supprimer des paramètres essentiels pousse le modèle à générer des formats invalides, augmentant les relances.
- Piège : Se fier aux affirmations non vérifiées des réseaux sociaux. Les gains réels dépendent de la taille de vos fichiers et de votre dépôt.
- Piège : Absence de télémétrie granulaire. Consultez la documentation BetterToken pour vérifier l'activation du caching et le suivi des requêtes.