Kontextkosten von KI-Agenten: Wiederholte Prompts und Tool Calls messen
Praxisleitfaden zur Messung und Optimierung der Kontextkosten in mehrstufigen KI-Agenten: Tool-Schemas, Baseline-Messung und Qualitätskontrolle.
Bei der Entwicklung autonomer KI-Agenten (Claude Code, Cline, Roo Code oder eigener Multi-Step-Pipelines) stellen Entwickler häufig ein explosives Wachstum der API-Kosten fest. Die Ursache liegt in der Kontextweitergabe: Bei jedem Schritt des Denkzyklus liest das Modell den vollständigen System-Prompt, alle Tool-Schemas, den bisherigen Nachrichtenverlauf und die Rohausgaben ausgeführter Funktionen neu ein.
Um Budgets ohne Funktionsverlust zu steuern, empfiehlt sich die Messung einer Baseline auf einer definierten Aufgabe und die schrittweise Optimierung einzelner Variablen.
Die Anatomie des Agentenkontexts: Wo Token pro Schritt anfallen
Das Kontextfenster eines Agenten besteht bei jedem Schritt aus vier Schichten:
- System-Prompts und Richtlinien: Grundlegende Stilvorgaben, Sicherheitsgrenzen und Workspace-Regeln.
- Tool-Schemas: JSON-Beschreibungen aller verfügbaren Funktionen und Parametertypen. Bei 20 Tools wird deren Schema bei jedem Aufruf erneut übertragen (3.000 bis 15.000 Token pro Schritt).
- Nachrichtenverlauf (Message History): Bisherige Benutzeranweisungen und Antworten des Modells.
- Tool-Ausgaben (Tool Outputs): Datei-Inhalte, Terminal-Logs und Rohantworten von APIs.
Bei 10 Schritten wird ein Basiskontext von 15.000 Token ohne Prompt-Caching zehnmal als Input berechnet.
Übersicht der Kontextquellen und Optimierungsmethoden
Schritt-für-Schritt-Anleitung: Baseline messen und Kosten senken
Nutzen Sie diesen Ansatz für messbare Einsparungen:
Schritt 1. Reproduzierbare Kontrollaufgabe festlegen
Wählen Sie ein realistisches Programmierszenario mit automatischer Prüfung (z. B. "Validierungsfunktion finden, Edge Case ergänzen, Tests ausführen"). Das Kriterium ist ein Exit-Code 0 bei pytest oder bun test.
Schritt 2. Baseline messen (Input, Output, Cache)
Führen Sie die Aufgabe mit der Standardkonfiguration aus und erfassen Sie:
- Anzahl der Ausführungsschritte (z. B. 10 Schritte);
- Gesamte Input-Token (z. B. 150.000 Token);
- Gesamte Output-Token (z. B. 2.500 Token);
- Gelesene Cache-Token;
- Gesamtkosten nach aktuellen Tarifen.
Bei einem Input-Preis von 0,45 pro Durchlauf.
Aktuelle Preise für führende Modelle finden Sie mit Stand vom 2026-08-22 auf der offiziellen BetterToken Preisseite. Das BetterToken Dashboard bietet detaillierte Verbrauchsstatistiken pro Einzelschritt.
Schritt 3. Einzelne Kontextvariablen isoliert testen
Führen Sie Testläufe durch und ändern Sie jeweils nur einen Parameter:
- Experiment A (Tool-Filterung): Bereitstellung von nur 3 relevanten Tools statt 15 allgemeinen Tools (Einsparung von bis zu 8.000 Token pro Schritt).
- Experiment B (Ausgabenbegrenzung): Kürzung von Terminalausgaben auf die ersten 50 Fehlerzeilen statt 2.000 Zeilen Log.
- Experiment C (Prompt-Caching): Feste Strukturierung des System-Prompts am Anfang für Cache-Kosten von ca. $0,30 pro 1M gelesener Token.
Schritt 4. Wirtschaftlichkeit und Lösungsqualität bewerten
Vergleichen Sie die Ergebnisse mit der Baseline. Wenn die Testgenauigkeit stabil bleibt und das Input-Volumen um 40–60% sinkt, übernehmen Sie die Konfiguration.
Empfehlungen für Agentenarchitekturen
- Spezialisierte Subagenten nutzen: Übergeben Sie dem Hauptkoordinator keine Ausführungstools, sondern delegieren Sie Recherche an Read-Only-Subagenten.
- Statische Präfixe einhalten: Platzieren Sie unveränderliche Regeln ganz oben im Request, um Prompt-Caching optimal zu nutzen (bis zu 90% Rabatt auf Leseoperationen).
- Schrittgrenzen (Max Iterations) setzen: Definieren Sie feste Obergrenzen für Schleifen, um Endlosschleifen bei Fehlern zu unterbinden.
Häufige Fehlerquellen
- Fehler: Zu starke Beschneidung von Schemas. Unvollständige Funktionsdefinitionen führen zu ungültigem JSON und teuren Wiederholungen.
- Fehler: Unreflektierte Übernahme fremder Benchmarks. Einsparungen hängen stark von der Repository-Größe und Dateistruktur ab.
- Fehler: Fehlende Verbrauchsmetriken. Nutzen Sie die BetterToken Dokumentation, um Token-Header korrekt auszuwerten.