Kontextkosten von KI-Agenten: Wiederholte Prompts und Tool Calls messen

Praxisleitfaden zur Messung und Optimierung der Kontextkosten in mehrstufigen KI-Agenten: Tool-Schemas, Baseline-Messung und Qualitätskontrolle.

Bei der Entwicklung autonomer KI-Agenten (Claude Code, Cline, Roo Code oder eigener Multi-Step-Pipelines) stellen Entwickler häufig ein explosives Wachstum der API-Kosten fest. Die Ursache liegt in der Kontextweitergabe: Bei jedem Schritt des Denkzyklus liest das Modell den vollständigen System-Prompt, alle Tool-Schemas, den bisherigen Nachrichtenverlauf und die Rohausgaben ausgeführter Funktionen neu ein.

Um Budgets ohne Funktionsverlust zu steuern, empfiehlt sich die Messung einer Baseline auf einer definierten Aufgabe und die schrittweise Optimierung einzelner Variablen.

Die Anatomie des Agentenkontexts: Wo Token pro Schritt anfallen

Das Kontextfenster eines Agenten besteht bei jedem Schritt aus vier Schichten:

  1. System-Prompts und Richtlinien: Grundlegende Stilvorgaben, Sicherheitsgrenzen und Workspace-Regeln.
  2. Tool-Schemas: JSON-Beschreibungen aller verfügbaren Funktionen und Parametertypen. Bei 20 Tools wird deren Schema bei jedem Aufruf erneut übertragen (3.000 bis 15.000 Token pro Schritt).
  3. Nachrichtenverlauf (Message History): Bisherige Benutzeranweisungen und Antworten des Modells.
  4. Tool-Ausgaben (Tool Outputs): Datei-Inhalte, Terminal-Logs und Rohantworten von APIs.

Bei 10 Schritten wird ein Basiskontext von 15.000 Token ohne Prompt-Caching zehnmal als Input berechnet.

Übersicht der Kontextquellen und Optimierungsmethoden

KontextkomponenteAnteil am GesamtvolumenHauptrisikoOptimierungsmethode
Tool-Schemas20–40%Dutzende ungenutzte Tools in der globalen ListeSubagenten mit spezialisierten Toolsets
Tool-Ausgaben30–60%Vollständiges Einlesen großer DateienZeilenlimits (Slices) und Grep-Filter
Nachrichtenverlauf15–30%Anhäufung fehlgeschlagener ZwischenschritteVerlauf zusammenfassen und alte Schritte bereinigen
System-Prompt5–15%Dynamisch wechselnde InstruktionenFeste Prompt-Präfixe für Prompt-Caching

Schritt-für-Schritt-Anleitung: Baseline messen und Kosten senken

Nutzen Sie diesen Ansatz für messbare Einsparungen:

Schritt 1. Reproduzierbare Kontrollaufgabe festlegen

Wählen Sie ein realistisches Programmierszenario mit automatischer Prüfung (z. B. "Validierungsfunktion finden, Edge Case ergänzen, Tests ausführen"). Das Kriterium ist ein Exit-Code 0 bei pytest oder bun test.

Schritt 2. Baseline messen (Input, Output, Cache)

Führen Sie die Aufgabe mit der Standardkonfiguration aus und erfassen Sie:

  • Anzahl der Ausführungsschritte (z. B. 10 Schritte);
  • Gesamte Input-Token (z. B. 150.000 Token);
  • Gesamte Output-Token (z. B. 2.500 Token);
  • Gelesene Cache-Token;
  • Gesamtkosten nach aktuellen Tarifen.

Bei einem Input-Preis von 3,00pro1MTokenohneCachingbelaufensichdieKostenfu¨r150.000InputTokenaufca.3,00 pro 1M Token ohne Caching belaufen sich die Kosten für 150.000 Input-Token auf ca. 0,45 pro Durchlauf.

Aktuelle Preise für führende Modelle finden Sie mit Stand vom 2026-08-22 auf der offiziellen BetterToken Preisseite. Das BetterToken Dashboard bietet detaillierte Verbrauchsstatistiken pro Einzelschritt.

Schritt 3. Einzelne Kontextvariablen isoliert testen

Führen Sie Testläufe durch und ändern Sie jeweils nur einen Parameter:

  • Experiment A (Tool-Filterung): Bereitstellung von nur 3 relevanten Tools statt 15 allgemeinen Tools (Einsparung von bis zu 8.000 Token pro Schritt).
  • Experiment B (Ausgabenbegrenzung): Kürzung von Terminalausgaben auf die ersten 50 Fehlerzeilen statt 2.000 Zeilen Log.
  • Experiment C (Prompt-Caching): Feste Strukturierung des System-Prompts am Anfang für Cache-Kosten von ca. $0,30 pro 1M gelesener Token.

Schritt 4. Wirtschaftlichkeit und Lösungsqualität bewerten

Vergleichen Sie die Ergebnisse mit der Baseline. Wenn die Testgenauigkeit stabil bleibt und das Input-Volumen um 40–60% sinkt, übernehmen Sie die Konfiguration.

Empfehlungen für Agentenarchitekturen

  1. Spezialisierte Subagenten nutzen: Übergeben Sie dem Hauptkoordinator keine Ausführungstools, sondern delegieren Sie Recherche an Read-Only-Subagenten.
  2. Statische Präfixe einhalten: Platzieren Sie unveränderliche Regeln ganz oben im Request, um Prompt-Caching optimal zu nutzen (bis zu 90% Rabatt auf Leseoperationen).
  3. Schrittgrenzen (Max Iterations) setzen: Definieren Sie feste Obergrenzen für Schleifen, um Endlosschleifen bei Fehlern zu unterbinden.

Häufige Fehlerquellen

  • Fehler: Zu starke Beschneidung von Schemas. Unvollständige Funktionsdefinitionen führen zu ungültigem JSON und teuren Wiederholungen.
  • Fehler: Unreflektierte Übernahme fremder Benchmarks. Einsparungen hängen stark von der Repository-Größe und Dateistruktur ab.
  • Fehler: Fehlende Verbrauchsmetriken. Nutzen Sie die BetterToken Dokumentation, um Token-Header korrekt auszuwerten.

Bereit, Ihren LLM-Workflow zu optimieren?

Verbinden Sie Modelle über eine API, verwalten Sie Schlüssel und behalten Sie KI-Kosten im Blick.