Self-hosted LLM oder API: Gesamtkosten für Teams vergleichen
Ein praxisnahes TCO-Modell für Self-hosted LLM und API, das über GPU-Preis und Token-Tarif hinausgeht.
GPU-Preis und Tarif pro Million Token bilden nicht die Gesamtkosten ab. Ein lokales Modell benötigt Kapazität, Updates, Observability, Sicherheit, Backup und Engineering-Zeit. Eine API verlagert einen Teil dieser Infrastruktur, lässt aber Nutzungs-, Integrations- und Limitkosten sowie die Abhängigkeit von einem externen Endpoint bestehen. Vergleichen Sie beide Wege mit denselben Aufgaben und derselben Qualitätsgrenze. Gesucht ist kein universeller Sieger, sondern eine reversible Konfiguration für das eigene Team.
1. Workload und Qualitätsgrenze festlegen
Wählen Sie 3–5 wiederkehrende Aufgaben: Dokumentklassifizierung nach fester schema, Suche in einer internen Wissensbasis, Code-Review mit test, strukturierter Bericht oder background batch. Erfassen Sie Input-/Output-Größe, Ausführungen an einem normalen Tag, Spitzenparallelität, erlaubte Zeit und Abnahmekriterium. Ein gültiges JSON, belegte Quellen oder ein bestandener test schaffen eine messbare Grenze.
Als messbare Pay-as-you-go-API zeigt das BetterToken Dashboard Zeitpunkt, Modell, HTTP-Status, Input, Output, Cache Token und Abbuchung. Prüfen Sie aktuelle Modelle und Preise, öffnen Sie den Workspace und übertragen Sie die Pilotwerte. BetterToken ist keine Self-hosting-Plattform, sondern in diesem Vergleich nur eine API-Option.
2. Self-hosted TCO umfasst mehr als die GPU
Messen Sie einen vollständigen Betriebszyklus mit mehreren normalen Tagen und mindestens einer erwarteten Spitze:
Verwenden Sie die tatsächlich geplante Konfiguration, Abschreibungsdauer und verfügbare Speichermenge. Ein Online-Betrag kann Gehäuse, Netzwerk, Redundanz, Versand und lokale Energiepreise auslassen. Prüfen Sie, ob Modell und Kontext ohne Änderung der Aufgabe oder Qualität in den Speicher passen. Protokollieren Sie Stunden für Runtime, Modellprüfung, Serving, Updates, Profiling, Queues, Observability, Zugriffskontrolle und Incidents.
Lokaler Betrieb kann mehr Kontrolle über den Datenstandort geben, erzeugt aber nicht automatisch Sicherheit. Berücksichtigen Sie OS-/Runtime-Patches, Secrets, Netzwerksegmentierung, Audit Logs, Backups und Administratorzugriff. Erfassen Sie Ausfallminuten und offene Jobs. Zweiter Knoten, Recovery Queue oder zugelassene API für nicht sensible Overflow-Last gehören ebenfalls zum TCO. Ein Verbot externer Datenübertragung ist eine harte Bedingung.
3. API-TCO beginnt bei Token
Normalisieren Sie Usage nach der tatsächlichen Schema des Providers und zählen Sie Cache Token im Input nicht doppelt.
Am 23. August 2026 zeigten die öffentlichen BetterToken-Daten für claude-sonnet-5 in der Claude-Gruppe $1.36 pro Million Input Token und $6.80 pro Million Output Token. Ohne Cache kosten 100.000 Input und 20.000 Output Token $0.272. Das Beispiel gilt nur für Modell, Gruppe und Datum. Prüfen Sie vor dem Pilot die aktuelle Preisseite und berechnen Sie Cache Read/Write nach aktueller Usage Schema. Ergänzen Sie Integration, 401/429/5xx-Behandlung, begrenzte Retries, Queues, Observability und Ergebnisprüfung.
4. Normal- und Spitzenlast getrennt testen
- Normal: typischer Ablauf einer Arbeitswoche.
- Spitze: vorher definierte Parallelität und Batch-Größe, ohne Qualitätsprüfungen abzuschalten.
Die Messwerte beschreiben nur die getestete Konfiguration und sind keine Zusage künftiger Stabilität.
5. Einen reversiblen Pilot durchführen
Migrieren Sie nicht sofort das ganze Produkt. Wählen Sie ein Szenario, behalten Sie eine gemeinsame Anwendungsschnittstelle und setzen Sie jeden Provider hinter einen Adapter. Fixieren Sie Inputs, Qualität und verbotene Daten; nutzen Sie dieselbe Stichprobe; messen Sie Normal- und Spitzenlast; zählen Sie Token, Infrastruktur und Stunden im selben Zeitraum; testen Sie Ausfall des lokalen Knotens und der externen API; wiederholen Sie nach Änderungen. API Key, .env, private Prompts und vollständige sensible Antworten gehören nicht in den Bericht.
6. Auswahl- und Ausstiegskriterien
Self-hosting kann passen, wenn der Datenstandort zwingend ist, der Workload planbar und das Team betriebsbereit ist. Eine API kann bei wechselnder Last, schnellem Start oder fehlender Runtime-Verantwortung passen. Hybrid kann sensible Aufgaben lokal halten und erlaubte Spitzen an die API geben.
- Self-hosted Pilot stoppen, wenn Qualität, Spitze oder Updates nicht in der verfügbaren Engineering-Zeit gelingen.
- API-Pilot stoppen, wenn Pflichtdaten nicht extern verarbeitet werden dürfen oder Kosten je akzeptierter Aufgabe unbeherrschbar sind.
- Nach Änderungen an Modell, Tarif, Hardware oder Workload beide Seiten neu berechnen.
- Keine niedrigere Summe wählen, die durch schlechtere Qualität oder fehlenden Fallback entsteht.
Das Ergebnis ist eine datierte TCO-Tabelle mit Konfiguration, Qualität, Spitzenverhalten und verantwortlicher Person.
Quellen
- Aktuelle BetterToken-Modelle und API-Preise
- BetterToken Docs
- BetterToken Public Pricing API,
claude-sonnet-5, erneut geprüft am 23. August 2026 - BetterToken Product Fact Sheet, Stand 31. Juli 2026