GPT-6 Luna vs. GPT-5.6 Luna: die realen Kosten einer akzeptierten Codex-Aufgabe berechnen
GPT-6 Luna hat deutlich niedrigere Tokenpreise als GPT-5.6 Luna. Für Codex sollte jedoch nicht allein der Listenpreis, sondern der Preis je akzeptierter Aufgabe entscheiden. Dieser Leitfaden nutzt am 2026-09-25 geprüfte Preise von OpenAI Standard und BetterToken, denselben hypothetischen Tokenmix und ein reproduzierbares Verfahren für Akzeptanzrate, Wiederholungen, Laufzeit und Gesamtkosten.
Inhalt

Sie müssen in Codex nicht entscheiden, welche Luna-Generation neuer klingt, sondern welches Modell den nächsten Aufgabenstapel zuerst bearbeiten soll und wann Sie nach einem Fehlschlag wechseln. Danach können Sie den ersten Kandidaten nach Versuchskosten wählen und mit Akzeptanzrate, Wiederholungen und manueller Nacharbeit die realen Kosten jeder erfolgreichen Aufgabe berechnen.
Hier beginnen: Für die meisten automatisch prüfbaren Aufgaben zuerst gpt-6-luna testen
gpt-6-luna ist der bessere erste Kandidat, wenn der Umfang klar ist und Tests, Lint oder ein Abnahmeskript schlechte Ergebnisse schnell ablehnen können. Die niedrigeren Kosten je Versuch ermöglichen eine günstige Basis, bevor Sie entscheiden, ob komplexe Arbeit zu gpt-5.6-luna wechseln sollte.
| Ihre Situation | Erster Schritt | Was die Empfehlung ändern würde |
|---|---|---|
| Kleine Korrekturen oder Serienänderungen mit automatisierten Tests | Mit gpt-6-luna beginnen | Wiederholte Fehlschläge oder manuelle Nacharbeit beseitigen den Preisvorteil |
| Dateiübergreifende Funktionen, Refactorings oder Schnittstellenänderungen | Beide Modelle paarweise testen | Diese Klasse gpt-5.6-luna geben, wenn Wiederholungen und Nacharbeit deutlich sinken |
| Eingabe liegt nahe bei oder über 272K | Unnötige Dateien entfernen, Verlauf kürzen oder Aufgabe teilen | Falls der Kontext nicht kleiner wird, mit Langkontextpreisen vergleichen |
| Sie nutzen ChatGPT- oder Codex-Tarifkontingente | Tarif-Dashboard und Credit-Regeln nutzen, nicht die API-Tabelle | Tokenpreise erst mit API Key oder custom provider anwenden |
Öffentliche Informationen enthalten noch keine gepaarten Ergebnisse mit derselben Codex-Version, demselben Repository und reasoning effort. Der Preis kann die Testreihenfolge bestimmen, das Standardmodell aber nur Ihre eigenen Aufgabendaten.
Ähnliche Schnittstellenlimits sagen die Codequalität nicht voraus
Die Kerninterfaces und Kontextgrenzen beider Modelle sind ähnlich; aus dem Datenblatt lässt sich daher nicht ableiten, welches in Ihrer Codebasis zuverlässiger ist. Beide unterstützen Text- und Bildeingabe, Textausgabe, Responses API, reasoning tokens und reasoning effort von none bis max; beide haben 1,050,000 Tokens Kontext, höchstens 922,000 Eingabe- und 128,000 Ausgabetokens.
| Punkt | gpt-6-luna | gpt-5.6-luna |
|---|---|---|
| Offizielle Positionierung | Effizientes Modell für fokussierte Aufgaben mit hohem Volumen | Modell für kostensensitive Workloads mit hohem Volumen |
| Wissensstichtag | 2026-05-18 | 2026-02-16 |
| Kontextfenster | 1,050,000 Tokens | 1,050,000 Tokens |
| Standardmäßiger reasoning effort | medium | medium |
Diese Angaben beweisen nicht, dass ein Modell in Ihrer Codebasis eine höhere Akzeptanzrate erzielt, schneller fertig wird oder weniger Wiederholungen braucht. Codex-Ergebnisse hängen außerdem von Aufgabentyp, Kontextqualität, Werkzeugberechtigungen, Clientversion, reasoning effort und den festgelegten Abnahmekriterien ab.
Bis 272K hat gpt-6-luna die niedrigeren Tokenpreise
Bei vollständigem Eingabekontext bis 272K kostet gpt-6-luna für Eingabe, Cache-Lesen und Cache-Schreiben die Hälfte; die Ausgabe kostet etwa 41.7% von gpt-5.6-luna. Die Tabelle wurde am 2026-09-25 geprüft, verwendet USD je 1 Million Tokens und vergleicht nur OpenAI Standard mit BetterToken-API-Abrechnung, nicht ChatGPT-/Codex-Tarifkontingente oder Credit-Abrechnung.
Bis einschließlich 272K: direkt mit dieser Tabelle rechnen
Bleibt der vollständige Eingabekontext jeder Anfrage bei höchstens 272K, verwenden Sie direkt diese Stufe ohne Langkontext-Multiplikatoren.
| Model ID | Anbieter | Eingabe | Cache-Lesen | Cache-Schreiben | Ausgabe |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.10 | $0.01 | $0.125 | $0.50 |
gpt-6-luna | BetterToken | $0.068 | $0.0068 | $0.085 | $0.34 |
gpt-5.6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $1.20 |
gpt-5.6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.816 |
BetterToken-Preise sind dynamisch. Deshalb sollten Sie am Veröffentlichungs- oder Kauftag die aktuellen Preise ansehen und die dann angezeigten Werte verwenden. BetterToken ist kein OpenAI-Produkt. Die obigen Tarife gelten für die GPT-Gruppe, die per API, Codex und in Werkzeugen mit benutzerdefinierter Base URL genutzt werden kann; sie sind keine ChatGPT- oder Codex-Abonnementkontingente.
OpenAI Batch und Flex kosten für diese Modelle 50% von Standard und liegen damit unter den hier gezeigten BetterToken-Tarifen. Sie sind nicht Bestandteil dieses Vergleichs. Aus der Tabelle darf daher nicht geschlossen werden, BetterToken sei günstiger als jede OpenAI-Verarbeitungsoption.
Über 272K: zuerst Eingabe reduzieren, dann Langkontextpreise nutzen
Wenn sich die Aufgabe teilen lässt, entfernen Sie irrelevante Dateien, kürzen Sie den Verlauf oder trennen Sie die Arbeit vor der Schwelle, weil die gesamte Anfrage teurer wird. Die Schwelle gilt für den vollständigen Eingabekontext einschließlich Cache-Anteilen; über 272K kosten Eingabe, Cache-Lesen und Cache-Schreiben das 2-Fache des Kurzkontexts, die Ausgabe das 1.5-Fache:
| Model ID | Anbieter | Eingabe | Cache-Lesen | Cache-Schreiben | Ausgabe |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $0.75 |
gpt-6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.51 |
gpt-5.6-luna | OpenAI Standard | $0.40 | $0.04 | $0.50 | $1.80 |
gpt-5.6-luna | BetterToken | $0.272 | $0.0272 | $0.34 | $1.224 |
Vier Tokenkategorien trennen, um die Versuchskosten nachzurechnen
Für einen Codex-Versuch müssen Sie nicht gecachte Eingabe, Cache-Lesen, Cache-Schreiben und Ausgabe getrennt erfassen. Das gemeinsame hypothetische Profil unten zeigt die Methode; ersetzen Sie die Zahlen durch Ihre Abrechnungsdaten, um die tatsächlichen Versuchskosten zu erhalten:
- 32,000 nicht gecachte Eingabetokens;
- 160,000 aus dem Cache gelesene Tokens;
- 16,000 in den Cache geschriebene Tokens;
- 8,000 Ausgabetokens;
- bei jeder Anfrage einen vollständigen Eingabekontext von höchstens 272K, sodass die Kurzkontextpreise gelten.
Die Formel lautet:
Aufgabenkosten = nicht gecachte Eingabe / 1,000,000 × Eingabepreis
+ Cache-Lesen / 1,000,000 × Preis für Cache-Lesen
+ Cache-Schreiben / 1,000,000 × Preis für Cache-Schreiben
+ Ausgabe / 1,000,000 × Ausgabepreis
| Model ID | Anbieter | Eingabekosten | Kosten Cache-Lesen | Kosten Cache-Schreiben | Ausgabekosten | Summe je Versuch |
|---|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.003200 | $0.001600 | $0.002000 | $0.004000 | $0.010800 |
gpt-6-luna | BetterToken | $0.002176 | $0.001088 | $0.001360 | $0.002720 | $0.007344 |
gpt-5.6-luna | OpenAI Standard | $0.006400 | $0.003200 | $0.004000 | $0.009600 | $0.023200 |
gpt-5.6-luna | BetterToken | $0.004352 | $0.002176 | $0.002720 | $0.006528 | $0.015776 |
Bei diesem hypothetischen Tokenprofil kostet ein Versuch mit gpt-6-luna etwa 46.6% eines Versuchs mit gpt-5.6-luna. BetterToken wendet auf beide Modelle denselben Preismultiplikator an, daher ist das Verhältnis zwischen den Modellen bei beiden Anbietern identisch. Das sind weiterhin Kosten pro Versuch, nicht pro erfolgreicher Aufgabe.
Cache-Lesen separat zählen, sonst wird der Preis über- oder unterschätzt
Berechnen Sie Cache-Lesen weder zum normalen Eingabepreis noch lassen Sie es weg. Codex liest Repository-Kontext, Verlauf und Werkzeugergebnisse mehrfach; Cache-Tokens sind meist günstiger, können aber zahlreich sein, sodass eine einzige „Eingabe“-Zahl den Preis falsch darstellt.
Speichern Sie für jeden Lauf input, cached input, cache write und output separat. Zeigt eine Zugriffsschicht nur den Endbetrag und nicht die vier Tokenkategorien, lässt sich wesentlich schwerer erklären, warum ein Modell oder eine Aufgabe mehr kostet.
Das Standardmodell nach Kosten je erfolgreicher Aufgabe wählen
Ein günstiger Aufruf garantiert keine günstig abgeschlossene Aufgabe; rechnen Sie API-Kosten von Fehlschlägen, Rollbacks und Wiederholungen ein. Die nützlichere Kennzahl lautet:
Kosten je akzeptierter Aufgabe = gesamte API-Kosten aller Versuche / akzeptierte Aufgaben
Erfassen Sie mindestens:
- Akzeptanzrate: Anteil der Aufgaben, die die vorab definierten Kriterien erfüllen, ohne dass ein Entwickler die Lösung neu schreibt;
- Wiederholungen: erneute Prompts, Rollbacks oder neue Modellläufe für dieselbe Aufgabe;
- Gesamtdauer: Zeit vom Start bis zu einem akzeptablen Diff, nicht nur die Latenz bis zum ersten Token;
- Manuelle Nacharbeit: ob und wie lange ein Entwickler den erzeugten Code ändern musste;
- Tokenmix: nicht gecachte Eingabe, Cache-Lesen, Cache-Schreiben und Ausgabe.
Mit den hypothetischen OpenAI-Standard-Kosten beträgt das Verhältnis pro Versuch 0.010800 / 0.023200 ≈ 46.6%. Bliebe das Tokenprofil identisch, hätte gpt-6-luna weiterhin niedrigere erwartete API-Kosten, sofern seine Akzeptanzrate mehr als ungefähr 46.6% der Akzeptanzrate von gpt-5.6-luna erreicht. Das ist lediglich eine aus hypothetischen Preisen abgeleitete Gewinnschwelle, keine gemessene Qualitätsaussage. Der Schwellenwert ändert sich mit Tokenverbrauch, Wiederholungen und Aufgabenmix.
Fünf Bedingungen fixieren, bevor Sie dem Vergleich vertrauen
Ein Lauf pro Modell ist kein belastbarer Vergleich; beide brauchen denselben Ausgangszustand, vergleichbare Aufgaben und identische Abnahmekriterien. Diese fünf Schritte verringern Verzerrungen durch Cache, Reihenfolge und menschliche Bewertung.
1. Umgebung fixieren
Verwenden Sie für beide Modelle dieselbe Codex-Version, denselben Ausgangs-Git-Commit, dieselbe Konfiguration, dieselben Werkzeugberechtigungen, denselben reasoning effort, denselben Prompt und denselben Abnahmebefehl. Rufen Sie nicht ein Modell über OpenAI Standard und das andere über einen anderen Zugriffsweg auf, um anschließend alle Latenz- oder Fehlerunterschiede dem Modell zuzuschreiben.
2. Aufgabenkategorien trennen
Halten Sie mindestens drei Klassen getrennt:
| Aufgabenklasse | Beispiel | Empfohlenes Abnahmekriterium |
|---|---|---|
| Kleine Korrektur | Klar definierter Fehler in einer oder wenigen Dateien | Zieltests bestehen; nicht betroffene Dateien bleiben unverändert |
| Dateiübergreifende Änderung | Funktion, Refactoring oder koordinierte Schnittstellenänderung | Alle Tests und Lint bestehen; das gewünschte Verhalten ist vorhanden |
| Review und Diagnose | Fehler finden, Risiko erklären, Korrektur vorschlagen | Das bekannte Problem wird gefunden und mit konkretem Code belegt |
Fassen Sie die drei Klassen nicht zu einem einzigen Durchschnitt zusammen. Zwei Modelle können bei kleinen Korrekturen nahezu gleich sein, sich aber bei der Wiederholungsrate für dateiübergreifende Änderungen deutlich unterscheiden.
3. Abnahme vor dem Modelllauf definieren
Legen Sie Pflichtprüfungen, erlaubte Verzeichnisse, Abhängigkeitsregeln und Fehlerbedingungen vorab fest. Werden die Anforderungen erst nach Sichtung der Ausgabe gesenkt, verliert die Akzeptanzrate ihre Aussagekraft.
4. Modellreihenfolge abwechseln
Lassen Sie nicht immer dasselbe Modell zuerst laufen. Wechseln Sie die Reihenfolge oder verwenden Sie, wenn möglich, gleichwertige unabhängige Aufgaben, damit Cache des ersten Laufs, Reparaturen der Umgebung und Erfahrung des Bedieners nicht systematisch eine Seite bevorzugen.
5. Einzelwerte pro Aufgabe behalten
Eine sinnvolle Zeile enthält: Aufgaben-ID, Klasse, Model ID, Anbieter, Verarbeitungsklasse, reasoning effort, Start- und Endzeit, vier Tokenkategorien, Zahl der Versuche, Ergebnis, Fehlergrund, Minuten manueller Nacharbeit und Endkosten. Bewahren Sie die Rohzeilen auf, bevor Sie nach Aufgabenklasse aggregieren.
Wann gpt-6-luna bleiben sollte und wann gpt-5.6-luna übernimmt
Behalten Sie gpt-6-luna als Standardkandidaten, solange die Akzeptanzrate den Preisvorteil erhält und die manuelle Nacharbeit ähnlich bleibt. Ändern sich Ergebnisse je Aufgabenklasse, routen Sie die Arbeit, statt ein einziges Modell global vorzuschreiben.
| Beobachtung | Empfohlene Aktion |
|---|---|
Die Akzeptanz von gpt-6-luna liegt über etwa 46.6% der Akzeptanz von gpt-5.6-luna, bei ähnlichem Tokenprofil und Reparaturaufwand | gpt-6-luna behalten; erwartete API-Kosten sind niedriger |
gpt-6-luna fällt unter den Break-even oder Wiederholungen und Nacharbeit machen den Gesamtpreis höher | Diese Aufgabenklasse zu gpt-5.6-luna verschieben |
Kleine Korrekturen sind mit gpt-6-luna günstiger, dateiübergreifende Änderungen mit gpt-5.6-luna nacharbeitsärmer | Nach Aufgabenklasse routen, kein universelles Default erzwingen |
| Der Unterschied stammt vor allem von Provider-Latenz, Fehlern oder Limits | Über denselben Zugang erneut testen, bevor Sie ihn dem Modell zuschreiben |
| Eingaben überschreiten häufig 272K | Kontext optimieren und neu testen; Tarifwechsel nicht als Qualitätsunterschied deuten |
Die 46.6%-Schwelle gilt nur für das hypothetische Tokenprofil oben. Unterscheiden sich Ausgabelänge, Cache oder Wiederholungen, berechnen Sie den Break-even aus den tatsächlichen Versuchskosten beider Modelle neu.
Empfehlung: Mit gpt-6-luna eine Basis bilden und nach Erfolgskosten entscheiden
Müssen Sie heute eines wählen, starten Sie klare, automatisch prüfbare Aufgaben mit gpt-6-luna. Behalten Sie eine repräsentative Auswahl komplexer Aufgaben, um gpt-5.6-luna unter denselben Bedingungen als Kontrolle auszuführen; der Preis eines Aufrufs reicht nicht.
Berechnen Sie nach einem Stapel vergleichbarer Aufgaben Akzeptanzrate, durchschnittliche Wiederholungen, manuelle Nacharbeitszeit und Kosten je erfolgreicher Aufgabe. Bleibt gpt-6-luna günstiger, bleibt es Standard; spart gpt-5.6-luna in einer bestimmten Klasse genug Nacharbeit, um den höheren Tokenpreis auszugleichen, routen Sie nur diese Klasse dorthin.
Offizielle Quellen
Diese drei offiziellen Seiten reichen zur erneuten Prüfung von Modellspezifikationen und OpenAI-Preisen.