Einladen & verdienen

So funktionieren Einladungsboni

Teile deinen Einladungslink. Registriert sich ein Freund darüber und lädt Guthaben auf, erhältst du die angezeigte Prämie für seine weiteren Aufladungen.

GPT-6 Luna vs. GPT-5.6 Luna: die realen Kosten einer akzeptierten Codex-Aufgabe berechnen

GPT-6 Luna hat deutlich niedrigere Tokenpreise als GPT-5.6 Luna. Für Codex sollte jedoch nicht allein der Listenpreis, sondern der Preis je akzeptierter Aufgabe entscheiden. Dieser Leitfaden nutzt am 2026-09-25 geprüfte Preise von OpenAI Standard und BetterToken, denselben hypothetischen Tokenmix und ein reproduzierbares Verfahren für Akzeptanzrate, Wiederholungen, Laufzeit und Gesamtkosten.

Inhalt
GPT-6 Luna vs. GPT-5.6 Luna: die realen Kosten einer akzeptierten Codex-Aufgabe berechnen

Sie müssen in Codex nicht entscheiden, welche Luna-Generation neuer klingt, sondern welches Modell den nächsten Aufgabenstapel zuerst bearbeiten soll und wann Sie nach einem Fehlschlag wechseln. Danach können Sie den ersten Kandidaten nach Versuchskosten wählen und mit Akzeptanzrate, Wiederholungen und manueller Nacharbeit die realen Kosten jeder erfolgreichen Aufgabe berechnen.

Hier beginnen: Für die meisten automatisch prüfbaren Aufgaben zuerst gpt-6-luna testen

gpt-6-luna ist der bessere erste Kandidat, wenn der Umfang klar ist und Tests, Lint oder ein Abnahmeskript schlechte Ergebnisse schnell ablehnen können. Die niedrigeren Kosten je Versuch ermöglichen eine günstige Basis, bevor Sie entscheiden, ob komplexe Arbeit zu gpt-5.6-luna wechseln sollte.

Ihre SituationErster SchrittWas die Empfehlung ändern würde
Kleine Korrekturen oder Serienänderungen mit automatisierten TestsMit gpt-6-luna beginnenWiederholte Fehlschläge oder manuelle Nacharbeit beseitigen den Preisvorteil
Dateiübergreifende Funktionen, Refactorings oder SchnittstellenänderungenBeide Modelle paarweise testenDiese Klasse gpt-5.6-luna geben, wenn Wiederholungen und Nacharbeit deutlich sinken
Eingabe liegt nahe bei oder über 272KUnnötige Dateien entfernen, Verlauf kürzen oder Aufgabe teilenFalls der Kontext nicht kleiner wird, mit Langkontextpreisen vergleichen
Sie nutzen ChatGPT- oder Codex-TarifkontingenteTarif-Dashboard und Credit-Regeln nutzen, nicht die API-TabelleTokenpreise erst mit API Key oder custom provider anwenden

Öffentliche Informationen enthalten noch keine gepaarten Ergebnisse mit derselben Codex-Version, demselben Repository und reasoning effort. Der Preis kann die Testreihenfolge bestimmen, das Standardmodell aber nur Ihre eigenen Aufgabendaten.

Ähnliche Schnittstellenlimits sagen die Codequalität nicht voraus

Die Kerninterfaces und Kontextgrenzen beider Modelle sind ähnlich; aus dem Datenblatt lässt sich daher nicht ableiten, welches in Ihrer Codebasis zuverlässiger ist. Beide unterstützen Text- und Bildeingabe, Textausgabe, Responses API, reasoning tokens und reasoning effort von none bis max; beide haben 1,050,000 Tokens Kontext, höchstens 922,000 Eingabe- und 128,000 Ausgabetokens.

Punktgpt-6-lunagpt-5.6-luna
Offizielle PositionierungEffizientes Modell für fokussierte Aufgaben mit hohem VolumenModell für kostensensitive Workloads mit hohem Volumen
Wissensstichtag2026-05-182026-02-16
Kontextfenster1,050,000 Tokens1,050,000 Tokens
Standardmäßiger reasoning effortmediummedium

Diese Angaben beweisen nicht, dass ein Modell in Ihrer Codebasis eine höhere Akzeptanzrate erzielt, schneller fertig wird oder weniger Wiederholungen braucht. Codex-Ergebnisse hängen außerdem von Aufgabentyp, Kontextqualität, Werkzeugberechtigungen, Clientversion, reasoning effort und den festgelegten Abnahmekriterien ab.

Bis 272K hat gpt-6-luna die niedrigeren Tokenpreise

Bei vollständigem Eingabekontext bis 272K kostet gpt-6-luna für Eingabe, Cache-Lesen und Cache-Schreiben die Hälfte; die Ausgabe kostet etwa 41.7% von gpt-5.6-luna. Die Tabelle wurde am 2026-09-25 geprüft, verwendet USD je 1 Million Tokens und vergleicht nur OpenAI Standard mit BetterToken-API-Abrechnung, nicht ChatGPT-/Codex-Tarifkontingente oder Credit-Abrechnung.

Bis einschließlich 272K: direkt mit dieser Tabelle rechnen

Bleibt der vollständige Eingabekontext jeder Anfrage bei höchstens 272K, verwenden Sie direkt diese Stufe ohne Langkontext-Multiplikatoren.

Model IDAnbieterEingabeCache-LesenCache-SchreibenAusgabe
gpt-6-lunaOpenAI Standard$0.10$0.01$0.125$0.50
gpt-6-lunaBetterToken$0.068$0.0068$0.085$0.34
gpt-5.6-lunaOpenAI Standard$0.20$0.02$0.25$1.20
gpt-5.6-lunaBetterToken$0.136$0.0136$0.17$0.816

BetterToken-Preise sind dynamisch. Deshalb sollten Sie am Veröffentlichungs- oder Kauftag die aktuellen Preise ansehen und die dann angezeigten Werte verwenden. BetterToken ist kein OpenAI-Produkt. Die obigen Tarife gelten für die GPT-Gruppe, die per API, Codex und in Werkzeugen mit benutzerdefinierter Base URL genutzt werden kann; sie sind keine ChatGPT- oder Codex-Abonnementkontingente.

OpenAI Batch und Flex kosten für diese Modelle 50% von Standard und liegen damit unter den hier gezeigten BetterToken-Tarifen. Sie sind nicht Bestandteil dieses Vergleichs. Aus der Tabelle darf daher nicht geschlossen werden, BetterToken sei günstiger als jede OpenAI-Verarbeitungsoption.

Über 272K: zuerst Eingabe reduzieren, dann Langkontextpreise nutzen

Wenn sich die Aufgabe teilen lässt, entfernen Sie irrelevante Dateien, kürzen Sie den Verlauf oder trennen Sie die Arbeit vor der Schwelle, weil die gesamte Anfrage teurer wird. Die Schwelle gilt für den vollständigen Eingabekontext einschließlich Cache-Anteilen; über 272K kosten Eingabe, Cache-Lesen und Cache-Schreiben das 2-Fache des Kurzkontexts, die Ausgabe das 1.5-Fache:

Model IDAnbieterEingabeCache-LesenCache-SchreibenAusgabe
gpt-6-lunaOpenAI Standard$0.20$0.02$0.25$0.75
gpt-6-lunaBetterToken$0.136$0.0136$0.17$0.51
gpt-5.6-lunaOpenAI Standard$0.40$0.04$0.50$1.80
gpt-5.6-lunaBetterToken$0.272$0.0272$0.34$1.224

Vier Tokenkategorien trennen, um die Versuchskosten nachzurechnen

Für einen Codex-Versuch müssen Sie nicht gecachte Eingabe, Cache-Lesen, Cache-Schreiben und Ausgabe getrennt erfassen. Das gemeinsame hypothetische Profil unten zeigt die Methode; ersetzen Sie die Zahlen durch Ihre Abrechnungsdaten, um die tatsächlichen Versuchskosten zu erhalten:

  • 32,000 nicht gecachte Eingabetokens;
  • 160,000 aus dem Cache gelesene Tokens;
  • 16,000 in den Cache geschriebene Tokens;
  • 8,000 Ausgabetokens;
  • bei jeder Anfrage einen vollständigen Eingabekontext von höchstens 272K, sodass die Kurzkontextpreise gelten.

Die Formel lautet:

Aufgabenkosten = nicht gecachte Eingabe / 1,000,000 × Eingabepreis
               + Cache-Lesen / 1,000,000 × Preis für Cache-Lesen
               + Cache-Schreiben / 1,000,000 × Preis für Cache-Schreiben
               + Ausgabe / 1,000,000 × Ausgabepreis
Model IDAnbieterEingabekostenKosten Cache-LesenKosten Cache-SchreibenAusgabekostenSumme je Versuch
gpt-6-lunaOpenAI Standard$0.003200$0.001600$0.002000$0.004000$0.010800
gpt-6-lunaBetterToken$0.002176$0.001088$0.001360$0.002720$0.007344
gpt-5.6-lunaOpenAI Standard$0.006400$0.003200$0.004000$0.009600$0.023200
gpt-5.6-lunaBetterToken$0.004352$0.002176$0.002720$0.006528$0.015776

Bei diesem hypothetischen Tokenprofil kostet ein Versuch mit gpt-6-luna etwa 46.6% eines Versuchs mit gpt-5.6-luna. BetterToken wendet auf beide Modelle denselben Preismultiplikator an, daher ist das Verhältnis zwischen den Modellen bei beiden Anbietern identisch. Das sind weiterhin Kosten pro Versuch, nicht pro erfolgreicher Aufgabe.

Cache-Lesen separat zählen, sonst wird der Preis über- oder unterschätzt

Berechnen Sie Cache-Lesen weder zum normalen Eingabepreis noch lassen Sie es weg. Codex liest Repository-Kontext, Verlauf und Werkzeugergebnisse mehrfach; Cache-Tokens sind meist günstiger, können aber zahlreich sein, sodass eine einzige „Eingabe“-Zahl den Preis falsch darstellt.

Speichern Sie für jeden Lauf input, cached input, cache write und output separat. Zeigt eine Zugriffsschicht nur den Endbetrag und nicht die vier Tokenkategorien, lässt sich wesentlich schwerer erklären, warum ein Modell oder eine Aufgabe mehr kostet.

Das Standardmodell nach Kosten je erfolgreicher Aufgabe wählen

Ein günstiger Aufruf garantiert keine günstig abgeschlossene Aufgabe; rechnen Sie API-Kosten von Fehlschlägen, Rollbacks und Wiederholungen ein. Die nützlichere Kennzahl lautet:

Kosten je akzeptierter Aufgabe = gesamte API-Kosten aller Versuche / akzeptierte Aufgaben

Erfassen Sie mindestens:

  • Akzeptanzrate: Anteil der Aufgaben, die die vorab definierten Kriterien erfüllen, ohne dass ein Entwickler die Lösung neu schreibt;
  • Wiederholungen: erneute Prompts, Rollbacks oder neue Modellläufe für dieselbe Aufgabe;
  • Gesamtdauer: Zeit vom Start bis zu einem akzeptablen Diff, nicht nur die Latenz bis zum ersten Token;
  • Manuelle Nacharbeit: ob und wie lange ein Entwickler den erzeugten Code ändern musste;
  • Tokenmix: nicht gecachte Eingabe, Cache-Lesen, Cache-Schreiben und Ausgabe.

Mit den hypothetischen OpenAI-Standard-Kosten beträgt das Verhältnis pro Versuch 0.010800 / 0.023200 ≈ 46.6%. Bliebe das Tokenprofil identisch, hätte gpt-6-luna weiterhin niedrigere erwartete API-Kosten, sofern seine Akzeptanzrate mehr als ungefähr 46.6% der Akzeptanzrate von gpt-5.6-luna erreicht. Das ist lediglich eine aus hypothetischen Preisen abgeleitete Gewinnschwelle, keine gemessene Qualitätsaussage. Der Schwellenwert ändert sich mit Tokenverbrauch, Wiederholungen und Aufgabenmix.

Fünf Bedingungen fixieren, bevor Sie dem Vergleich vertrauen

Ein Lauf pro Modell ist kein belastbarer Vergleich; beide brauchen denselben Ausgangszustand, vergleichbare Aufgaben und identische Abnahmekriterien. Diese fünf Schritte verringern Verzerrungen durch Cache, Reihenfolge und menschliche Bewertung.

1. Umgebung fixieren

Verwenden Sie für beide Modelle dieselbe Codex-Version, denselben Ausgangs-Git-Commit, dieselbe Konfiguration, dieselben Werkzeugberechtigungen, denselben reasoning effort, denselben Prompt und denselben Abnahmebefehl. Rufen Sie nicht ein Modell über OpenAI Standard und das andere über einen anderen Zugriffsweg auf, um anschließend alle Latenz- oder Fehlerunterschiede dem Modell zuzuschreiben.

2. Aufgabenkategorien trennen

Halten Sie mindestens drei Klassen getrennt:

AufgabenklasseBeispielEmpfohlenes Abnahmekriterium
Kleine KorrekturKlar definierter Fehler in einer oder wenigen DateienZieltests bestehen; nicht betroffene Dateien bleiben unverändert
Dateiübergreifende ÄnderungFunktion, Refactoring oder koordinierte SchnittstellenänderungAlle Tests und Lint bestehen; das gewünschte Verhalten ist vorhanden
Review und DiagnoseFehler finden, Risiko erklären, Korrektur vorschlagenDas bekannte Problem wird gefunden und mit konkretem Code belegt

Fassen Sie die drei Klassen nicht zu einem einzigen Durchschnitt zusammen. Zwei Modelle können bei kleinen Korrekturen nahezu gleich sein, sich aber bei der Wiederholungsrate für dateiübergreifende Änderungen deutlich unterscheiden.

3. Abnahme vor dem Modelllauf definieren

Legen Sie Pflichtprüfungen, erlaubte Verzeichnisse, Abhängigkeitsregeln und Fehlerbedingungen vorab fest. Werden die Anforderungen erst nach Sichtung der Ausgabe gesenkt, verliert die Akzeptanzrate ihre Aussagekraft.

4. Modellreihenfolge abwechseln

Lassen Sie nicht immer dasselbe Modell zuerst laufen. Wechseln Sie die Reihenfolge oder verwenden Sie, wenn möglich, gleichwertige unabhängige Aufgaben, damit Cache des ersten Laufs, Reparaturen der Umgebung und Erfahrung des Bedieners nicht systematisch eine Seite bevorzugen.

5. Einzelwerte pro Aufgabe behalten

Eine sinnvolle Zeile enthält: Aufgaben-ID, Klasse, Model ID, Anbieter, Verarbeitungsklasse, reasoning effort, Start- und Endzeit, vier Tokenkategorien, Zahl der Versuche, Ergebnis, Fehlergrund, Minuten manueller Nacharbeit und Endkosten. Bewahren Sie die Rohzeilen auf, bevor Sie nach Aufgabenklasse aggregieren.

Wann gpt-6-luna bleiben sollte und wann gpt-5.6-luna übernimmt

Behalten Sie gpt-6-luna als Standardkandidaten, solange die Akzeptanzrate den Preisvorteil erhält und die manuelle Nacharbeit ähnlich bleibt. Ändern sich Ergebnisse je Aufgabenklasse, routen Sie die Arbeit, statt ein einziges Modell global vorzuschreiben.

BeobachtungEmpfohlene Aktion
Die Akzeptanz von gpt-6-luna liegt über etwa 46.6% der Akzeptanz von gpt-5.6-luna, bei ähnlichem Tokenprofil und Reparaturaufwandgpt-6-luna behalten; erwartete API-Kosten sind niedriger
gpt-6-luna fällt unter den Break-even oder Wiederholungen und Nacharbeit machen den Gesamtpreis höherDiese Aufgabenklasse zu gpt-5.6-luna verschieben
Kleine Korrekturen sind mit gpt-6-luna günstiger, dateiübergreifende Änderungen mit gpt-5.6-luna nacharbeitsärmerNach Aufgabenklasse routen, kein universelles Default erzwingen
Der Unterschied stammt vor allem von Provider-Latenz, Fehlern oder LimitsÜber denselben Zugang erneut testen, bevor Sie ihn dem Modell zuschreiben
Eingaben überschreiten häufig 272KKontext optimieren und neu testen; Tarifwechsel nicht als Qualitätsunterschied deuten

Die 46.6%-Schwelle gilt nur für das hypothetische Tokenprofil oben. Unterscheiden sich Ausgabelänge, Cache oder Wiederholungen, berechnen Sie den Break-even aus den tatsächlichen Versuchskosten beider Modelle neu.

Empfehlung: Mit gpt-6-luna eine Basis bilden und nach Erfolgskosten entscheiden

Müssen Sie heute eines wählen, starten Sie klare, automatisch prüfbare Aufgaben mit gpt-6-luna. Behalten Sie eine repräsentative Auswahl komplexer Aufgaben, um gpt-5.6-luna unter denselben Bedingungen als Kontrolle auszuführen; der Preis eines Aufrufs reicht nicht.

Berechnen Sie nach einem Stapel vergleichbarer Aufgaben Akzeptanzrate, durchschnittliche Wiederholungen, manuelle Nacharbeitszeit und Kosten je erfolgreicher Aufgabe. Bleibt gpt-6-luna günstiger, bleibt es Standard; spart gpt-5.6-luna in einer bestimmten Klasse genug Nacharbeit, um den höheren Tokenpreis auszugleichen, routen Sie nur diese Klasse dorthin.

Offizielle Quellen

Diese drei offiziellen Seiten reichen zur erneuten Prüfung von Modellspezifikationen und OpenAI-Preisen.

Bereit, Ihren LLM-Workflow zu optimieren?

Verbinden Sie Modelle über eine API, verwalten Sie Schlüssel und behalten Sie KI-Kosten im Blick.

Kostenlos starten