GPT-6 LunaとGPT-5.6 Luna:Codexで採用されたタスクの実コストを計算する方法
GPT-6 Lunaのトークン単価はGPT-5.6 Lunaより大幅に低いものの、Codexのモデル選定では表示単価ではなく、採用されたタスク1件あたりのコストを見る必要があります。本稿では、2026-09-25に確認したOpenAI StandardとBetterTokenの価格、共通の仮想トークン構成、採用率・再試行・所要時間・総コストを比較する再現可能な手順を示します。
目次

あなたがCodexで決めたいのは、どちらのLuna世代が新しく見えるかではなく、次のコードタスク群をどちらから始め、失敗時にいつ切り替えるかです。読み終えれば、1回あたりのコストで最初の候補を選び、採用率・再試行・手動修正時間を使って成功タスク1件の実コストを計算できます。
先に結論:自動判定できるタスクの多くは gpt-6-luna から試す
範囲が明確で、テスト、lint、受け入れスクリプトが不適切な結果をすぐ拒否できるなら、最初の候補はgpt-6-lunaです。1回あたりのTokenコストが低いため、低い予算で基準値を作り、複雑な仕事をgpt-5.6-lunaへ戻すべきか判断できます。
| あなたの状況 | 最初にすること | 判断が変わる条件 |
|---|---|---|
| 小さな修正や一括変更で自動テストがある | gpt-6-lunaから始める | 失敗が続く、または手動修正で価格差が消える |
| 複数ファイル機能、リファクタリング、インターフェース変更 | 両モデルを同条件でペアテストする | gpt-5.6-lunaが再試行と修正時間を明確に減らすなら、その種類を任せる |
| 入力が272Kに近い、または超えている | 無関係なファイルを除き、履歴を短くし、タスクを分割する | 文脈を減らせない場合は長文脈料金で比較する |
| ChatGPTやCodexプランの枠を使っている | API表ではなく利用状況画面とCredit規則を見る | API Keyやcustom providerへ移った場合に下のToken価格を使う |
公開情報には、同じCodexバージョン、リポジトリ、reasoning effortでのペア結果がまだありません。価格でテスト順は決められますが、既定モデルは自分のタスクデータで決める必要があります。
インターフェース上限は近く、コード品質までは予測できない
両モデルの主要インターフェースとコンテキスト上限は近いため、仕様表だけでは自分のコードベースでどちらが安定するか分かりません。どちらもテキストと画像入力、テキスト出力、Responses API、reasoning tokens、noneからmaxまでのreasoning effortをサポートし、コンテキストウィンドウは1,050,000トークン、最大入力922,000トークン、最大出力128,000トークンです。
| 項目 | gpt-6-luna | gpt-5.6-luna |
|---|---|---|
| 公式の位置付け | 集中した大量タスク向けの高効率モデル | コスト重視の大量ワークロード向けモデル |
| 知識カットオフ | 2026-05-18 | 2026-02-16 |
| コンテキストウィンドウ | 1,050,000トークン | 1,050,000トークン |
| 既定のreasoning effort | medium | medium |
これらの仕様だけでは、自分のコードベースでどちらの採用率が高いか、どちらが速いか、再試行が少ないかは分かりません。Codexの結果は、タスクの種類、コンテキストの質、ツール権限、クライアントのバージョン、reasoning effort、受け入れ基準にも左右されます。
272K以下ではgpt-6-lunaのToken単価が低い
完全な入力コンテキストが272K以下なら、gpt-6-lunaの入力・キャッシュ読み取り・書き込みはgpt-5.6-lunaの半額で、出力は約41.7%です。表は2026-09-25に確認し、単位は100万トークンあたりのUSDです。比較対象はOpenAI StandardとBetterToken API課金のみで、ChatGPT/Codexプラン枠やCredit課金は含みません。
272K以下:この表から直接計算する
各リクエストの完全な入力コンテキストが272K以下なら、この料金区分をそのまま使い、長文脈の倍率は適用しません。
| Model ID | 提供元 | 入力 | キャッシュ読み取り | キャッシュ書き込み | 出力 |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.10 | $0.01 | $0.125 | $0.50 |
gpt-6-luna | BetterToken | $0.068 | $0.0068 | $0.085 | $0.34 |
gpt-5.6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $1.20 |
gpt-5.6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.816 |
BetterTokenの価格は動的です。公開日や購入日に現在の価格を確認し、その日の表示値を使用してください。BetterTokenはOpenAIの公式製品ではありません。上記はAPI、Codex、カスタムBase URLに対応するツールで利用できるGPTグループの従量課金であり、ChatGPTやCodexのサブスクリプション枠ではありません。
OpenAI BatchとFlexは、これらのモデルではStandardの50%で、ここに示したBetterToken価格より低くなります。本比較には含めません。したがって、この表から「BetterTokenはOpenAIのすべての処理方式より安い」と結論付けることはできません。
272K超:まず入力を減らし、必要なら長文脈料金を使う
分割できるなら、しきい値を超える前に無関係なファイルを除き、履歴を短くし、作業を分けてください。完全な入力コンテキストにはキャッシュ部分も含まれ、272Kを超えると入力・キャッシュ読み取り・書き込みは短文脈料金の2倍、出力は1.5倍になります。
| Model ID | 提供元 | 入力 | キャッシュ読み取り | キャッシュ書き込み | 出力 |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $0.75 |
gpt-6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.51 |
gpt-5.6-luna | OpenAI Standard | $0.40 | $0.04 | $0.50 | $1.80 |
gpt-5.6-luna | BetterToken | $0.272 | $0.0272 | $0.34 | $1.224 |
4種類のTokenを分ければ、1回の試行コストを再計算できる
Codexの1回の試行を計算するには、非キャッシュ入力、キャッシュ読み取り、キャッシュ書き込み、出力を分けます。次の共通の仮想使用量は計算方法の例です。自分の請求明細に置き換えれば、実際の1回あたりコストを得られます。
- 非キャッシュ入力:32,000トークン
- キャッシュ読み取り:160,000トークン
- キャッシュ書き込み:16,000トークン
- 出力:8,000トークン
- 各リクエストの完全な入力コンテキストは272K以下で、短いコンテキスト価格を適用
計算式は次のとおりです。
タスクコスト = 非キャッシュ入力 / 1,000,000 × 入力単価
+ キャッシュ読み取り / 1,000,000 × 読み取り単価
+ キャッシュ書き込み / 1,000,000 × 書き込み単価
+ 出力 / 1,000,000 × 出力単価
| Model ID | 提供元 | 入力コスト | キャッシュ読み取りコスト | キャッシュ書き込みコスト | 出力コスト | 1試行の合計 |
|---|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.003200 | $0.001600 | $0.002000 | $0.004000 | $0.010800 |
gpt-6-luna | BetterToken | $0.002176 | $0.001088 | $0.001360 | $0.002720 | $0.007344 |
gpt-5.6-luna | OpenAI Standard | $0.006400 | $0.003200 | $0.004000 | $0.009600 | $0.023200 |
gpt-5.6-luna | BetterToken | $0.004352 | $0.002176 | $0.002720 | $0.006528 | $0.015776 |
この仮想トークン構成では、gpt-6-lunaの1試行はgpt-5.6-lunaの約**46.6%**です。BetterTokenは両モデルに同じ価格倍率を適用するため、モデル間の比率はどちらの提供元でも同じです。ただし、これは1試行あたりのコストであり、成功したタスク1件あたりのコストではありません。
キャッシュ読み取りを分けないと、費用を過大・過小評価する
キャッシュ読み取りを通常入力の単価で計算してはいけませんし、請求から除外してもいけません。Codexはリポジトリ文脈、会話履歴、ツール結果を繰り返し読みます。キャッシュTokenは通常安価ですが量が多いため、「入力」を1つの数字にすると計算を誤ります。
各実行について、input、cached input、cache write、outputを別々に保存してください。アクセス層が最終金額しか示さず、4種類のトークンを示さない場合、モデルやタスクのコスト差を説明するのは難しくなります。
既定モデルは成功タスク1件のコストで選ぶ
安い呼び出しが、安い完了タスクを意味するとは限りません。失敗、ロールバック、再試行のAPI費用もすべて含めます。より有用な指標は次です。
成功タスク1件あたりのコスト = 全試行のAPI総コスト / 採用されたタスク数
少なくとも次を記録します。
- 採用率: 開発者が解決策を書き直さず、事前の基準を満たしたタスクの割合
- 再試行: 同じタスクに対する再プロンプト、ロールバック、新しいモデル実行
- 総所要時間: 最初のトークンまでではなく、開始から受け入れ可能なdiffまでの時間
- 手動修正: 生成コードを開発者が変更したか、その所要時間
- トークン構成: 非キャッシュ入力、キャッシュ読み取り、キャッシュ書き込み、出力
上のOpenAI Standardの仮定では、1試行の比率は0.010800 / 0.023200 ≈ 46.6%です。トークン構成が同じなら、gpt-6-lunaの採用率がgpt-5.6-lunaの採用率の約46.6%を上回る限り、期待APIコストは低くなります。これは仮定した価格から導いた損益分岐関係であり、品質を実測した結論ではありません。トークン量、再試行、タスク構成が変われば、しきい値も変わります。
比較を信頼する前に5つの条件を固定する
各モデルを1回ずつ実行するだけでは比較になりません。同じ開始状態、同等のタスク、同一の受け入れ基準を使う必要があります。次の5手順で、キャッシュ、実行順、人の判断による偏りを減らせます。
1. 環境を固定する
両モデルで同じCodexバージョン、開始Git commit、設定、ツール権限、reasoning effort、プロンプト、受け入れコマンドを使用します。一方をOpenAI Standard、もう一方を異なるアクセス経路で呼び出して、遅延や失敗の差をすべてモデルの差とみなしてはいけません。
2. タスク種別を分ける
最低でも次の3種類を別々に扱います。
| タスク種別 | 例 | 推奨する受け入れ条件 |
|---|---|---|
| 小規模修正 | 1つまたは少数ファイルの明確な不具合 | 対象テストに合格し、無関係なファイルを変更しない |
| 複数ファイル変更 | 機能追加、リファクタリング、連動するインターフェース変更 | 全テストとlintに合格し、要求された動作を満たす |
| レビューと診断 | バグを特定し、リスクを説明し、修正を提案 | 既知の問題を見つけ、具体的なコード上の根拠を示す |
3種類を1つの平均にまとめないでください。小規模修正ではほぼ同じでも、複数ファイル変更では再試行率に大きな差が出る可能性があります。
3. 実行前に受け入れ基準を定義する
必要なテスト、変更可能なディレクトリ、依存関係の方針、失敗条件を事前に固定します。出力を見た後で基準を下げると、採用率に意味がなくなります。
4. モデルの実行順を交互にする
常に同じモデルを先に実行しないでください。順序を交互にするか、可能なら同等で独立したタスクを使用し、初回実行のキャッシュ、環境修復、担当者の慣れが片方を一貫して有利にしないようにします。
5. タスクごとの明細を残す
有用な1行には、タスクID、タスク種別、Model ID、提供元、処理区分、reasoning effort、開始・終了時刻、4種類のトークン、試行回数、合否、失敗理由、手動修正時間、最終コストを含めます。元の行を保存してから、タスク種別ごとに集計します。
gpt-6-lunaを維持する条件とgpt-5.6-lunaへ切り替える条件
gpt-6-lunaの採用率が価格優位を保ち、手動修正時間も同程度なら、既定候補のままにします。タスク種類で結果が変わるなら、全作業に1モデルを強制せず、種類別に振り分けてください。
| 観測した結果 | 推奨アクション |
|---|---|
gpt-6-lunaの採用率がgpt-5.6-lunaの約46.6%を上回り、Token構成と修正時間が近い | gpt-6-lunaを維持する。期待APIコストが低い |
gpt-6-lunaが損益分岐点を下回る、または再試行と修正で総額が高くなる | そのタスク種類をgpt-5.6-lunaへ切り替える |
小修正はgpt-6-luna、複数ファイル作業はgpt-5.6-lunaの返工が少ない | タスク種類でルーティングし、万能の既定モデルを求めない |
| 差が主にproviderの遅延、エラー、レート制限から生じる | 同じ接続経路で再実行してからモデル差と判断する |
| 入力が頻繁に272Kを超える | コンテキストを最適化して再テストし、料金段階の変化を品質差と混同しない |
46.6%は上の仮想Token構成だけに当てはまります。出力長、キャッシュ利用、再試行回数が違う場合は、各モデルの実測1回コストから損益分岐点を再計算してください。
推奨:gpt-6-lunaで基準を作り、成功タスク単価で決める
今日1つ選ぶ必要があるなら、範囲が明確で自動判定できる仕事はgpt-6-lunaから始めてください。複雑なタスクの代表サンプルは残し、同じ条件でgpt-5.6-lunaを対照として実行します。1回の呼び出し価格だけでは決めません。
同等タスクを一まとまり実行したら、採用率、平均再試行、手動修正時間、成功タスク1件のコストを計算します。gpt-6-lunaが引き続き安ければ既定のままにし、特定種類でgpt-5.6-lunaの返工削減が高い単価を上回るなら、その種類だけを切り替えます。
公式資料
モデル仕様とOpenAI価格は、次の3つの公式ページで再確認できます。