GPT-6.1 Sol・GPT-6 Astra・Claude Opus 5.5の選び方
公開トークン単価を重視する一般的なコーディング、文書処理、ツール利用ワークフローでは、まずGPT-6.1 Solを試します。難度が極めて高い、または誤りの損失が大きい場合はGPT-6 Astraを検証します。Claude中心の環境や長時間のエージェント型作業ではClaude Opus 5.5も同条件で比較します。本稿は、提供元の公式評価と自分の受け入れテストを分け、API料金を同じ基準で比較し、Solが通常のChatGPT Chatに表示されない理由も整理します。
目次

複雑なコード、文書処理、ツールを使うワークフローの多くでは、最初の候補をGPT-6.1 Solにします。特に難しい課題や、誤答の損失が大きい課題ではGPT-6 Astraを試します。Claudeの環境をすでに使っている場合や、長時間のエージェント型コーディングが中心ならClaude Opus 5.5も本命として評価します。
これは出発点であり、万能ランキングではありません。OpenAIのローンチ時評価では、GPT-6.1 Solが複数のコスト対性能比較で有利と報告されています。しかし、いずれも提供元が特定のハーネス、ツール、推論設定で実施した評価です。自分のリポジトリ変更、契約書レビュー、ブラウザ操作が最少の再試行で完了するモデルを保証するものではありません。
利用経路にも注意が必要です。2026年10月1日時点で、GPT-6.1 SolはChatGPT Work、Codex、OpenAI APIで利用できますが、通常のChatGPT Chatにはまだ導入されていません。通常のモデル選択画面に表示されないからといって、直ちにアカウント障害とは限りません。
タスク別の実用的な結論
| タスク | 最初に試すモデル | 別モデルを試す条件 |
|---|---|---|
| 複数ファイルの実装、デバッグ、コードレビュー、ツール付き開発エージェント | gpt-6.1-sol | 複数回試しても設計制約を落とす、または誤った変更の損失が大きいならAstraへ。Claude向けツールチェーンが重要ならOpus 5.5も試します。 |
| 長文レポート、複雑なPDF、規程分析、文書作成 | コストを意識した基準としてgpt-6.1-sol | 同じ文書で、文章品質、指示保持、Claude中心の工程が重要ならOpus 5.5を比較。特に難しく高リスクの統合判断ではAstraを使います。 |
| 多数のツールを使う複数段階の業務フロー | gpt-6.1-sol | 制約の見落としが高額な操作につながるならAstraへ。既存のオーケストレーションがClaude API中心ならOpus 5.5も比較します。 |
| 難しい科学研究やオープンエンドな調査 | OpenAIの上位候補としてgpt-6-astra | Solを低単価の対照群に残し、Opus 5.5も同じ資料、ツール、合否基準で実行します。 |
| 決定的な自動検査がある大量処理 | 3モデルだけを比べるならgpt-6.1-sol | 本稿ではLunaを再評価しません。GPT-6ファミリー全体はGPT-6 Astra vs Sol vs Lunaを参照してください。 |
実務上の原則は、受け入れ基準を継続して満たす最も安いモデルを通常ルートにし、観測できる失敗時だけ強いモデルや異なるモデルへ切り替えることです。
実際に比較できる項目
3モデルはいずれも、コード、文書、ツール利用、長いコンテキストに対応します。ただし、製品上の入口や推論制御は同一ではありません。
| モデル | 正確なAPIモデルID | 提供元の位置付け | コンテキストと出力 | 推論の特徴 |
|---|---|---|---|---|
| GPT-6.1 Sol | gpt-6.1-sol | OpenAIは、複雑なコーディング、コンピューター操作、専門業務でAstraに近い性能をより低い単価で提供するモデルと位置付けています。 | 1,050,000トークンのコンテキスト、最大128,000出力トークン | effortはlow、medium、high、xhigh、max。noneとminimalは非対応。ツール呼び出しにはResponses APIを推奨。 |
| GPT-6 Astra | gpt-6-astra | OpenAIは、最も要求の高い作業向けの最上位モデルと位置付けています。 | 1,050,000トークンのコンテキスト、最大128,000出力トークン | lowからmaxまで選択可能。 |
| Claude Opus 5.5 | claude-opus-5-5 | Anthropicは、長時間のエージェント型コーディングと知識労働向けと説明しています。 | 1,000,000トークンのコンテキスト、最大128,000出力トークン | adaptive thinkingは常時有効。既定のeffortはmediumで、深さ、待ち時間、費用に影響します。 |
こうした説明は最初の候補を選ぶ手掛かりにはなります。ただし、一方の「最上位」と他方の「長時間のエージェント型」をそのまま同じ尺度に置くことはできません。システムプロンプト、ツール、評価ハーネス、effort、課金方式が異なるためです。
公式評価から分かること、分からないこと
GPT-6.1 Solの発表には、いくつか有用な比較があります。普遍的な順位表ではなく、掲載された条件での結果として読みます。
| 公式評価 | 測る内容 | OpenAIが公表した結論 | その結論からは言えないこと |
|---|---|---|---|
| DeepSWE v1.1 | 実在コードベースでの長期的なソフトウェア開発 | 掲載設定でSolはAstraと同等、費用は約5分の1と報告。 | 自分の言語、リポジトリ、テスト、エージェントでも同等とは限りません。 |
| GDP.pdf | 表、グラフ、図、細かい記載を含む専門PDFへの根拠付き回答 | fallbackを含むOpus 5.5よりSolが高く、テスト費用は半分未満と報告。 | 一般的な文章品質テストではなく、自社文書のレビューを代替しません。 |
| AutomationBench | 多数のツールを使うエンドツーエンド業務 | medium effortでSolがOpus 5.5を上回り、テスト費用は約3分の1と報告。 | 自社のツール定義、権限、再試行、復旧設計では結果が変わります。 |
| Terminal-Bench Science 0.1 | コードとターミナルを使う科学作業 | 比較内ではAstraが最高スコア、Solはタスク当たりのテスト費用が大幅に低いと報告。 | すべての研究でAstraが最良の費用対効果を持つことや、別環境への再現を示しません。 |
OpenAIは、GPTの評価が研究環境またはAPIで実施され、システムプロンプト、ツール、effortが本番のChatGPTと異なる場合があるとも説明しています。競合モデルの結果が同じ製品面での実行ではなく、公表資料から取得されることもあります。したがって、提供元の評価はテスト設計の材料であって、選定の最終回答ではありません。
Claude Opus 5.5の公式ページには仕様、料金、想定用途、対応プラットフォームが掲載されていますが、自分のタスクでSol、Astra、Opusを同じハーネスに入れた中立比較ではありません。公開情報で作れるのは候補リストであり、普遍的な勝者ではありません。
API料金を同じ基準で比較する
以下は2026年10月1日に確認した、100万トークン当たりの公開API料金(米ドル)です。ツール呼び出し、保存、地域処理、高速モード、再試行、人手レビュー、個別契約は含みません。
| モデル | 通常入力 | キャッシュ入力または読取 | キャッシュ書込 | 出力 | 長コンテキストの扱い |
|---|---|---|---|---|---|
gpt-6.1-sol | $2.00 | $0.10 | $2.50 | $10.00 | 入力が272Kを超えると、リクエスト全体に入力・キャッシュ2倍、出力1.5倍を適用。 |
gpt-6-astra | $10.00 | $1.00 | $12.50 | $50.00 | 272K超では同じOpenAIの倍率を適用。 |
claude-opus-5-5 | $4.00 | $0.20 | 5分キャッシュ$5.00、1時間キャッシュ$8.00 | $20.00 | AnthropicはClaude 4.6以降の完全な1Mコンテキストを標準トークン単価で提供すると説明。 |
キャッシュの意味は完全には同じではありません。OpenAIは書き込みとキャッシュ入力を、Anthropicは有効期間別の書き込みと読み取りを提示しています。アプリケーションの実際の書き込み回数、再利用、期限切れを基に計算してください。
キャッシュなしの透明な例
1回の実行で入力200,000トークン、出力20,000トークンを使い、キャッシュ、ツール、再試行がないとします。OpenAIの入力は272K未満です。
- GPT-6.1 Sol:
0.2 × $2 + 0.02 × $10 = $0.60 - Claude Opus 5.5:
0.2 × $4 + 0.02 × $20 = $1.20 - GPT-6 Astra:
0.2 × $10 + 0.02 × $50 = $3.00
これは同じトークン構成の公開料金だけを比べた例です。合格率、出力長、待ち時間、ツール費用、必要な試行回数は反映していません。
サブスクリプションとAPI費用を混ぜない
| 利用経路 | サブスクリプション | 最低入金額 | 初回クレジット | 利用料金 |
|---|---|---|---|---|
| SolまたはAstraのOpenAI API | ChatGPTとAPIは別の請求体系で、ChatGPTの契約はAPI料金を含みません。 | 引用したモデルページには全利用者共通の最低額は記載されていません。アカウントや契約条件を確認します。 | 全利用者共通の初月クレジットは記載されていません。 | モデルトークンに加え、該当するツール、保存、地域処理、速度階層など。 |
| Opus 5.5のClaude API | 有料ClaudeチャットプランにはClaude APIまたはConsoleは含まれません。 | Anthropicは多くのConsole組織が前払い利用クレジットを使うと説明しています。アカウント表示額を確認します。 | 引用した請求記事に共通の初回クレジットは記載されていません。 | モデルトークンに加え、利用機能やプラットフォーム固有の料金。 |
確実に言える範囲は限定的です。3モデルの中ではSolの公開標準トークン単価が最も低いものの、受け入れ済みタスク1件当たりの総費用が最小とは限りません。
通常のChatGPT ChatにSolがない理由
Chat、ChatGPT Work、Codex、APIは、同じモデル選択画面の別名ではなく、異なる製品面です。
| 利用面 | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| 通常のChatGPT Chat | 2026年10月1日時点で未提供 | API名だけから利用可否を推測せず、現在の選択画面と契約を確認 | 該当なし |
| ChatGPT Work | 対象となるPlus、Pro、Business、Enterprise、Edu利用者に提供。workspace設定の影響あり | 公式に提供。企業では管理者設定に依存する場合あり | 該当なし |
| Codex | 提供済み。契約、クライアント版、workspaceによって一覧が変わる場合あり | 対応経路で提供 | 該当なし |
| OpenAI API | gpt-6.1-sol | gpt-6-astra | 該当なし |
| Claude APIと対応クラウド | 該当なし | 該当なし | claude-opus-5-5。提携プラットフォームではIDが異なる場合あり |
| claude.aiとClaudeアプリ | 該当なし | 該当なし | 公式ページはClaudeアプリでの利用を示しますが、選択可否は現在の契約と展開状況に依存 |
Solが通常のChatだけにない場合、ブラウザ変更や再読み込みでは製品面の違いは解消しません。利用条件を満たすならWorkまたはCodexを開くか、APIモデルIDを使います。対応面にも表示されない場合は、クライアント版、workspaceポリシー、段階展開、アカウント権限を確認してください。
ランキングを写す代わりに受け入れテストをする
小規模でも統制された自社評価の方が、単一の総合スコアより実用的です。
1. 代表的なタスクを選ぶ
実務に近い10〜20件を用意します。たとえば、バグ修正、複数ファイル機能、コードレビュー、失敗テストの診断、複雑なPDFへの回答、根拠付き要約、厳格なテンプレート出力、ツール選択、複数段階操作、障害復旧です。通常例、境界例、モデルが停止または確認すべき例を含めます。
2. 実行前に合否を定義する
コードではテスト、lint、セキュリティチェック、レビュー項目を使います。文書では必須・禁止主張、引用、表の項目、形式を定義します。ワークフローでは許可ツール、確認点、副作用の限界、最終状態を定めます。好みのモデルの結果を見てから基準を変えないでください。
3. モデル以外を固定する
同じ入力ファイル、指示、ツール、権限、最大出力、タイムアウトを使い、正確なモデルIDを記録します。推論制御は提供元間で完全に対応しません。まず文書化された既定設定を比較し、effort調整は別実験として扱います。
4. 繰り返し、全試行を記録する
初回合格率、許可した再試行後の最終合格率、入力・キャッシュ・書込・出力トークン、ツール呼び出しと外部費用、合格までの時間、人手レビューと修正、失敗分類を記録します。1回の成功は偶然かもしれません。
5. 合格タスク当たり費用を計算する
合格タスク当たり費用 = 全試行のモデル・ツール費用 + 人手修正費用 ÷ 合格結果数
Astraが高価な失敗を防ぐ、または合格率を大きく改善するなら、高い単価を正当化できます。Opus 5.5がClaude工程で介入回数を減らすなら、その単価に意味があります。Solは同じ基準をより低い総費用で満たす限り、通常ルートに残します。
最終的なルーティング案
- 日常の複雑なコード、文書分析、ツール付きワークフローはGPT-6.1 Solから始めます。 3モデル中で公開標準単価が最も低く、OpenAIはいくつかのローンチ評価でAstraに近い結果を報告しています。
- 課題が極めて難しい、曖昧、科学的、または誤りが高価ならGPT-6 Astraへ上げます。 高い単価を正当化する合格率改善を事前に決めます。
- Claude APIやClaude向けツールを使う、または長時間のエージェント型コーディングと知識労働が中心ならClaude Opus 5.5を本気で比較します。
- 通常Chatの選択画面だけでSolの利用可否を判断しません。 OpenAIがChatには未提供と明記している間は、Work、Codex、APIを使います。
- 全社で1モデルを勝者にせず、タスク群ごとに昇格させます。 リポジトリ変更の勝者がPDF、業務自動化、研究でも勝つとは限りません。
まず、典型的な10件のタスクと合否条件を固定し、同じ資料とツールで3モデルを実行してください。提供元の主張を、自分で説明できるルーティングルールへ変えられます。