Claude Opus 5.5とFable 5.1を比較:コーディング費用と選び方
検証できる日常開発ではOpus 5.5を基本にし、目視確認が難しい高リスク作業や初回失敗の損失が大きい案件だけFable 5.1を検討する、という使い分けを示します。
目次

diffを読めて、テストを実行し、完成した画面や動作まで確認できるなら、日常的な開発と範囲が明確なエージェント作業ではClaude Opus 5.5を第一候補にするのが合理的です。入力・出力tokenの単価はいずれもFable 5.1より60%安く、独立評価でも同等以上の結果が多く見られます。ただし、Opusはタスクによってtokenを多く使うため、安い単価を理由に無制限で動かすべきではありません。
Fable 5.1に追加料金を払う価値があるのは、成果物が大きすぎて人が十分に検証できない場合、または初回の失敗による損失がモデル料金を大きく上回る場合です。 以下では、2026年9月26日時点の公開価格、独立ベンチマーク、実作業レビューを分けて比較します。
先に結論:普段はOpus、高リスクの一部だけFable
| 作業内容 | まず選ぶモデル | 理由 |
|---|---|---|
| 慣れたコードベースでの機能追加、バグ修正、プロトタイプ | Opus 5.5 | 低価格でFableに近い能力があり、結果も確認しやすい |
| 合格条件が明確な移行、監査、一括変更 | Opus 5.5 | 長時間タスクに強い。ただしチェックポイントと停止条件が必要 |
| diffが大きい、または微妙な問題で短時間のレビューが難しい | Fable 5.1 | 実作業レビューでは、最難関の問題でFableの上限が高いと評価された |
| 初回からできるだけ正しい納品物が必要 | Fable 5.1 | 追加の推論費用より、手戻りや納期遅延の方が高くなりやすい |
| 予算も完了条件もない、自由度の高いエージェント実行 | 無人で動かさない | Opusは自ら作業を広げて消費を続けることがある。先に範囲を決める |
「Opusは安く、Fableは賢い」という二分だけでは足りません。見るべきなのは、同じタスクを完了する総費用です。入力、出力、キャッシュ、ツール呼び出し、再実行、人のレビュー、手戻りまで含めて比較します。
公開価格:Opusの入力・出力単価はFableの40%
2026年9月26日時点で、AnthropicのOpus 5.5公式ページは、入力100万token当たり4ドル、出力100万token当たり20ドルとしています。Everyの実作業レビューでは、Fable 5.1はそれぞれ10ドルと50ドルです。
| 100万token当たり | Opus 5.5 | Fable 5.1 | Fable比 |
|---|---|---|---|
| 入力 | $4 | $10 | 60%安い |
| 出力 | $20 | $50 | 60%安い |
入力と出力の構成が同じなら、Fableのtoken単価はOpusの2.5倍です。AnthropicはOpusについて、キャッシュ読み取りを100万token当たり0.20ドル、書き込みを5ドルとも公表しています。ただし、ここで参照したFableの資料には同じ条件のキャッシュ価格がないため、キャッシュ同士の優劣は断定しません。
単価表で分かるのは「1 tokenはいくらか」だけです。「この開発がいくらで終わるか」は分かりません。コーディングエージェントは、ファイルを読み、ツールを使い、テストをやり直し、自分の修正をさらに直します。同じ課題でもモデルごとの消費量は大きく変わります。
1タスク当たりのtoken:Opusは約53%多く出力しても、出力費は低かった
Artificial Analysisによると、最大effortでIntelligence Indexの1タスク当たりに使った平均出力は次の通りです。
- Opus 5.5:約119,000出力token
- Fable 5.1:約78,000出力token
Opusの出力量は約53%多い計算です。この平均値と公開出力単価を組み合わせると、出力tokenだけを見た試算は次のようになります。
- Opus 5.5:119,000 ÷ 1,000,000 × $20 ≈ $2.38
- Fable 5.1:78,000 ÷ 1,000,000 × $50 ≈ $3.90
この評価条件では、Opusは約1.53倍の出力tokenを使いましたが、出力部分の費用は約39%低くなりました。単価差が2.5倍なので、入力と出力の比率が近いなら、OpusはFableの2.5倍までtokenを使って初めてtoken費が同程度になります。
ただし、これは実際のコーディング請求額ではありません。入力、キャッシュ、ツール、失敗後の再実行、プロバイダー側の条件を含まず、Intelligence Indexもあなたのリポジトリではありません。ここから言えるのは、Opusの出力が多いだけで高くなるとは限らない一方、低単価だから長時間実行を放置してよいわけでもないということです。
独立ベンチマーク:Opusは有力な標準モデルだが、全面的な代替ではない
Artificial Analysisは最大effortのOpus 5.5に58点を付けました。公開時点で同社が測定したIntelligence Indexの最高値です。Fable 5.1と直接比べられる結果は次の通りです。
| 独立評価 | Opus 5.5 | Fable 5.1 | 読み方 |
|---|---|---|---|
| Humanity’s Last Exam | 61.4% | 59.1% | Opusが小幅に上回る |
| SciCode | 66.9% | 63.1% | 科学系コーディング問題でOpusが上回る |
| GDPval-AA v2.1 | 1846 Elo | 1735 Elo | エージェント型の知識作業でOpusが上回る |
| AA-Briefcase v1.1 | 1822 Elo | Opusより143 Elo低い | 総合はOpusが上だが、ルーブリック評価の小項目ではFableがわずかに上 |
同じ報告では、OpusはCritPt、AA-LCR、GDP.pdfで首位ではありません。5段階のうち4つのeffortが「知能と1タスク当たり費用」のパレート最適に入りました。つまり、Opusは能力と費用の組み合わせに優れますが、あらゆる仕事で勝つ証明ではありません。
Anthropicが公表したコーディング結果も同じ方向です。たとえばCursorBench 4.0では、Opusの標準medium effortが52.5%、Fableのmax effortが51.8%とされています。ただし、これはベンダー公表値です。Anthropic自身も、最上位モデル間の小さなスコア差は実務差を示しにくくなっていると注意しています。候補を絞る材料にはなりますが、自社タスクのテストを省く理由にはなりません。
実作業レビュー:自動テストが緑でも、製品が壊れていることはある
Everyのチームは発売前にOpus 5.5を7日間使いました。同媒体は、Anthropicから先行アクセスを受けた一方、記事内容への関与はなかったと開示しています。評価が全員一致しなかった点が、むしろ使い分けを示しています。
- あるテスターはFableからOpusへ日常モデルを切り替え、プロダクト開発とコードでは同等、場合によっては上だと評価しました。
- 別のテスターは「小さなFable」と表現し、日常作業や大規模な一気通貫の開発には使いつつ、最難関の問題ではFableを選びました。
- あるテスターは、Opusのコーディング能力をFableの約90%と見積もりました。これはその人の課題に基づく主観的な推定で、一般的なベンチマークではありません。
最も重要な失敗例は、音声入力フォームのアプリです。Opusは約30分動き、約590万tokenを消費しました。自動チェックはすべて緑でしたが、実際に操作すると主要画面でエラーが出て、必須のAIサービスも呼び出していませんでした。
そのため、慣れたコードベースの機能開発やプロトタイプにOpusを使うときも、diffを読む、実アプリを動かす、重要な外部呼び出しを確認するという3段階を残してください。検証に必要なファイルは別コピーも保存し、エージェントが自分の検証材料を変更・削除できないようにします。
Fable 5.1の高い料金がまだ妥当な場面
1. 変更が大きく、短時間で目視確認できない
複数サービスにまたがる変更、元に戻しにくいデータ移行、見つけにくいセキュリティや並行処理の不具合では、token単価より初回の正しさが重要です。Everyのテスターは、この種の最大・最難関の問題を引き続きFableに任せていました。
「Fableはいくら高いか」だけでなく、「失敗を1回避けると何人時を節約できるか」を考えます。ロールバック、障害、原因調査の期待費用がモデル差額を超えるなら、Fableの方が経済的です。
2. 初回から完成品に近い成果物が必要
厳格なテンプレート、ブランドルール、固定納期がある仕事では、EveryのテストでFableの方が安全でした。プレゼン資料の課題でOpusはレイアウトを改善しましたが、ロゴと色を間違え、根拠のない主張も追加しました。Fableの成果物の方が優れていました。
探索の幅より初回の忠実度が重要なら、まずFableを試します。それでも「より安全」は「レビュー不要」という意味ではありません。
3. 人の検証費用が推論費より高い
シニアエンジニアがOpusの大きなパッチを確認するのに2時間かかり、Fableが一貫して小さく証明しやすい変更を出すなら、高いAPI料金でも総費用は下がり得ます。逆に、強いテスト、プレビュー環境、コードレビューを持つチームは、Opusの低価格を実際の節約に変えやすくなります。
自分のコードで公平に比較する方法
1つのプロンプトだけで判断せず、モデルごとに異なるツールや文脈も与えないでください。実在し、再現可能な課題を5〜10個選びます。通常機能、複数ファイルの修正、長時間タスク、高リスク変更を最低1件ずつ含めます。
- 同じリポジトリのスナップショット、システム指示、ツール権限、受け入れテストを使う。
- まず同じeffortで比較し、その後に各モデルの最良設定を別に試す。
- 開始前に完了条件、最大実行時間、token予算、停止条件を書く。
- 入力、出力、キャッシュ、ツール呼び出し、経過時間、初回成功率、人の手戻り時間を記録する。
- 成功した実行だけでなく、失敗と再実行もタスク費用に含める。
判断式は次の通りです。
1タスクの総費用 = モデル料金 + 人のレビュー + 手戻りと再実行 + 誤納品による期待損失
Opusの初回成功率がFableに近ければ、Opusを標準にします。高リスクの特定カテゴリでFableが手戻りを明確に減らすなら、そのカテゴリだけをFableへ振り分けます。こうすれば、日常依頼すべてで2.5倍のtoken単価を払わずに、Fableの高い上限を利用できます。
最終的なおすすめ
大半のコーディングと範囲が明確なエージェント作業では、まずClaude Opus 5.5を選んでください。 入力・出力単価は60%低く、独立結果も最上位クラスの標準モデルとして支持しています。引用データで出力が多くても、試算上の出力費はFableを下回りました。
成果物を確認しにくい、初回失敗が高くつく、または自社の比較テストでFableが手戻りを大幅に減らした場合に、Fable 5.1へ追加料金を払います。 実用的なのは1モデルですべて処理する構成ではありません。検証できる仕事の多くをOpusに任せ、高リスクで価値の高い少数の仕事だけをFableに残します。
参考資料
- Anthropic:Claude Opus 5.5の発表、公式価格、ベンダー評価、2026年9月22日。
- Artificial Analysis:Opus 5.5の独立ベンチマークと1タスク当たりtoken、2026年9月22日。
- Every:Opus 5.5を7日間使った実作業レビュー、2026年9月22日。
データ確認日:2026年9月26日。価格やモデルの挙動は、提供会社の更新後に変わる可能性があります。