Claude Fable 5 vs GPT-5.6(Sol)徹底比較|コーディングAIの最強はどっちか
7月1日に復活したAnthropicの最上位モデル「Claude Fable 5」と、7月9日に一般提供が始まったOpenAIの新フラッグシップ「GPT-5.6 Sol」。両社の最新最上位モデルを、料金・ベンチマーク・API仕様・実際の使い分けの観点から比較します。ベンチマークの数字を鵜呑みにできない事情も含めて、正直に整理します。
比較の前提:2026年7月中旬の両者の状況
まず前提として、両モデルとも2026年7月に「使える状態」が確定したばかりです。
- Claude Fable 5:6月9日リリース後、輸出規制で一時停止していたが、規制解除を受けて7月1日に完全復活。Claude.ai・Claude Code・APIで利用可能(経緯はこちらの記事で詳しく解説)
- GPT-5.6 Sol:6月26日の限定プレビューを経て、7月9日にChatGPT・Codex・APIで一般提供開始。Sol・Terra・Lunaの3段階構成の最上位
つまり本記事は「Anthropicの最上位 vs OpenAIの最上位」の、どちらも一般提供されている状態での初めての直接対決の比較になります。なお、GPT-5.5時代の比較は6月版の比較記事をご覧ください。
スペック・料金比較
| 項目 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|
| 提供元 | Anthropic | OpenAI |
| モデルID | claude-fable-5 | gpt-5.6-sol |
| 入力価格(100万トークン) | $10 | $5 |
| 出力価格(100万トークン) | $50 | $30 |
| コンテキスト | 100万トークン | 105万トークン |
| 最大出力 | 128K | 128K |
| 推論の制御 | 思考は常時ON(無効化不可)。effortはlow〜maxの5段階 | effort指定+Sol限定の「ultra」モード |
| 主な利用経路 | Claude.ai(Pro以上)・Claude Code・API | ChatGPT(Plus以上)・Codex・API・GitHub Copilot |
| 特記事項 | 安全分類器あり・30日データ保持必須 | gpt-5.6指定はSolのエイリアス(意図せぬ高額利用に注意) |
まず目を引くのは価格差です。Solの単価はFable 5のちょうど半分。さらにOpenAIはSolについてエージェント型コーディングでのトークン効率が54%向上したとしており、単価×消費量の両面で、APIコストはSol側が明確に安くなります。ただしSolの「ultra」モードはトークン消費が大幅に増えるため、ultra常用なら話は別です。
ベンチマーク比較:数字は「割れて」いる
今回の比較で最も重要なのは、ベンチマークによって勝者が入れ替わるという点です。都合の良い数字だけを見ると判断を誤ります。
SWE-bench Pro(実案件型のコード修正):Fable 5の圧勝
| モデル | スコア | 出典 |
|---|---|---|
| Claude Fable 5 | 80.3% | Anthropic公式 |
| GPT-5.6 Sol | 64.6% | 独立リーダーボード集計(OpenAI未公表) |
| GPT-5.6 Terra | 63.4% | 独立リーダーボード集計 |
| GPT-5.5 | 58.6% | 公表値 |
実際のGitHub issueを修正するタイプのベンチマークでは、Fable 5が15ポイント以上の差をつけています。注意点として、OpenAIはSolのSWE-bench Proスコアを自社では公表しておらず、上記は独立集計です。さらにOpenAIは7月8日に「SWE-bench Proのタスクの約30%に欠陥がある」とする監査結果を公表しており、このベンチマーク自体の信頼性に疑問を投げかけています(負けている側からの指摘である点は割り引いて読む必要がありますが、指摘内容自体は具体的です)。
Terminal-Bench 2.1(自律的なターミナル操作):ほぼ互角
| モデル | スコア | 出典 |
|---|---|---|
| GPT-5.6 Sol | 88.8%(ultra時91.9%) | OpenAI公式(自社測定) |
| Claude Fable 5 | 88.0% | Anthropic公式 |
| Claude Opus 4.8 | 82.7% | Anthropic公式 |
コマンドラインでの自律作業能力では、SolがFable 5をわずかに上回ります。ただしどちらも自社測定値で、測定条件は揃っていません。実質的には「同水準」と見るのが妥当です。
Coding Agent Index(独立系の総合評価):効率でSol
第三者機関Artificial AnalysisのCoding Agent Indexでは、Solが最高推論設定でスコア80を記録し、Fable 5を2.8ポイント上回って首位に立ちました。注目すべきはその内訳で、Fable 5の半分以下の出力トークン・半分以下の所要時間・約3分の2のコストでこのスコアを出しています。
・一発の難しいコード修正の精度ならFable 5が明確に上(SWE-bench Pro +15pt)
・長時間の自律エージェント作業は互角〜Solがやや上(Terminal-Bench、Coding Agent Index)
・同じ結果に到達するまでの時間とコストはSolが明確に有利
どちらか一方が全面的に勝っている状況ではありません。
API仕様・運用面の違い
Fable 5:強力だが「縛り」がある
- 思考(Extended Thinking)は常時ONで無効化できません。コスト制御はeffortパラメータで行います
- 安全分類器があり、サイバーセキュリティ・バイオ関連などのリクエストは拒否またはOpus 4.8への切り替えが発生することがあります。セキュリティ診断ツールの開発など、業務内容によっては実質的に使えない場面があります
- 30日間のデータ保持が必須で、ZDR(ゼロデータ保持)を要件とする企業では採用できません
GPT-5.6 Sol:柔軟だが「事故りやすい」ポイントがある
- APIで
gpt-5.6とだけ指定するとSolのエイリアスとして扱われ、バランス型のつもりが最上位料金で課金されます。ティア名まで明示指定が基本です - Sol限定のultraモードは性能を引き上げる代わりにトークン消費が大幅に増えるため、トークン予算(Codexなら
rollout_token_budget)の設定が事実上必須です - Codexでの具体的な設定方法はGPT-5.6のCodex実践ガイドで解説しています
結局どう使い分けるか
| ケース | おすすめ | 理由 |
|---|---|---|
| 難易度の高いバグ修正・レガシーコードの改修 | Fable 5 | 実案件型ベンチマークで圧倒的。1回で直る確率が高い |
| アーキテクチャ設計・技術選定の壁打ち | Fable 5 | 最難関推論での性能差。計画をFableに任せ実装を安いモデルに回す構成も有効 |
| 長時間の自律エージェント作業(環境構築・大量の定型変更) | GPT-5.6 Sol | ターミナル操作系で互角以上、かつ半分の時間・低コストで完走する |
| APIコストを抑えたい・大量に回したい | GPT-5.6(Sol/Terra) | 単価半分+トークン効率の改善。日常タスクはTerraで十分 |
| セキュリティ関連の開発・診断 | GPT-5.6 Sol | Fable 5は安全分類器により拒否・モデル切り替えが発生し得る |
| ZDR(ゼロデータ保持)が要件 | GPT-5.6またはOpus 4.8 | Fable 5は30日データ保持が必須 |
Claude CodeとCodexは併用できます。「設計・難所はFable 5、回す作業はSol/Terra」という分担が、2026年7月時点のコスパ最適解です。サブスクプラン内で使うなら、Claude側はProプラン以上でFable 5が(使用量条件付きで)使え、ChatGPT側はPlus以上でSolが使えるため、両方のサブスクを持つ選択肢も現実的です。モデル使い分けの考え方は「Fable 5で計画、Sonnet 5で実装」検証記事も参考にしてください。
よくある質問
Q. 結局、単純に「頭が良い」のはどっちですか?
最難関の推論・一発の正答率という意味ではFable 5です。SWE-bench Proの15ポイント差は測定条件を差し引いても大きく、FrontierCode Diamondのような最難関ベンチマークでの他モデルとの差も歴然です。ただし「同じ時間と予算でどれだけ仕事が進むか」という実務の尺度ではSolが逆転するケースが多い、というのが正確な答えです。
Q. GPT-5.6にはTerra・Lunaもありますが、比較対象はSolだけでいいですか?
Fable 5の対抗として比較すべきはSolです。ただしTerraはGPT-5.5並みの性能を約半額で提供する実用的なモデルで、日常的なコーディングの多くはTerraで足ります。3ティアの使い分けはCodex実践ガイドで詳しく解説しています。
Q. ベンチマークの数字はどこまで信用できますか?
本文の通り、各社が公表するのは自社に有利な数字で、SWE-bench Pro自体にも欠陥の指摘が出ています。本記事では出典(自社測定か独立集計か)を明記しました。数ポイントの差は誤差と考え、15ポイント級の差と第三者評価(Coding Agent Index)を重視するのが現実的な読み方です。
Q. Claude Mythos 5との関係は?
Fable 5はMythos 5と同じ基盤モデルに追加の安全対策を施した一般提供版です。Mythos 5は米国の承認組織限定で、一般ユーザーが比較検討する対象はFable 5になります。詳しくはMythos 5の解説記事をご覧ください。
まとめ
- 2026年7月、Fable 5(7/1復活)とGPT-5.6 Sol(7/9 GA)が初めて「両方使える」状態で揃った
- 料金はSolがFable 5の半分($5/$30 vs $10/$50)。トークン効率も向上しており実効コスト差はさらに大きい
- ベンチマークは割れている:一発の難問修正はFable 5、自律エージェント作業の速度・効率はSol
- Fable 5には安全分類器・30日データ保持という運用上の縛りがある点に注意
- 現実解は併用。「設計・難所はFable 5、回す作業はSol/Terra」が7月時点のコスパ最適解


