Claude CodeとCodex、性能で選ぶならどちらか
実装、調査、ターミナル操作、画面確認まで広く任せるなら、この記事ではGPT-6 Astraを使うCodexを第一候補にします。 一方、比較対象をClaude Opus 5とGPT-5.6 Solに絞ると、公表された複数の開発系指標でOpus 5が優勢です。「Codexだから常に強い」「Claude Codeだからコードが得意」と、製品名だけでは決められません。
この記事では、Claude Fable 5対GPT-6 Astra、Claude Opus 5対GPT-5.6 Solを中心に、性能、長い作業への対応、速度と費用を比較します。Sonnet・Haiku・Terra・Lunaと、すでに登場しているFable 5.1も取り上げます。
確認日は2026年9月18日です。独自の実機対決は行っていません。 数値は提供元・評価運営者の公開資料、用途別の推奨はそれを踏まえた編集上の判断です。総合性能は「コードの正しさだけでなく、周辺調査や実行・検証まで進められる能力」と定義し、料金は別に評価します。
表は横にスクロールできます
| 比較する範囲 | 本記事の判断 | 判断の理由と限界 |
|---|---|---|
| Fable 5 対 Astra | 広い作業への対応ではAstraを推奨 | ターミナル操作・科学計算で優勢。コード品質を含む指標ではFable 5が上回る項目もある |
| Opus 5 対 Sol | 開発性能を優先するならOpus 5を推奨 | 後述の開発系公表値で優勢。API単価は現在のSolが安い |
| 現行上位モデルを含む総合選択 | Astra搭載Codexを第一候補にする | 作業範囲の広さを重視した判断。Fable 5.1との差は旧Fable 5ほど大きくない |
| 日常の小さな修正・大量処理 | Sonnet 5・Terra・Lunaも比較する | 最高性能より、必要な品質を満たすまでの時間と費用が重要になる |
根拠となる数値と出典、判断を変える条件を以下に示します。
最初に揃えるべき比較条件
開発ツールと、その中で動くモデルを区別する
Claude CodeとCodexは開発作業を進めるためのツールです。Fable、Opus、Astra、Solは、その中で推論やコード生成を担当するモデルです。ファイル探索、コマンド実行、会話の保持、追加指示、権限設定まで含めた実行の仕組みによっても結果が変わります。
モデルの選び方はClaude Codeのモデル設定とCodexのモデル一覧で確認できます。本記事は標準的に利用するClaude系・OpenAI系モデルを対象にしています。
したがって、APIや別の実行環境で測定したモデルの点数を、そのまま「Claude CodeとCodexを同じPCで動かした結果」と扱うことはできません。公開値から比較できる能力と、実際のツール上で確かめるべき使い勝手を分けて読む必要があります。
同じ名前のベンチマークでも、条件が違うことがある
たとえばTerminal-Bench 4.0の評価説明では、ターミナルを通して作業を終えた環境を検証します。一方、CognitionのFrontierCode 1.1は、コードの正しさに加えて品質を評価するためのものです。測る対象が違うため、点数を単純に平均して総合点にはしません。
この記事では次の基準で数値を扱います。
- ベンチマーク名に加え、バージョンやMain・Extendedなどの区分を揃える。
- 提供元の比較表は公表値として掲載し、独立した追試と区別する。
- 小さな差を、統計的に確かな性能差と断定しない。
- 異なる資料の数値は別表にし、都合のよい値だけを継ぎ合わせない。
- 推論設定、ツール、安全対策、試行回数の違いを確認する。
Fable 5とAstraを徹底比較
公表値ではAstraが広い作業に強く、コード品質では接戦
以下はOpenAIのAstra発表資料の同一比較表から抜き出した値です。すべて高いほど良い指標です。OpenAIは各推論設定での最大スコアを掲載し、研究環境やAPIでの評価は製品利用時と異なり得ると説明しています。同じ時間・同じ費用での対決ではありません。
表は横にスクロールできます
| 公表指標・測る能力 | Fable 5 | GPT-6 Astra | 数値上の比較 |
|---|---|---|---|
| Terminal-Bench 4.0 ターミナル作業の完遂 | 44.5% | 57.9% | Astraが13.4ポイント高い |
| DeepSWE v1.1 長い開発課題の解決 | 69.9% | 74.1% | Astraが4.2ポイント高い |
| FrontierCode 1.1 Extended コードの正しさと品質・全150課題 | 64.9% | 64.5% | Fable 5が0.4ポイント高い |
| FrontierCode 1.1 Main コードの正しさと品質・難しい100課題 | 53.5% | 53.3% | Fable 5が0.2ポイント高い |
| Terminal-Bench Science 0.1 科学研究の作業の完遂 | 21.4% | 64.6% | Astraが43.2ポイント高い |
| Humanity’s Last Exam・ツールあり 専門分野の知識と推論 | 63.8% | 57.2% | Fable 5が6.6ポイント高い |
各指標は、次のように読むと開発作業との関係が分かります。 以下の定義は2026年9月18日に各評価の一次資料で確認しています。
- Terminal-Bench 4.0:コマンドを実行し、ソフトウェア・機械学習・運用などの課題を終えられるかを測ります。作業後の環境をテストで検証するため、説明だけでなく実際に動かして完了する力の参考になります。点数は課題の成功率です。評価方法
- DeepSWE v1.1:複数の工程を要する開発課題の解決率です。AIがコミットした変更を別の隔離環境へ適用し、テストで採点します。長い実装を完成させ、変更後も動くコードを残せるかを見る参考になります。v1.1の採点方法
- FrontierCode 1.1:実際のオープンソース開発のPRを題材に、正しく動くことに加え、レビュー基準に沿ったコード品質も採点します。Extendedは全150課題、Mainはそのうち難しい100課題です。表の値は採点基準に基づくスコアで、課題を丸ごと解決した割合とは区別します。既存コードに合う修正を評価したいときの参考になります。対象課題と採点方法
- Terminal-Bench Science 0.1:科学者の研究作業を基にした70課題の解決率です。データ解析、シミュレーション、最適化などを実行し、成果物を課題別のテストで確かめます。研究・数値計算を含む開発の参考になりますが、一般的なWebアプリ改修の成功率とは同じではありません。評価対象と具体例
- Humanity’s Last Exam(HLE):数学・自然科学・人文科学など、専門家が作成した難問への正答率です。この表は検索やコード実行などのツールを利用できる条件の値で、ツールなしの値とは分けて比較します。専門知識と推論の参考になりますが、リポジトリの修正や研究作業の完遂を直接測るものではありません。HLEの目的と指標
この表から読み取れるのは、Astraがどの課題でも勝つわけではなく、ターミナルを使った作業や科学的な実行課題で差が大きいということです。FrontierCodeのわずかな差から、どちらのコードが常に優れているとも言えません。専門知識を問うHLEにもFable 5の強みが残っています。
開発の依頼には、コードを書く以外の作業もあります。再現環境を用意し、失敗原因を調べ、テストを動かし、結果に合わせて修正する。その比重が大きい仕事を想定するなら、この記事はAstraを選びます。既存コードに自然に収まる修正の品質を最優先するなら、Fable側を外す根拠にはなりません。
長時間の調査と、途中で依頼が変わる仕事
Astraの公式ガイドは、長い作業での一貫性、途中の追加指示への対応、曖昧な依頼での確認を特徴として説明しています。これは、原因調査の途中で「この制約も守ってほしい」と伝えるような開発作業に関係する性質です。ただし、ガイドに書かれた特徴だけで、実案件の手戻り削減率までは判断できません。
Fable 5の発表資料も、長い自律作業や検証を重視しています。Fableには安全対策によって別モデルが応答する場合があるため、比較時は選択したモデル名だけでなく、実際に作業したモデルの記録も必要です。
どちらを使う場合も、長く考え続けること自体を高評価にしないほうがよいでしょう。調査した事実、未解決の点、実行したテスト、最終差分を追えるかどうかが、人間が引き継ぐ際の品質になります。
コンテキストの大きさだけでは勝敗は決まらない
表は横にスクロールできます
| API仕様 | Fable 5 | Astra | Opus 5 | Sol |
|---|---|---|---|---|
| コンテキスト上限 | 100万トークン | 105万トークン | 100万トークン | 105万トークン |
| 最大出力 | 12.8万トークン | 12.8万トークン | 12.8万トークン | 12.8万トークン |
出典は各モデルのAPI仕様、Fable 5、Astra、Opus 5、Solです。AstraとSolの最大入力は92.2万トークンで、コンテキスト全体を入力に使えるわけではありません。ツール側の有効上限や会話の圧縮条件も別途影響します。
大きいコンテキストは多くの資料を扱う余地になりますが、必要な箇所を正確に選び、変更の影響を追えるかは別の能力です。リポジトリ全体を読ませられることと、すべての依存関係を理解できることは同義ではありません。
Opus 5とSolを徹底比較
開発性能ではOpus 5を推奨する根拠がある
以下はAnthropicのFable 5.1発表資料に掲載されたOpus 5とSolの値です。先ほどのOpenAI表とは別の集計であり、この表の中で比較します。
表は横にスクロールできます
| 公表指標・測る能力 | Opus 5 | GPT-5.6 Sol | 数値上の比較 |
|---|---|---|---|
| Terminal-Bench 4.0 ターミナル作業の完遂 | 52.3% | 37.3% | Opus 5が15.0ポイント高い |
| CursorBench 3.2.0 実際の開発依頼への対応 | 70.0% | 67.2% | Opus 5が2.8ポイント高い |
| Terminal-Bench Science 0.1 科学研究の作業の完遂 | 29.0% | 22.4% | Opus 5が6.6ポイント高い |
| AutomationBench 業務ツールをまたぐ作業の完遂 | 26.9% | 19.6% | Opus 5が7.3ポイント高い |
この表で新たに登場する2つの指標も、測る対象が異なります。 Terminal-BenchとTerminal-Bench Scienceの意味は前の表と同じです。
- CursorBench 3.2.0:Cursorの開発チームによる実際の利用を基に、コード編集や不具合調査などへの対応を評価する指標です。3.2では指示への追従と高度なツール利用の課題が追加されています。実際の開発依頼を解決する力の参考になりますが、Cursorの評価環境に依存するため、Claude CodeやCodexそのものの利用成績ではありません。評価の設計、3.2の変更履歴
- AutomationBench:営業・マーケティング・運用・サポート・財務・人事の業務を、複数のツールを使って完了できるかを測ります。たとえば顧客管理のレコード更新や連絡が正しく行われたかを、作業後の状態から判定します。数値は業務の成功率であり、コード生成の正確さや速さの指標ではありません。Zapierの評価説明
Anthropicの比較資料はTerminal-Bench Scienceの標準誤差をモデルごとに±3.5〜4.5ポイントと説明しています。小幅な差の順位は慎重に扱う必要がありますが、掲載した複数の方向でOpus 5が高いことは、候補を選ぶ根拠になります。
提供元以外の測定も見ておきます。DatacurveのDeepSWE v1.1公開ボードでは、Opus 5のmax設定が74%±4%、Solのmax設定が73%±3%という丸め表示です。この評価では両者は近く、明確な優劣を付ける根拠にはなりません。同ボードの平均費用はそれぞれ$11.84と$6.46で、Solが低い値です。費用は評価時の条件によるもので、現在の自分の案件の見積額ではありません。
Opus 5とSolの二択で、料金より開発作業の成功を優先するなら、この記事の推奨はOpus 5です。 とくに、実装とツール操作を組み合わせる仕事では、まずOpus 5を試す理由があります。
Opus 5の公式発表は、自己検証や反復改善も特徴として挙げています。ただし、「確認を多く行う」と「必要な確認を適切に行う」は同じではありません。レビューではテストの数だけでなく、元の不具合が再現しなくなったか、関係のない変更が増えていないかを見ます。
Solを選ぶ理由は、現在の単価と既存の運用にある
Solは公式仕様で複雑な専門作業向けのモデルとして位置付けられています。現在の通常API単価はOpus 5より低く、既にCodexで依頼・確認の手順を整えているなら、その環境でSolを評価する価値があります。
ここで「安いから性能も劣る」「新しいから全面的に上」とは判断しません。必要な品質を同じ回数で満たせる仕事なら、安いモデルのほうが実用上有利になります。逆に、追加依頼と手直しが増えるなら、単価差は小さくなります。コストを含めた選択は、作業完了までの時間と総費用で判断します。
Fable 5.1を含めると、結論はどう変わるか
2026年9月18日時点で、Fable 5は公式資料上で旧世代の扱いになっており、Fable 5.1への移行が案内されています。Fable 5に対するAstraの差を、そのまま最新Claudeとの性能差として紹介するのは不適切です。
同じOpenAIの比較表でFable 5.1を見ると、Terminal-Bench 4.0は55.8%でAstraの57.9%に近づきます。FrontierCode 1.1 Extendedも63.6%対64.5%です。総合的な能力の別指標であるArtificial Analysis Intelligence Index v4.1.1では、Fable 5.1が65.7、Astraが61.2と順序が逆になります。この指数は成功率ではありません。
Artificial Analysis Intelligence Indexは、複数の評価を組み合わせた総合指数です。 知識、推論、数学、プログラミングなどを横断して見るためのもので、「65.7なら依頼の65.7%を成功させる」という意味ではありません。構成する評価や重みはバージョンで変わるため、本記事のv4.1.1と別バージョンの値を直接比較しないでください。運営元の算出方法で、その位置付けと変更履歴を確認できます。
つまり、現在の上位モデル同士は、何を重く評価するかで推奨が変わる比較です。本記事は「調べて、動かして、検証する範囲の広さ」を重視してAstraを第一候補にしますが、純粋なコード修正や知識・推論の評価を重視する読者には、Fable 5.1との比較が欠かせません。公表値から製品全体の絶対的な勝者を証明したわけではありません。
Claude Codeで追試するときは、モデルの別名にも注意します。fableの参照先はバージョンや接続先で変わるため、公式のモデル設定に従い、Fable 5の比較にはclaude-fable-5、5.1の比較にはclaude-fable-5-1のように対象を明示し、実際の応答モデルを記録してください。
他のモデルは、どの仕事で比較するか
上位モデルを常用する前に、作業の難しさに応じた候補も押さえておきましょう。以下の用途は、Claudeのモデル一覧とCodexのモデル一覧に示される位置付けを踏まえた提案です。横並びの性能順位ではありません。
表は横にスクロールできます
| モデル | 比較候補になる仕事 | 上位モデルへ切り替える判断 |
|---|---|---|
| Claude Sonnet 5 | 日常の実装、テスト追加、範囲の決まった修正 | 複数の制約を落とす、原因調査が進まない場合にOpusやFableを試す |
| Claude Haiku 4.5 | 単純な分類・整形・対象が明確な小さな作業 | 広い影響調査や難しい設計判断が必要になったら上位候補を試す |
| GPT-5.6 Terra | 日常の開発作業を品質と料金の両面で評価する基準 | 仕様が曖昧、依存関係が複雑、修正を繰り返す場合にSolやAstraを試す |
| GPT-5.6 Luna | 小さな修正、抽出・分類、件数の多い定型作業 | 安さより調査・レビューの負担が大きくなったら上位候補を試す |
| GPT-5.5・旧Claudeモデル | 既存の評価結果や運用との比較基準 | 新規導入では、提供継続と移行先を確認して現行モデルから比較する |
Sonnet 5とTerraは普段使いの比較候補、HaikuとLunaは軽い仕事の比較候補になります。ただし、同じ行動を期待する候補同士であっても、同等の性能という意味ではありません。Mythos系は利用条件が異なるため、一般的なClaude Code利用者向けの総合順位には含めません。Anthropicの提供範囲の説明では、FableとMythosを区別しています。
低価格モデルの単価と選び方は、開発エンジニア向け、コスパの良いAIモデルでも扱っています。
速度・料金・利用枠まで含めて比較する
上位4モデルのAPI単価
次の金額は100万トークンあたりの米ドル、通常の同期API、キャッシュなしです。OpenAI側は入力272Kトークン以下の料金です。Batch、Fastモード、ツール料金などは含みません。
表は横にスクロールできます
| モデル | 入力 | 出力 | 入力1万・出力2千トークンの計算例 |
|---|---|---|---|
| Claude Fable 5 | $10 | $50 | $0.20 |
| GPT-6 Astra | $10 | $50 | $0.20 |
| Claude Opus 5 | $5 | $25 | $0.10 |
| GPT-5.6 Sol | $4 | $20 | $0.08 |
出典はOpenAIの現行料金表、Fable 5の料金、Opus 5の料金です。Solは少なくとも2026年11月21日までのプロモーション料金が案内されています。OpenAIでは272Kを超える入力に別料金が適用されるため、大量のコードを毎回渡す条件でこの表をそのまま使うことはできません。
計算例の出力は推論分などを含む課金対象の総量です。画面に表示された回答の長さだけでは計算できません。また、同じ依頼でもモデルごとにトークン数やツールの往復回数が変わるため、これは単価の比較例であり、開発1件の費用予測ではありません。
Fable 5.1は通常の入力・出力単価を維持しつつ、キャッシュ読み取りの料金が見直されています。長い会話ではキャッシュの影響が大きいため、Fable 5の料金比較をそのまま5.1の総費用へ当てはめないでください。Fable 5.1の料金変更で条件を確認できます。
最初の応答が速いことと、修正が早く終わることは別
今回確認した資料だけでは、全モデルを同じPC・同じリポジトリ・同じ設定で実行した所要時間は揃いません。そこで「Astraは何倍速い」「Claude Codeは必ず待ち時間が短い」といった製品全体の速度順位は付けません。
実際に測るなら、応答開始まで、AIが作業を終えるまで、人間のレビューと修正までの3つに分けます。最初の出力が速くても、テスト漏れで依頼し直すなら、使える状態になるまでの時間は長くなります。
API単価と月額プランの利用枠も別物です。Codexの料金説明では、モデル・作業量・コンテキストなどで消費量が変わります。Claude CodeのFableも、プランに応じてusage creditsを使う場合があります。同じ月額で同じ件数を処理できるとは限りません。
結論:総合性能はAstra搭載Codexを推奨、Opus対SolならClaude Code
本記事の推奨は、実装から調査・実行・検証まで広く任せるなら、Astraを選べるCodexを第一候補にすることです。Fable 5との公表値では、コード品質に関する接戦を残しつつ、ターミナルや科学的な実行課題に強みが見られるためです。
一方、Opus 5とSolの二択で開発性能を優先するなら、Opus 5を使うClaude Codeを推奨します。 Solは現在のAPI単価や既存のCodex運用を含めて判断する候補です。
そして、今から上位モデルを選ぶならFable 5.1も必ず比較対象に入れます。コード品質を重く見る仕事ではClaude Code側を選ぶ余地があり、単一の総合指標で常にAstraが勝つわけでもありません。
この結論は、2026年9月18日に確認した公開資料に基づく選択指針です。実際の開発で比較するときは、同じ開始状態・依頼・完了条件を揃え、モデルと推論設定を記録します。テストの成否だけでなく、人間の手直しを含む時間と総費用を見て、必要な品質を満たす構成を選んでください。