Claude Code と Codex の両方に金を払っていると、作業のたびにどちらを開くか迷います。どちらが優秀かで決めようとすると、まず決まりません。両社が出しているスコアは噛み合っておらず、それぞれ自分が勝つ盤面だけを見せているからです。
そこで、公式ドキュメントと第三者の計測を突き合わせて、作業の側から振り分ける基準を作りました。使う問いは三つです。どれだけ読ませる必要があるか、放っておける作業か、あとで人に読まれるコードか。
先に断っておくと、自分のリポジトリで測った値は入っていません。公表されている数字を並べ直したものです。
結論
順位では決まらない理由
では、スコアの高いほうを選べばいいのではないか。公開されている数字を並べても、順位は付きません。空欄のほうが雄弁です。
| ベンチマーク | Claude Opus 5 | GPT-5.6 Sol | 注記 |
|---|---|---|---|
| SWE-bench Verified | 97.0%(Vals AI)、96.0%(システムカード帰属) | 非公表 | OpenAI は 2026 年 2 月以降 報告していない |
| SWE-bench Pro | 79.2% | 64.6% | OpenAI 公式の比較表。Claude 側が大きく上 |
| Terminal-Bench 2.1 | 非公表 | 88.8%(ultra 91.9%) | Anthropic は Opus 5 の値を出していない |
OpenAI は SWE-bench Verified を出さず、Anthropic は Opus 5 の Terminal-Bench を出しません。両社とも、自分が勝てる盤面だけを見せています。
数字の読み方にも注意がいります。SWE-bench Pro は汚染耐性版で Verified より低く出るので、79.2% と 97.0% を並べて比べてはいけません。同じ Opus 5 の Verified が 96.0% と 97.0% で食い違うのも、実行ハーネスが違うからです。Verified 系は各社で記憶の疑いが指摘されていて、上限の目安として割り引く見方が一般的です。
公開スコアで言えるのは、どちらかが全面的に上ということはない、までです。順位の代わりになるのは作業の側の性質で、制約の硬い順に三つあります。
コンテキストの上限
三つのうち、いちばん硬い制約です。ただし硬いのはモデルの仕様ではなく、既定値と課金の境目のほうでした。
Codex の既定である Sol は、Codex の中では 272K で動きます。上限ではありません。config.toml の model_context_window と model_auto_compact_token_limit を書き換えれば 1,050K まで開きます。8 月 17 日に Codex の Tibo Sottiaux 本人が手順を公開していて、当初は API キーだけだったのが ChatGPT アカウントでも効くようになりました。
とはいえ、開けば済む話でもありません。OpenAI のモデルページに書かれているとおり、272K を越えた時点で入力が 2 倍、出力が 1.5 倍になり、それがリクエスト全体に適用されます。Sottiaux 自身も既定は性能とコストの両面で詰めたものだと書いていて、同僚の Noam Brown は既定を上げることを勧めないと返しています。リポジトリを丸ごと読ませる作業でこれをやると、精度の前に請求で殴られます。
Opus 5 は 1M を標準価格のまま使えます。レガシー読解や横断改修を Claude に寄せているのは、モデルの賢さではなく、既定のままで殴られないという一点です。逆に、対象が数ファイルに収まる作業なら 272K は何の制約にもなりません。
放っておける作業か
読ませる量が足りるとわかったら、次は走らせ方で分かれます。人が横についていない前提の作業は、止め方が用意されているほうへ寄せます。Codex CLI は read-only、workspace-write、danger-full-access の三段階を、macOS の Seatbelt と Linux の Landlock + seccomp でカーネルレベルに落としています。承認ポリシーも untrusted、on-request、never から選べます。CI で走らせるなら、この作りのほうが安心です。
量が要る作業も同じ側です。同一タスクで Claude Code の約 4 分の 1 のトークンという計測があり、Express.js のリファクタで約 15 ドル対 約 155 ドルという実例が記録されています。ultra 設定は既定で 4 エージェントの並列実行になります。数時間から数日走らせるタスクや、テストの量産をここに置いているのはそのためです。
あとで人に読まれるコードか
速く安く終わることと、翌週の自分が読める diff であることは別です。三つめは、出てきたコードを人が読むかどうかで分かれます。CatDoes が 500 人規模で取った調査では、日常のコーディングでは 65% が Codex を選好する一方、ブラインドでコードを見比べた評価では Claude Code の出力が構造と慣用表現の点で 67% 対 25% で支持されました。
ただしこの調査は手法が公開されていないので、傾向として読むのが妥当です。前の二つが公式ドキュメントで確認できる制約なのに対して、この軸だけ根拠が一段弱いことは断っておきます。レビューと設計をここに置いたのは、この軸が効く場面が主にその二つだからでもあります。
定額と従量の境目
三つの軸で振り分けても、両方に金を払っていなければ実行できません。出力 100 万トークンあたりの単価はこうなっています。
対話で使う分は定額に寄せます。1 日 3 時間から 5 時間ほど触る使い方だと、サブスクのほうが API 従量より 2 倍から 2.5 倍安いという試算が複数あります。Claude Code Max 5x が 100 ドル、ChatGPT Pro が 100 ドルで Codex 5x なので、両方契約して 200 ドル。上の振り分けを実行するには両系統が要るため、ここは削れません。
CI やバッチのような非対話の処理は従量にします。Luna が 0.20 ドル / 1.20 ドル、Haiku 4.5 が 1 ドル / 5 ドルで、定型処理ならこの段で足ります。もう一つ、claude.ai の Settings から Usage を開いて使用クレジットの上限を入れておきます。高いモデルをエージェントに投げると、止まらないまま従量が伸びます。
参照
数字はすべて 2026 年 8 月 28 日時点の公表値です。価格とコンテキストは 7 月から 8 月にかけて複数回変わっていて、今後も動きます。
- Introducing Claude Opus 5
- GPT-5.6
- GPT-5.6 Sol のモデルページ(272K 超の課金、価格、コンテキスト)
- Codex documentation
- Tibo Sottiaux の投稿(1M コンテキストの設定手順、2026-08-17)
- openai/codex#32486(既定のままでも 272K を超えうるという報告)