本文へスキップ
resq's blog
戻る

Claude Code と Codex、どちらに何を投げるか

更新日:

Claude Code と Codex の両方に金を払っていると、作業のたびにどちらを開くか迷います。どちらが優秀かで決めようとすると、まず決まりません。両社が出しているスコアは噛み合っておらず、それぞれ自分が勝つ盤面だけを見せているからです。

そこで、公式ドキュメントと第三者の計測を突き合わせて、作業の側から振り分ける基準を作りました。使う問いは三つです。どれだけ読ませる必要があるか、放っておける作業か、あとで人に読まれるコードか。

先に断っておくと、自分のリポジトリで測った値は入っていません。公表されている数字を並べ直したものです。

結論

作業◀ Claude Opus 5Codex GPT-5.6 ▶
どれだけ読ませるかで決まる
レガシーコードを読んで仕様を起こす
リポジトリ全体にまたがる改修
再現しないバグの原因を探す
あとで人に読まれる
コードレビュー、設計レビュー
設計や技術選定の相談
放っておける、量が要る
CI 連携、非対話の自動修正
数時間から数日走らせる自律タスク
新規実装、足場作り
フロントエンド、UI 実装
テストの量産
Claude Opus 5Codex GPT-5.6
左右の位置は寄り具合です。中央に近いものほど、もう一方でも困りません。

順位では決まらない理由

では、スコアの高いほうを選べばいいのではないか。公開されている数字を並べても、順位は付きません。空欄のほうが雄弁です。

ベンチマークClaude Opus 5GPT-5.6 Sol注記
SWE-bench Verified97.0%(Vals AI)、96.0%(システムカード帰属)非公表OpenAI は 2026 年 2 月以降 報告していない
SWE-bench Pro79.2%64.6%OpenAI 公式の比較表。Claude 側が大きく上
Terminal-Bench 2.1非公表88.8%(ultra 91.9%)Anthropic は Opus 5 の値を出していない

OpenAI は SWE-bench Verified を出さず、Anthropic は Opus 5 の Terminal-Bench を出しません。両社とも、自分が勝てる盤面だけを見せています。

数字の読み方にも注意がいります。SWE-bench Pro は汚染耐性版で Verified より低く出るので、79.2% と 97.0% を並べて比べてはいけません。同じ Opus 5 の Verified が 96.0% と 97.0% で食い違うのも、実行ハーネスが違うからです。Verified 系は各社で記憶の疑いが指摘されていて、上限の目安として割り引く見方が一般的です。

公開スコアで言えるのは、どちらかが全面的に上ということはない、までです。順位の代わりになるのは作業の側の性質で、制約の硬い順に三つあります。

コンテキストの上限

三つのうち、いちばん硬い制約です。ただし硬いのはモデルの仕様ではなく、既定値と課金の境目のほうでした。

Claude Opus 5
Sonnet 5
1,000K
Codex GPT-5.6 Sol
(既定)
272K
↓ ここから 入力 2x、出力 1.5x
Codex Sol
(設定を上げた場合)
1,050K
Claude Haiku 4.5
200K
Sol の既定は 2026 年 7 月に 372K から 272K へ縮みました。272K を超えると、割増はその超過分ではなくリクエスト全体にかかります。

Codex の既定である Sol は、Codex の中では 272K で動きます。上限ではありません。config.toml の model_context_window と model_auto_compact_token_limit を書き換えれば 1,050K まで開きます。8 月 17 日に Codex の Tibo Sottiaux 本人が手順を公開していて、当初は API キーだけだったのが ChatGPT アカウントでも効くようになりました。

とはいえ、開けば済む話でもありません。OpenAI のモデルページに書かれているとおり、272K を越えた時点で入力が 2 倍、出力が 1.5 倍になり、それがリクエスト全体に適用されます。Sottiaux 自身も既定は性能とコストの両面で詰めたものだと書いていて、同僚の Noam Brown は既定を上げることを勧めないと返しています。リポジトリを丸ごと読ませる作業でこれをやると、精度の前に請求で殴られます。

Opus 5 は 1M を標準価格のまま使えます。レガシー読解や横断改修を Claude に寄せているのは、モデルの賢さではなく、既定のままで殴られないという一点です。逆に、対象が数ファイルに収まる作業なら 272K は何の制約にもなりません。

放っておける作業か

読ませる量が足りるとわかったら、次は走らせ方で分かれます。人が横についていない前提の作業は、止め方が用意されているほうへ寄せます。Codex CLI は read-only、workspace-write、danger-full-access の三段階を、macOS の Seatbelt と Linux の Landlock + seccomp でカーネルレベルに落としています。承認ポリシーも untrusted、on-request、never から選べます。CI で走らせるなら、この作りのほうが安心です。

量が要る作業も同じ側です。同一タスクで Claude Code の約 4 分の 1 のトークンという計測があり、Express.js のリファクタで約 15 ドル対 約 155 ドルという実例が記録されています。ultra 設定は既定で 4 エージェントの並列実行になります。数時間から数日走らせるタスクや、テストの量産をここに置いているのはそのためです。

あとで人に読まれるコードか

速く安く終わることと、翌週の自分が読める diff であることは別です。三つめは、出てきたコードを人が読むかどうかで分かれます。CatDoes が 500 人規模で取った調査では、日常のコーディングでは 65% が Codex を選好する一方、ブラインドでコードを見比べた評価では Claude Code の出力が構造と慣用表現の点で 67% 対 25% で支持されました。

ただしこの調査は手法が公開されていないので、傾向として読むのが妥当です。前の二つが公式ドキュメントで確認できる制約なのに対して、この軸だけ根拠が一段弱いことは断っておきます。レビューと設計をここに置いたのは、この軸が効く場面が主にその二つだからでもあります。

定額と従量の境目

三つの軸で振り分けても、両方に金を払っていなければ実行できません。出力 100 万トークンあたりの単価はこうなっています。

ANTHROPIC
Haiku 4.5
$5
Sonnet 5
$10
Opus 5
$25
OPENAI
GPT-5.6 Luna
$1.20
GPT-5.6 Terra
$12
GPT-5.6 Sol
$30
Sol(販促価格)
$20
入力は Opus 5 が $5、Sol が $5(販促 $4)。Sol の $20 は 2026 年 8 月 21 日から 3 か月の販促価格で、少なくとも 11 月 21 日までと明記されています。

対話で使う分は定額に寄せます。1 日 3 時間から 5 時間ほど触る使い方だと、サブスクのほうが API 従量より 2 倍から 2.5 倍安いという試算が複数あります。Claude Code Max 5x が 100 ドル、ChatGPT Pro が 100 ドルで Codex 5x なので、両方契約して 200 ドル。上の振り分けを実行するには両系統が要るため、ここは削れません。

CI やバッチのような非対話の処理は従量にします。Luna が 0.20 ドル / 1.20 ドル、Haiku 4.5 が 1 ドル / 5 ドルで、定型処理ならこの段で足ります。もう一つ、claude.ai の Settings から Usage を開いて使用クレジットの上限を入れておきます。高いモデルをエージェントに投げると、止まらないまま従量が伸びます。

参照

数字はすべて 2026 年 8 月 28 日時点の公表値です。価格とコンテキストは 7 月から 8 月にかけて複数回変わっていて、今後も動きます。


この記事をシェア:

前の記事
Claude Code アップデートまとめ (2026-08-30 〜 2026-09-05)
次の記事
弐寺DP レポ (2026-08-23 〜 2026-08-29)