GPT-5.6を論文とベンチマークで読む:Codex・AIエージェント・安全性の現在地
GPT-5.6 Sol、max reasoning、ultra modeを、SWE-bench、TerminalWorld、OSWorld、OdysseyBench、PaperBench、Cybench、AgentHarmなどの研究・ベンチマークから読み解き、CodexやAIエージェントに何を任せられるかを整理します。
公開 2026.06.27 / 更新 2026.07.10
この記事のポイント
- GPT-5.6 Solの期待値は、SWE-benchだけでなくTerminal、OS、長時間workflow、研究再現、安全評価を分けて読む
- ベンチマークのスコアは作業設計の材料であり、本番反映、秘密情報、権限変更を自動化してよい根拠にはならない
- Codex利用者は、モデル選びより先に、差分確認、build/check、sitemap/upload、人間レビューの位置を決める
2026年7月10日追記:一般提供後の公式評価を研究記事へ接続
一般提供版ではSol・Terra・Lunaのcoding、computer use、cybersecurity、long context、tool useの公式評価が公開され、ultraは標準4 agents、APIではmulti-agent betaとProgrammatic Tool Callingが追加されました。以下の研究評価は公式scoreだけで上書きせず、何を測るbenchmarkかを分けて読みます。
| 公式評価 | Sol | Sol Ultra | Terra | Luna | 読み方 |
|---|---|---|---|---|---|
| SWE-Bench Pro | 64.6% | — | 63.4% | 62.7% | repo課題の一断面。実repoの指示・reviewは別 |
| Terminal-Bench 2.1 | 88.8% | 91.9% | 87.4% | 84.7% | terminal作業。副作用と生成物を確認 |
| OSWorld 2.0 | 62.6% | — | 50.2% | 45.6% | desktop操作。approvalと権限を残す |
| SEC-Bench Pro | 71.2% | 74.3% | 57.7% | 48.9% | 防御・patch・reviewへ限定 |
冒頭の結論:GPT-5.6は強さではなく評価軸を分けて読む
GPT-5.6 Sol、max reasoning、ultra modeという言葉を見ると、Codexに大きな作業をそのまま任せたくなります。ただ、AIエージェントの実力は、コード修正、ターミナル操作、GUI操作、研究再現、サイバー安全性で別々に見た方が安全です。
GPT-5.6公式発表で確認できること
公式発表とSystem Cardから読めるのは、GPT-5.6 seriesがSol / Terra / Lunaに分かれ、Solが長いコーディング、agentic workflow、max reasoning、ultra mode、サイバーや長時間タスクの評価文脈で語られていることです。一方で、この記事では公式に出ていないGPT-5.6の個別ベンチマーク数値を作りません。
なぜSWE-benchだけでは足りないのか
SWE-benchは実GitHub issueを使うため、AIコーディング評価の重要な入口です。ただし、実務のCodex作業は、issue修正だけでは終わりません。調査、複数ファイル変更、build/check、生成HTML、sitemap、upload、本番前確認、完了報告レビューまで含めると、TerminalWorld、OSWorld、OdysseyBench、PaperBenchのような別軸も必要になります。
| ベンチマーク | 測っている能力 | タスク例 | Codex利用者への示唆 | 読む時の注意点 |
|---|---|---|---|---|
| SWE-bench | 実GitHub issueの修正 | repoを読んでテストを通す修正 | コード修正力の入口になる | issue修正以外の要件定義、レビュー、本番反映は薄い |
| SWE-rebench | 新鮮なタスク収集と汚染対策 | fresh interactive tasks | 古い公開問題だけで比較しない視点 | 評価pipelineやtask selectionを読む |
| SWE-Lancer | 実務価値に近いソフトウェア作業 | フリーランス案件由来の実装判断 | 金額や依頼品質まで含めた実務感を見る | 単純な解決率と収益性は同じではない |
| TerminalWorld / Terminal-Bench | ターミナルでの長い操作 | CLI、ログ確認、ファイル操作、検証 | build/check込みのCodex作業に近い | コマンド副作用と環境差を見る |
| OSWorld | 実コンピュータ環境のGUI/OS操作 | 複数アプリ、画面理解、クリック操作 | ブラウザやOS操作を含むagent評価の限界が分かる | Codex CLIだけの性能とは分ける |
| OdysseyBench | 長時間のオフィスワークフロー | Word、Excel、PDF、メール、カレンダー | subagentsや分担設計の必要性が見える | 成功率より途中状態管理を見る |
| PaperBench | AI研究の再現能力 | 論文理解、実装、実験、rubric評価 | 論文実装を丸投げしない理由が分かる | 再現環境、乱数、評価指標を分ける |
| Cybench | サイバー課題への推論・実行能力 | CTF型課題、セキュリティ評価 | 防御レビューの期待値と境界を考える | 攻撃手順へ寄せない |
| ExploitGym | 脆弱性から攻撃成立までの危険な能力 | 脆弱性理解と悪用可能性評価 | 記事では防御・修正・レビューに限定する | 具体的な再現手順を書かない |
| AgentHarm | エージェントの有害行動リスク | ツール利用で危険な依頼を遂行するか | 権限設計と拒否境界の重要性が分かる | 安全評価として読み、悪用例集にしない |
Codex利用者は何を確認すべきか
| Codexに任せたい作業 | 近いベンチマーク | 必要な能力 | 人間が残す確認 |
|---|---|---|---|
| 1記事+関連リンクの更新 | SWE-bench / TerminalWorld | 既存構造理解、複数ファイル編集、build確認 | 検索意図、出典、生成HTML、sitemap |
| build失敗の原因調査 | TerminalWorld | ログ読解、仮説、再実行、差分管理 | コマンド副作用、不要変更、未確認ログ |
| ブラウザやOSをまたぐ確認 | OSWorld | 画面理解、状態追跡、操作計画 | 最終表示、認証、外部サービス影響 |
| 長いクラスター追加 | OdysseyBench / PaperBench | 作業分解、途中状態管理、出典整理 | 採用判断、薄い重複の見送り、公開判断 |
| セキュリティ修正案 | Cybench / AgentHarm | リスク整理、パッチ候補、拒否境界 | 秘密情報、本番影響、悪用可能な詳細の排除 |
ベンチマークを過信しないチェックリスト
- そのベンチマークは自分の作業に近いか。
- モデル単体の評価か、agent scaffoldやツール実行込みの評価か。
- ファイル編集、テスト実行、ログ確認、再試行が含まれているか。
- タスクが古くなく、データ汚染や公開済み問題の影響を減らしているか。
- 成功率だけでなく、失敗の種類、途中状態、再試行コストを見ているか。
- 本番反映、秘密情報、権限変更、課金処理まで任せてよい話にすり替えていないか。
- 自分のrepoで小さく再現する確認タスクを用意しているか。
サイバー評価は防御の言葉に翻訳する
Cybench、ExploitGym、AgentHarmは、AIエージェントが危険な領域でどこまで進めてしまうかを考える材料です。AI開発横丁では、これを攻撃手順の紹介ではなく、防御的コードレビュー、パッチ作成、権限管理、AGENTS.mdの禁止事項へ翻訳します。
GPT-5.6研究編FAQ
GPT-5.6のベンチマークは何を見ればよいですか?
SWE-benchだけでなく、ターミナル操作、OS/GUI操作、長時間workflow、研究再現、安全評価を分けて見ます。自分の作業に近い評価を優先します。
SWE-benchだけでAIコーディング性能は分かりますか?
入口にはなりますが十分ではありません。実務では要件定義、レビュー、build/check、sitemap、upload、本番前確認が残ります。
TerminalWorldとTerminal-Benchは何が違いますか?
どちらもターミナル作業評価の文脈で読みますが、記事では個別名称より、長いCLI操作、ログ読解、環境差、副作用の扱いを重視します。
ultra modeとsubagentsはどの研究と関係しますか?
OSWorldやOdysseyBenchのように、複数画面・複数アプリ・長時間workflowを扱う評価と相性がよい読み方です。ただしレビュー不要の根拠にはなりません。
CybenchやExploitGymの記事を書いても安全ですか?
安全な抽象度に限定すれば扱えます。攻撃手順や再現コードではなく、防御、レビュー、パッチ、権限設計に寄せます。
関連記事
- AIエージェントのベンチマーク完全ガイド:SWE-benchだけでCodexの実力は分からない理由
ベンチマークはランキングではなく、何を測って何を測っていないかを見る道具です。Codex作業に近い評価軸を分けて読みます。
- SWE-bench・SWE-rebench・SWE-bench-Live・SWE-MERAの違い:AIコーディング評価はなぜ更新され続けるのか
SWE-benchのスコアは無意味ではありません。ただし古い公開タスクだけでは新しいモデル評価が歪むため、fresh / live / dynamicな評価が増えています。
- TerminalWorld・Terminal-Benchで読むAIターミナルエージェントの限界:CodexにCLI作業を任せる前に見ること
ターミナル作業はコマンドを打つだけではありません。環境、ログ、ファイル、生成物、副作用、確認方法まで読めてはじめて実務に近づきます。
- AgentHarm・AgentHazardで読むAIエージェントの危険な失敗:ツール権限と禁止事項をどう設計するか
AIエージェントの危険は、1つの返答よりも、ツール利用、ファイル操作、外部送信、権限変更の連鎖で大きくなります。防御寄りに整理します。