GPT-5.6研究編クラスターを追加:SWE-benchだけでなく長時間タスク・OS操作・安全評価まで整理
GPT-5.6公式発表クラスターの続編として、SWE-bench、TerminalWorld、OSWorld、OdysseyBench、PaperBench、Cybench、ExploitGym、AgentHarm、System Cardを使った研究・ベンチマーク編を追加しました。
公開 2026.06.27 / 更新 2026.06.27
この記事のポイント
- 新規親記事と長時間タスク、ultra mode、サイバー評価の子記事を追加
- 既存SWE-bench記事を大幅強化し、SWE-rebench / SWE-Lancer / TerminalWorld / OSWorldへ接続
- Cybench / ExploitGym / AgentHarmは防御・レビュー・権限設計の観点に限定
GPT-5.6公式発表クラスターの続編として、研究・ベンチマークからGPT-5.6 Sol、Codex、AIエージェントの実力と限界を読むクラスターを追加しました。
薄い用語記事は増やさず、SWE-benchだけでAIコーディング性能を判断する危うさ、TerminalWorld / OSWorld / OdysseyBenchが示す長時間タスクの難しさ、PaperBenchが示す研究再現の限界、Cybench / ExploitGym / AgentHarmを安全に扱う境界を整理しています。