Search the alley

記事を検索

2文字以上でタイトル・カテゴリ・タグを検索できます。

GPT-5.6研究編クラスターを追加:SWE-benchだけでなく長時間タスク・OS操作・安全評価まで整理

GPT-5.6公式発表クラスターの続編として、SWE-bench、TerminalWorld、OSWorld、OdysseyBench、PaperBench、Cybench、ExploitGym、AgentHarm、System Cardを使った研究・ベンチマーク編を追加しました。

公開 2026.06.27 / 更新 2026.06.27

この記事のポイント

  • 新規親記事と長時間タスク、ultra mode、サイバー評価の子記事を追加
  • 既存SWE-bench記事を大幅強化し、SWE-rebench / SWE-Lancer / TerminalWorld / OSWorldへ接続
  • Cybench / ExploitGym / AgentHarmは防御・レビュー・権限設計の観点に限定

GPT-5.6公式発表クラスターの続編として、研究・ベンチマークからGPT-5.6 Sol、Codex、AIエージェントの実力と限界を読むクラスターを追加しました。

薄い用語記事は増やさず、SWE-benchだけでAIコーディング性能を判断する危うさ、TerminalWorld / OSWorld / OdysseyBenchが示す長時間タスクの難しさ、PaperBenchが示す研究再現の限界、Cybench / ExploitGym / AgentHarmを安全に扱う境界を整理しています。

関連記事