PaperBenchの記事一覧
PaperBenchは、AIが論文を読み、実装し、実験を再現する能力を見る評価です。Codexに研究実装を頼む時は、再現成功の判断を人間側に残します。
このテーマの読み方
PaperBenchは、AIが論文を読み、実装し、実験を再現する能力を見る評価です。Codexに研究実装を頼む時は、再現成功の判断を人間側に残します。
- AIエージェントのベンチマーク完全ガイド:SWE-benchだけでCodexの実力は分からない理由
SWE-bench、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBench、TerminalWorld、OSWorld、AgentHarmを分けて読み、Codexに任せる範囲と人間確認の残し方を整理します。
- AIは論文を再現できるのか?PaperBenchから見るCodexで研究実装を頼む時の限界
PaperBenchを入口に、AIへ論文実装や研究再現を頼む時の分解手順、失敗しやすい箇所、人間が確認すべき評価指標を整理します。
- GPT-5.6を論文とベンチマークで読む:Codex・AIエージェント・安全性の現在地
GPT-5.6 Sol、max reasoning、ultra modeを、SWE-bench、TerminalWorld、OSWorld、OdysseyBench、PaperBench、Cybench、AgentHarmなどの研究・ベンチマークから読み解き、CodexやAIエージェントに何を任せられるかを整理します。