ベンチマークの記事一覧
ベンチマークはAI開発ツール比較の入口ですが、SWE-benchだけでなく、ターミナル操作、OS操作、長時間workflow、安全評価、汚染、既存repoとの相性を分けて読む必要があります。
このテーマの読み方
ベンチマークはAI開発ツール比較の入口ですが、SWE-benchだけでなく、ターミナル操作、OS操作、長時間workflow、安全評価、汚染、既存repoとの相性を分けて読む必要があります。
- AIエージェントのベンチマーク完全ガイド:SWE-benchだけでCodexの実力は分からない理由
SWE-bench、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBench、TerminalWorld、OSWorld、AgentHarmを分けて読み、Codexに任せる範囲と人間確認の残し方を整理します。
- SWE-bench・SWE-rebench・SWE-bench-Live・SWE-MERAの違い:AIコーディング評価はなぜ更新され続けるのか
SWE-bench系ベンチマークが増え続ける理由を、汚染、古いissue、弱いテスト、多言語化、live-updatable評価の観点から整理します。
- TerminalWorld・Terminal-Benchで読むAIターミナルエージェントの限界:CodexにCLI作業を任せる前に見ること
TerminalWorld、Terminal-Bench、terminal-agent task guidelineから、Codexにbuild/checkやログ読解を任せる前の安全手順を整理します。