SWE-benchの記事一覧
SWE-benchはAIコーディング評価の代表的な入口です。SWE-rebench、SWE-bench-Live、SWE-MERA、SWE-Bench++とあわせて、古い公開タスクや汚染を過信しない読み方を整理します。
このテーマの読み方
SWE-benchはAIコーディング評価の代表的な入口です。SWE-rebench、SWE-bench-Live、SWE-MERA、SWE-Bench++とあわせて、古い公開タスクや汚染を過信しない読み方を整理します。
- AIエージェントのベンチマーク完全ガイド:SWE-benchだけでCodexの実力は分からない理由
SWE-bench、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBench、TerminalWorld、OSWorld、AgentHarmを分けて読み、Codexに任せる範囲と人間確認の残し方を整理します。
- SWE-bench・SWE-rebench・SWE-bench-Live・SWE-MERAの違い:AIコーディング評価はなぜ更新され続けるのか
SWE-bench系ベンチマークが増え続ける理由を、汚染、古いissue、弱いテスト、多言語化、live-updatable評価の観点から整理します。
- AIベンチマークの汚染とは?SWE-bench-Live・SWE-MERAからスコアを信じすぎない読み方
ベンチマーク汚染、公開タスクの古さ、弱いテスト、live-updatable benchmarkの意味を、SWE-rebench、SWE-bench-Live、SWE-MERAから整理します。