AIエージェント評価クラスターに対話・Skills・自己評価ベンチマークを追加
既存のAIエージェント評価ハブを軸に、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBenchを反映し、対話、Agent Skills、自己評価のズレまで読めるようにしました。
公開 2026.06.30 / 更新 2026.06.30
この記事のポイント
- 既存親ハブを更新し、子記事3本だけを追加
- Dialogue SWE-Bench、SWE-Skills-Bench、MarketBenchをCodex/Claude Code運用へ翻訳
- 既存のSWE-bench、AGENTS.md、完了報告、危険権限、レビュー負荷記事を強化
AIエージェント評価・ベンチマークの既存ハブに、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBenchを反映しました。新規親記事を増やさず、SWE-bench系、対話、Agent Skills、自己評価、ターミナル、OS/Web、安全性、自分のrepo評価を1つの導線で読める構成です。
CodexやClaude Codeの運用では、完全自律スコアだけでなく、確認質問、手順書の適合、token overhead、成功見込みのズレ、レビュー負荷まで見ます。公開ベンチマークのスコアは、作業範囲を決める材料であって、本番反映や秘密情報処理を丸投げする根拠ではありません。
関連記事
- AIは論文を再現できるのか?PaperBenchから見るCodexで研究実装を頼む時の限界
論文を読めること、コードを書けること、実験を再現できることは別です。PaperBenchから研究実装をAIに頼む時の安全な切り方を整理します。