Search the alley

記事を検索

2文字以上でタイトル・カテゴリ・タグを検索できます。

AIエージェント評価クラスターに対話・Skills・自己評価ベンチマークを追加

既存のAIエージェント評価ハブを軸に、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBenchを反映し、対話、Agent Skills、自己評価のズレまで読めるようにしました。

公開 2026.06.30 / 更新 2026.06.30

この記事のポイント

  • 既存親ハブを更新し、子記事3本だけを追加
  • Dialogue SWE-Bench、SWE-Skills-Bench、MarketBenchをCodex/Claude Code運用へ翻訳
  • 既存のSWE-bench、AGENTS.md、完了報告、危険権限、レビュー負荷記事を強化

AIエージェント評価・ベンチマークの既存ハブに、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBenchを反映しました。新規親記事を増やさず、SWE-bench系、対話、Agent Skills、自己評価、ターミナル、OS/Web、安全性、自分のrepo評価を1つの導線で読める構成です。

CodexやClaude Codeの運用では、完全自律スコアだけでなく、確認質問、手順書の適合、token overhead、成功見込みのズレ、レビュー負荷まで見ます。公開ベンチマークのスコアは、作業範囲を決める材料であって、本番反映や秘密情報処理を丸投げする根拠ではありません。

関連記事