Search the alley

記事を検索

2文字以上でタイトル・カテゴリ・タグを検索できます。

AIエージェントの自己評価はどこまで信用できる?MarketBenchで見る成功確率とtoken見積もりのズレ

MarketBenchをもとに、AIエージェントの成功確率、token usage、完了見込みの自己申告をログ・テスト・差分で補正する運用を整理します。

公開 2026.06.27 / 更新 2026.06.30

この記事のポイント

  • MarketBenchはAIエージェントを市場参加者として評価する
  • 成功確率とtoken usageの自己評価にはミスキャリブレーションがある
  • 市場型・入札型の作業配分は自己申告がズレると崩れる

結論:AIの自信はログで補正する

CodexやClaude Codeが「できます」「この程度で終わります」「成功しました」と言っても、それだけで判断してはいけません。MarketBenchは、AIエージェントが成功確率やtoken usageを正しく見積もれるかを見る研究です。実務では、自己申告ではなく、実行ログ、差分、テスト、レビューで補正します。

何を評価する論文か

MarketBenchは、AIエージェントが市場参加者のようにタスクへ参加する状況で、成功確率やtoken usageをどれだけ正しく見積もれるかを評価します。自己申告がズレると、入札型や市場型のタスク配分はうまく機能しません。

何が分かったか

  • LLMは成功確率を過大または過小に見積もることがある。
  • token usageの見積もりもズレる。
  • 自己申告に基づく作業配分は、ミスキャリブレーションがあると崩れやすい。
  • AIエージェント運用では、自己評価より実測ログが重要になる。

Codex / Claude Codeへの読み替え

自己申告そのまま信じない理由見るもの
できます作業範囲や依存関係を見落とすことがある対象ファイル、制約、必要コマンド
成功しました失敗ログや未確認生成物を見落とすことがあるgit diff、build、check、HTML
すぐ終わります調査や再実行で膨らむことがある実測時間、失敗回数
tokenは少ないです長い文脈やSkillsで増えることがある実使用量、ログ、課金上限

実務でどう使うか

  • AIに成功確率を聞くより、成功条件と失敗条件を書かせる。
  • token見積もりは参考値に留め、実測ログを残す。
  • 完了報告には、実行したコマンド、失敗したコマンド、未確認事項を入れさせる。
  • レビュー負荷が高い作業は、AIの自信ではなく差分サイズと影響範囲で判断する。

やってはいけないこと

  • AIエージェントの自己評価を完全に嘘と決めつけない。
  • 逆に、自己評価だけで本番反映やpushを判断しない。
  • token見積もりだけで予算管理しない。
  • レビュー負荷をAIの自信で軽く見積もらない。

MarketBench FAQ

MarketBenchはコーディング専用ベンチマークですか?

コーディングだけではなく、AIエージェントを市場参加者として評価する研究です。この記事ではCodex運用へ読み替えています。

AIの自己評価は全部信用できないのですか?

全部嘘という意味ではありません。参考にはなりますが、ログ、テスト、差分、レビューで補正します。

成功確率を聞く意味はありますか?

あります。ただし数値そのものより、失敗条件、依存関係、不確実な点を出させる方が実用的です。

token usage見積もりはどう扱いますか?

事前見積もりは参考値にし、実使用量や課金上限で管理します。長いSkillsや大量ファイル読み込みでは増えやすいです。

レビュー負荷とどう関係しますか?

AIが自信ありと言っても、差分が大きい、権限が広い、生成物が多い作業はレビュー負荷が高くなります。

個人開発では何を記録すればいいですか?

実行コマンド、build/check結果、失敗ログ、変更ファイル、未確認事項、tokenや時間の実測を残します。

入札型エージェント配分とは何ですか?

複数エージェントが見積もりや自己評価をもとにタスクを取るような仕組みです。自己評価がズレると配分もズレます。

Codexに完了報告を書かせる時のコツは?

確認済み、未確認、失敗から直した点、残る懸念を分けて書かせます。

関連記事