AgentHazardの記事一覧
AgentHazardは、computer-use agentの危険な行動を考えるための安全性評価です。ブラウザ、OS、外部送信、権限変更を人間確認つきで扱います。
このテーマの読み方
AgentHazardは、computer-use agentの危険な行動を考えるための安全性評価です。ブラウザ、OS、外部送信、権限変更を人間確認つきで扱います。
- AIエージェントのベンチマーク完全ガイド:SWE-benchだけでCodexの実力は分からない理由
SWE-bench、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBench、TerminalWorld、OSWorld、AgentHarmを分けて読み、Codexに任せる範囲と人間確認の残し方を整理します。
- AgentHarm・AgentHazardで読むAIエージェントの危険な失敗:ツール権限と禁止事項をどう設計するか
AgentHarm、AgentHazard、GPT-5.6 System Card、OWASP Top 10 for LLM Applicationsから、AIエージェントの危険行動を防ぐ権限設計を整理します。