AgentHarmの記事一覧
AgentHarmは、AIエージェントの有害行動リスクを読むための安全性評価です。攻撃手順ではなく、拒否境界、権限設計、AGENTS.md改善に翻訳します。
このテーマの読み方
AgentHarmは、AIエージェントの有害行動リスクを読むための安全性評価です。攻撃手順ではなく、拒否境界、権限設計、AGENTS.md改善に翻訳します。
- AIエージェントのベンチマーク完全ガイド:SWE-benchだけでCodexの実力は分からない理由
SWE-bench、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBench、TerminalWorld、OSWorld、AgentHarmを分けて読み、Codexに任せる範囲と人間確認の残し方を整理します。
- AgentHarm・AgentHazardで読むAIエージェントの危険な失敗:ツール権限と禁止事項をどう設計するか
AgentHarm、AgentHazard、GPT-5.6 System Card、OWASP Top 10 for LLM Applicationsから、AIエージェントの危険行動を防ぐ権限設計を整理します。
- GPT-5.6を論文とベンチマークで読む:Codex・AIエージェント・安全性の現在地
GPT-5.6 Sol、max reasoning、ultra modeを、SWE-bench、TerminalWorld、OSWorld、OdysseyBench、PaperBench、Cybench、AgentHarmなどの研究・ベンチマークから読み解き、CodexやAIエージェントに何を任せられるかを整理します。