#AI開発運用
AI開発運用に関する記事一覧です。関連する記事をまとめて探せます。
- AIエージェント開発で10万円溶かす前に読む、API課金・権限・知らないrepoの地雷回避ガイド
Codex、Claude Code、GitHub Copilot、MCP、AI APIを使う前に確認したいAPI課金事故、権限設定、知らないGitHubリポジトリ実行、APIキー、push・deployの注意点を初心者向けに整理します。
- AIエージェントのベンチマーク完全ガイド:SWE-benchだけでCodexの実力は分からない理由
SWE-bench、Dialogue SWE-Bench、SWE-Skills-Bench、MarketBench、TerminalWorld、OSWorld、AgentHarmを分けて読み、Codexに任せる範囲と人間確認の残し方を整理します。
- SWE-bench・SWE-rebench・SWE-bench-Live・SWE-MERAの違い:AIコーディング評価はなぜ更新され続けるのか
SWE-bench系ベンチマークが増え続ける理由を、汚染、古いissue、弱いテスト、多言語化、live-updatable評価の観点から整理します。
- TerminalWorld・Terminal-Benchで読むAIターミナルエージェントの限界:CodexにCLI作業を任せる前に見ること
TerminalWorld、Terminal-Bench、terminal-agent task guidelineから、Codexにbuild/checkやログ読解を任せる前の安全手順を整理します。
- AIは論文を再現できるのか?PaperBenchから見るCodexで研究実装を頼む時の限界
PaperBenchを入口に、AIへ論文実装や研究再現を頼む時の分解手順、失敗しやすい箇所、人間が確認すべき評価指標を整理します。
- 自分のリポジトリでCodexを評価する方法:小さなベンチマークタスクの作り方
公開ベンチマークだけでCodexを判断せず、自分のrepoで小さく安全に評価するためのタスク設計、成功条件、失敗条件、完了報告レビューを整理します。
- AIベンチマークの汚染とは?SWE-bench-Live・SWE-MERAからスコアを信じすぎない読み方
ベンチマーク汚染、公開タスクの古さ、弱いテスト、live-updatable benchmarkの意味を、SWE-rebench、SWE-bench-Live、SWE-MERAから整理します。
- Dialogue SWE-Benchとは?対話型コーディングエージェント評価が重要な理由
Dialogue SWE-Benchを、CodexやClaude Codeで確認質問、方針相談、レビュー差し戻しを含めて使うための評価軸として整理します。
- Agent Skillsは本当に効く?SWE-Skills-Benchから見るスキル注入の限界
SWE-Skills-Benchをもとに、AGENTS.md、Claude Code Skills、手順書を増やす時の効果測定、token overhead、version mismatchのリスクを整理します。
- AIエージェントの自己評価はどこまで信用できる?MarketBenchで見る成功確率とtoken見積もりのズレ
MarketBenchをもとに、AIエージェントの成功確率、token usage、完了見込みの自己申告をログ・テスト・差分で補正する運用を整理します。
- ChatGPT WorkとCodexの違い・使い分け|調査・サイト運営・コード修正はどちらに頼む?
ChatGPT WorkとCodexの違いを、調査、資料作成、個人サイト運営、GitHub、コード修正、build、sitemap、pushの具体例で比較。どちらへ依頼すべきか、初心者向けの判断表と安全な併用手順を紹介します。
- Claude Code CLI自動化の使い方|-p・JSON出力・max-turns・Windows・MCPの安全設計
Claude Code CLIを非対話で自動化する方法を、-p/--print、JSON・stream-json出力、max-turns、Windows Native・WSL、MCP接続の確認順に整理します。
- Claude Code Pluginsの使い方|marketplace・scope・MCP・Skillsを安全に管理
Claude Code Pluginsの使い方を、marketplaceの追加とinstall、user・project・local scope、Skills・Hooks・MCP・LSP、--plugin-dir、reload、更新、削除の順に整理します。
- Codex PluginsとSkillsの違い|MCP・コネクタ・Hooksを安全に使い分ける
Codex PluginsとSkillsの違いを、OpenAI Docsの現行Pluginsページに沿って整理。Skills、Connectors、MCP servers、Hooks、利用面、Codex CLIの導入前チェックを解説します。
- CodexのMCP設定ガイド|config.toml・CLI・Desktop・IDEを安全に分ける
CodexのMCP設定を、config.toml、CLI、ChatGPT desktop app、IDE extension、project scope、tool allow/deny、approval mode、OAuth loginから整理します。
- MCP 2026-07-28仕様の変更点|ステートレス化・Tasks・認証・移行ガイド
正式公開されたMCP 2026-07-28仕様の変更点を、stateless core、server/discover、MRTR、Tasks、MCP Apps、認証強化、deprecation policyから整理します。2025-11-25系から移行する前に、SDK・クライアント・接続先の対応範囲を確認できます。
- Claude Code約40万セッション研究で分かったこと|専門知識・成功率・仕事の変化
AnthropicのClaude Code利用研究を、約40万セッション規模の対象、2025年10月から2026年4月の仕事モード、planningとexecutionの分業、domain expertiseとverified success、分析方法と限界に分けて解説します。企業公式の観察研究を、個人開発者のタスク設計へ翻訳します。
- GitHub CopilotはどこまでAIエージェント化した?App・Cloud Agent・MCP・Plugins・BYOKを整理
2026年8月のGitHub Copilot公式Changelogをもとに、Agent Plugins、MCP allowlist、cloud agentの推論レベル、コメント自動化、code review effort、BYOK、2026年9月のモデル変更を、個人開発者と組織の委任・監視・レビューに分けて整理します。
- MCP OAuth認証のCIMD・DCR移行ガイド|iss・scope・resource・PKCEの確認順
MCP 2026-07-28のOAuth認証を、CIMD・DCR・Protected Resource Metadata・iss・resource・scope・PKCEに分けて整理。HTTPとstdioの違い、401/403の切り分け、移行前チェックを解説します。
- MCP Client Credentialsとは?CI/CD・常駐処理で使うOAuth拡張の安全設計
MCPのOAuth Client Credentials extensionを、ユーザー不在のCI/CD・background service・server-to-server向けに整理。JWT assertionとclient secret、scope、token refresh、対応状況の確認順を解説します。
- MCP EMAとは?Enterprise-Managed AuthorizationのIdP・SSO・ID-JAG設計
MCPのEnterprise-Managed Authorization(EMA)を、IdP・SSO・ID-JAG・組織ポリシー・中央失効の順に整理。通常OAuthやClient Credentialsとの違い、client・server・管理者の確認点を解説します。
- MCP Tasksとは?tasks/get・update・cancelと旧API移行の確認順
MCP Tasks extensionを、長時間処理、durable task handle、tasks/get・tasks/update・tasks/cancel、input_required、旧experimental APIからの移行、安全なTask ID管理まで整理します。
- MCP Appsとは?ui://・sandbox iframe・postMessageの安全設計
MCP AppsのUI resource、ui://、sandbox iframe、postMessage、CSP、permissions、host consent、client supportを、通常のMCP toolやWebアプリとの違いから整理します。
- AI開発用バックアップSSDの選び方|Codex・Claude Codeに作業を任せる前の安全装置
CodexやClaude Codeに大きめの修正を任せる前に、gitだけでは守れない未追跡ファイル、uploadフォルダ、画像素材、ローカル設定を外付けSSDへ退避する考え方を整理します。