AgentDoG 1.5:オープンソースの AI Agent セキュリティ診断・ガードレールフレームワーク
上海AI実験室がオープンソース公開した軽量 Agent セキュリティツール。3 次元診断で実行軌跡のリスクを分析し、オンラインガードレールとしてのデプロイをサポート


AgentDoG 1.5:オープンソースの AI Agent セキュリティ診断・ガードレールフレームワーク
上海AI実験室がオープンソース公開した軽量 Agent セキュリティツール。3 次元診断で実行軌跡のリスクを分析し、オンラインガードレールとしてのデプロイをサポート
AI Agent が「質問に答える」から「ツール呼び出し、コマンド実行、システム操作」へと進化すると、セキュリティ問題はもはやコンテンツ審査だけでは済みません。上海人工知能実験室がリリースした AgentDoG 1.5 はオープンソースの Agent セキュリティ診断フレームワークで、完全な実行軌跡の分析、リスク発生源の特定、オンラインガードレールのデプロイが可能です。Agent プラットフォーム開発者、セキュリティエンジニア、AI インフラチームに適しています。
AgentDoG 1.5 とは
AgentDoG 1.5 は上海人工知能実験室がオープンソース公開した AI Agent セキュリティ診断・オンラインガードレールフレームワークです。核心の考え方は:最終出力を見ず、完全な実行軌跡を見る。
Agent は最終応答では正常に見えても、その前に誤ったツール呼び出しを行い、情報を漏洩し、危険なコマンドを実行しているかもしれません。AgentDoG 1.5 は完全な agent trajectory(ユーザーリクエスト、中間応答、ツール呼び出し、環境フィードバック、最終応答)を分析してセキュリティ判断を行います。

核心機能
3 次元セキュリティ診断
AgentDoG 1.5 は safe / unsafe の判定だけでなく、3 つの次元の細粒度な診断を出力します:
- Risk Source:リスクがどこから来るのか(ツール説明?環境フィードバック?記憶インジェクション?)
- Failure Mode:Agent がどのように失敗したのか(誤ったツール呼び出し?承認バイパス?目標逸脱?)
- Real-world Harm:どのような現実への危害をもたらすのか(データ漏洩?ファイル破損?システム侵入?)
拡張可能な分類体系
Agent プラットフォームごとに直面するリスクはまったく異なります。AgentDoG 1.5 は 3 つの高次元を保ったまま、シーンごとに具体的カテゴリを拡張します:

例えば:
- OpenClaw シーン:持続セッションリスク、承認バイパス、プラグインサプライチェーン攻撃、クロスツール攻撃チェーン
- Codex シーン:リポジトリファイルインジェクション、依存関係サプライチェーン、危険な shell 実行、破壊的なワークスペース変更
ATBench Family ベンチマーク
論文では同一フレームワークを共有する 3 つのベンチマークを構築しています:
- ATBench:汎用 tool-use agent
- ATBench-Claw:OpenClaw クロスアプリ実行シーン
- ATBench-Codex:Codex コード実行シーン
オンラインガードレール(Online Guardrail)
AgentDoG 1.5 は Pre-Reply 介入機構としてデプロイできます:Agent の最終応答がユーザーに送信される前に、完全な実行軌跡を読み取り、通すかどうかを判断します。
この設計は最終応答前の 1 回だけ検査を行うもので、毎回のツール呼び出し後に検査を挿入することを避け、レイテンシを低減します。
性能データ
AgentDoG 1.5 はわずか約 1,000 件の高品質サンプルで軽量モデル(0.8B / 2B / 4B / 8B)を訓練しただけで、効果は十分実用的です:
| 指標 | AgentDoG 1.5-4B |
|---|---|
| R-Judge Accuracy | 92.2% |
| R-Judge F1 | 92.7% |
| ATBench Accuracy | 72.4% |
| ATBench F1 | 74.3% |
オンラインガードレールの効果
OpenClaw のオンライン評価では:
| シーン | ガードレール前 ASR | ガードレール後 ASR |
|---|---|---|
| ClawSafety | 56.25% | 18.75% |
| AgentHarm (Prompt Intelligence Theft) | 41.92% | 26.92% |
| CIK-Bench (retained) | 94.29% | 42.86% |

安全訓練パイプライン
AgentDoG 1.5 は評価モデルであるだけでなく、Agent の訓練フローにも接続できます:
- SFT 段階:高品質な安全軌跡をフィルタリングし、AgentHarm harm score を 57.49% から 20.32% まで低下
- RL 段階:軽量な Python simulator 環境を構築し、10,000 件の並列環境をサポート。ピークメモリは 2.5GB 未満
リソースリンク
- 論文: https://arxiv.org/abs/2605.29801
- GitHub: https://github.com/AI45Lab/AgentDoG
- Hugging Face: https://huggingface.co/collections/AI45Research/agentdog15
コード、モデル、データはすべてオープンソース化されています。
活用シーン
- Agent プラットフォームセキュリティチーム:オンラインガードレールとしてデプロイし、Agent の危険な挙動を阻止
- Agent 開発者:開発段階で AgentDoG を使って Agent の安全性を評価
- AI セキュリティ研究者:ATBench Family で新しい Agent セキュリティ手法を構築・評価
- 企業 IT セキュリティ:社内 Agent デプロイ前のセキュリティ監査とリスク評価
関連記事

星塵智能T1:8.99万人民元の人型ロボットが発売開始
星塵智能(Astribot)が人型ロボットT1を発表。8.99万人民元から。ワイヤ駆動本体+自社開発AIモデル+身体性OSの三位一体アーキテクチャで、6月1日から出荷開始します。

Volcano Engine AI Trust:3層アーキテクチャで Agent のセキュリティを守る
Volcano Engine が AI Trust セキュリティ製品体系を発表。モデルの信頼性、エージェントの制御、インテリジェントなセキュリティ運用をカバーし、1日の検知呼び出し量は100億回に達します。

Xiaomi MiMo API が恒久的に最大99%値下げ、開発者はどう恩恵を受けるか
Xiaomi の MiMo-V2.5 シリーズ API が最大99%値下げ。Token Plan プランの容量は5-8倍に増量され、DeepSeek の価格に全面対抗します。

Darwin Skill 2.0:AI スキルを自己進化させる
darwin-skill 2.0 はオープンソースの Skill/Prompt 自動最適化ツール。Microsoft の2本の論文のエッセンスを吸収し、複数評価者による独立レビュー + 人的ゲート機構で、AI スキル文書を80点から90点以上へ引き上げます。

オープンソースの画像テキストカード Skill:「AI 感のある添え画像」にさよなら
guizang-social-card-skill はオープンソースの AI 画像テキストカード生成ツール。11種類のコンテンツカテゴリ適応、雑誌級の組版エンジン、無料商用画像素材ライブラリを内蔵し、RedNote レベルの添え画像をワンクリックで生成します。

Hy-Memory:AI Agent に超強力な記憶力を搭載する
Hy-Memory は Tencent が発表した OpenClaw 用メモリプラグイン。6層の記憶フレームワーク、System1/System2 デュアルシステム、進化チェーンの3層アーキテクチャで、Agent があなたの偏好、決定、履歴を本当に記憶できるようにし、記憶フラグメントを70%以上削減します。