AgentDoG 1.5:オープンソースの AI Agent セキュリティ診断・ガードレールフレームワーク

·Toolin 編集部

上海AI実験室がオープンソース公開した軽量 Agent セキュリティツール。3 次元診断で実行軌跡のリスクを分析し、オンラインガードレールとしてのデプロイをサポート

AgentDoG 1.5:オープンソースの AI Agent セキュリティ診断・ガードレールフレームワーク

AI Agent が「質問に答える」から「ツール呼び出し、コマンド実行、システム操作」へと進化すると、セキュリティ問題はもはやコンテンツ審査だけでは済みません。上海人工知能実験室がリリースした AgentDoG 1.5 はオープンソースの Agent セキュリティ診断フレームワークで、完全な実行軌跡の分析、リスク発生源の特定、オンラインガードレールのデプロイが可能です。Agent プラットフォーム開発者、セキュリティエンジニア、AI インフラチームに適しています。

AgentDoG 1.5 とは

AgentDoG 1.5 は上海人工知能実験室がオープンソース公開した AI Agent セキュリティ診断・オンラインガードレールフレームワークです。核心の考え方は:最終出力を見ず、完全な実行軌跡を見る。

Agent は最終応答では正常に見えても、その前に誤ったツール呼び出しを行い、情報を漏洩し、危険なコマンドを実行しているかもしれません。AgentDoG 1.5 は完全な agent trajectory(ユーザーリクエスト、中間応答、ツール呼び出し、環境フィードバック、最終応答)を分析してセキュリティ判断を行います。

AgentDoG 1.5 フレームワークアーキテクチャ

核心機能

3 次元セキュリティ診断

AgentDoG 1.5 は safe / unsafe の判定だけでなく、3 つの次元の細粒度な診断を出力します:

  • Risk Source:リスクがどこから来るのか(ツール説明?環境フィードバック?記憶インジェクション?)
  • Failure Mode:Agent がどのように失敗したのか(誤ったツール呼び出し?承認バイパス?目標逸脱?)
  • Real-world Harm:どのような現実への危害をもたらすのか(データ漏洩?ファイル破損?システム侵入?)

拡張可能な分類体系

Agent プラットフォームごとに直面するリスクはまったく異なります。AgentDoG 1.5 は 3 つの高次元を保ったまま、シーンごとに具体的カテゴリを拡張します:

Agent のシーンごとの拡張可能な分類体系

例えば:

  • OpenClaw シーン:持続セッションリスク、承認バイパス、プラグインサプライチェーン攻撃、クロスツール攻撃チェーン
  • Codex シーン:リポジトリファイルインジェクション、依存関係サプライチェーン、危険な shell 実行、破壊的なワークスペース変更

ATBench Family ベンチマーク

論文では同一フレームワークを共有する 3 つのベンチマークを構築しています:

  • ATBench:汎用 tool-use agent
  • ATBench-Claw:OpenClaw クロスアプリ実行シーン
  • ATBench-Codex:Codex コード実行シーン

オンラインガードレール(Online Guardrail)

AgentDoG 1.5 は Pre-Reply 介入機構としてデプロイできます:Agent の最終応答がユーザーに送信される前に、完全な実行軌跡を読み取り、通すかどうかを判断します。

この設計は最終応答前の 1 回だけ検査を行うもので、毎回のツール呼び出し後に検査を挿入することを避け、レイテンシを低減します。

性能データ

AgentDoG 1.5 はわずか約 1,000 件の高品質サンプルで軽量モデル(0.8B / 2B / 4B / 8B)を訓練しただけで、効果は十分実用的です:

指標AgentDoG 1.5-4B
R-Judge Accuracy92.2%
R-Judge F192.7%
ATBench Accuracy72.4%
ATBench F174.3%

オンラインガードレールの効果

OpenClaw のオンライン評価では:

シーンガードレール前 ASRガードレール後 ASR
ClawSafety56.25%18.75%
AgentHarm (Prompt Intelligence Theft)41.92%26.92%
CIK-Bench (retained)94.29%42.86%

オンラインガードレール評価結果

安全訓練パイプライン

AgentDoG 1.5 は評価モデルであるだけでなく、Agent の訓練フローにも接続できます:

  • SFT 段階:高品質な安全軌跡をフィルタリングし、AgentHarm harm score を 57.49% から 20.32% まで低下
  • RL 段階:軽量な Python simulator 環境を構築し、10,000 件の並列環境をサポート。ピークメモリは 2.5GB 未満

リソースリンク

コード、モデル、データはすべてオープンソース化されています。

活用シーン

  • Agent プラットフォームセキュリティチーム:オンラインガードレールとしてデプロイし、Agent の危険な挙動を阻止
  • Agent 開発者:開発段階で AgentDoG を使って Agent の安全性を評価
  • AI セキュリティ研究者:ATBench Family で新しい Agent セキュリティ手法を構築・評価
  • 企業 IT セキュリティ:社内 Agent デプロイ前のセキュリティ監査とリスク評価

関連記事

星塵智能T1:8.99万人民元の人型ロボットが発売開始
AI製品

星塵智能T1:8.99万人民元の人型ロボットが発売開始

星塵智能(Astribot)が人型ロボットT1を発表。8.99万人民元から。ワイヤ駆動本体+自社開発AIモデル+身体性OSの三位一体アーキテクチャで、6月1日から出荷開始します。

Toolin 編集部
Volcano Engine AI Trust:3層アーキテクチャで Agent のセキュリティを守る
AI製品

Volcano Engine AI Trust:3層アーキテクチャで Agent のセキュリティを守る

Volcano Engine が AI Trust セキュリティ製品体系を発表。モデルの信頼性、エージェントの制御、インテリジェントなセキュリティ運用をカバーし、1日の検知呼び出し量は100億回に達します。

Toolin 編集部
Xiaomi MiMo API が恒久的に最大99%値下げ、開発者はどう恩恵を受けるか
AI製品

Xiaomi MiMo API が恒久的に最大99%値下げ、開発者はどう恩恵を受けるか

Xiaomi の MiMo-V2.5 シリーズ API が最大99%値下げ。Token Plan プランの容量は5-8倍に増量され、DeepSeek の価格に全面対抗します。

Toolin 編集部
Darwin Skill 2.0:AI スキルを自己進化させる
AI製品

Darwin Skill 2.0:AI スキルを自己進化させる

darwin-skill 2.0 はオープンソースの Skill/Prompt 自動最適化ツール。Microsoft の2本の論文のエッセンスを吸収し、複数評価者による独立レビュー + 人的ゲート機構で、AI スキル文書を80点から90点以上へ引き上げます。

Toolin 編集部
オープンソースの画像テキストカード Skill:「AI 感のある添え画像」にさよなら
AI製品

オープンソースの画像テキストカード Skill:「AI 感のある添え画像」にさよなら

guizang-social-card-skill はオープンソースの AI 画像テキストカード生成ツール。11種類のコンテンツカテゴリ適応、雑誌級の組版エンジン、無料商用画像素材ライブラリを内蔵し、RedNote レベルの添え画像をワンクリックで生成します。

Toolin 編集部
Hy-Memory:AI Agent に超強力な記憶力を搭載する
AI製品

Hy-Memory:AI Agent に超強力な記憶力を搭載する

Hy-Memory は Tencent が発表した OpenClaw 用メモリプラグイン。6層の記憶フレームワーク、System1/System2 デュアルシステム、進化チェーンの3層アーキテクチャで、Agent があなたの偏好、決定、履歴を本当に記憶できるようにし、記憶フラグメントを70%以上削減します。

Toolin 編集部