TRIAD:AIエージェントに拒否だけでなく危険な計画の修復までできるようにする

·Toolin 編集部

オープンソースのAgent安全フレームワークTRIADは、2値分類のガードレールを3路判断(継続/更新/拒否)に置き換え、プロンプトインジェクション攻撃下でもユーザーの本来タスクを守ります。

TRIAD:AIエージェントに拒否だけでなく危険な計画の修復までできるようにする

Agentがメールを呼び出し、データベースを照会し、コードを実行し、メッセージを送り始めると、安全リスクは「問いに間違って答える」レベルの話ではなくなります。Webページ中の悪意あるテキスト、1通のメールに挟まれた命令が、Agentを本来のタスクから逸らす可能性があります——顧客のメールアドレスを漏らし、無関係な人に会議場所を送り、使うべきでないツールを呼び出すなど。メルボルン大学のチームがオープンソース化したTRIAD(Tripartite Response for Iterative Agent Guardrailing)が示す解は「拒否して終わり」ではなく、ガードレールに危険な計画の修復を学ばせることです。対象は、プロンプトインジェクションに汚染済みだがユーザーの本来目標は依然として妥当というグレーゾーンです。

TRIADプロジェクトカバー

既存のガードレールはどこで詰まるのか

従来のguardrail(ガードレール)モデルは、Agentがツールを実行する前に1回「安全/危険」の2値分類判断を行います。単純明快に見えますが、実際のAgentシーンではしばしば機能しません:

  • 丸ごと通過:攻撃を成功させ、Agentは悪意ある命令どおりに走る
  • 丸ごと拒否:ユーザーの本来正常なタスクも一緒に犠牲になる

実際の攻撃は往々にして「タスク全体が有害」ではなく「正常なタスクに信頼できない命令が混入している」という形です。たとえばAgentに「ホテルを検索してメールを送って」と頼むと、検索結果やメール本文に悪意あるコンテンツが差し込まれます。このとき通してもいけないし、単純に拒否してもいけません。

TRIADとは何か:ガードレールを「審判」から「フィードバック提供者」へ

TRIADの核心の発想は、2値の意思決定を3類へ拡張することです:

  • Proceed(継続):現在の行動計画は安全で、ユーザー目標とも一致している。Agentは通常どおり実行する
  • Refuse(拒否):ユーザーのリクエスト自体が有害、または計画の変更では安全に完了できない場合、直接拒否する
  • Update(更新):最も重要な中間状態——計画はプロンプトインジェクションに汚染されているが、ユーザーの本来目標は依然として妥当

TRIADの3路判断フロー

図1:TRIADのフロー。Agentの各ステップのツール呼び出し前に、Tri-Guardが行動計画を検査し、Proceed/Update/Refuseの3類の判断を下します。汚染されているが修復可能なタスクには自然言語フィードバックが書き戻され、Agentが計画を改めるよう導きます。

Update分岐に入ると、TRIADはタスクを終了せず、Tri-Guardに自然言語フィードバックを生成させ、Agentの一時コンテキストに書き戻します。リスクの出所、タスクの逸脱点、現在のツール呼び出しの問題を明確に指摘し、下流のAgentの再計画を導きます。

これでクローズループが形成されます。Agentが計画を提出→Tri-Guardが検査→更新が必要ならフィードバックをコンテキストに注入→Agentが新計画を再生成→再びTri-Guard検査を通る——実行許可、拒否、または最大更新回数到達まで続きます。

実験データ:攻撃率を下げるだけではない

ASB(直接/間接プロンプトインジェクションを測定)とAgentHarm(有害タスクの拒否と正常タスクの保持を測定)の2つのbenchmarkで、Qwen3-32B、Kimi-2.5、GPT-5.1、Gemini-2.5-Proの4つのAgent backboneをカバーしています:

TRIAD実験結果

表1:TRIADの4類のAgentでの実験結果。無防御のReAct、ToolSafe、TRIAD+TS-Guard、TRIAD+Tri-Guardとの比較。

キーとなる数字:

  • 平均攻撃成功率(ASR)が74.45%から10.42%へ低下
  • 同時に平均正常タスク完了率(TSR)が28.45%から68.60%へ向上

研究チームが特に強調する直感に反する点は、低いASRが良いガードレールを意味しないことです。少なくないbaselineは攻撃成功率を押し下げられますが、その代償は高い拒否率です——「疑わしければ遮断/疑わしければ諦める」方式でリスクを下げ、正常タスクもろとも完了しなくなります。TS-Guardを例にとると、ASB-DPIとASB-IPIでの拒否率は88.80%と94.63%に達し、対応するTSRはわずか1.33%と0.59%で、ほぼユーザータスクを全部放棄するのに等しいのです。

判断分布の変化

図3:訓練前後のguardrail判断分布。Tri-Guardは汚染された行動を直接RefuseではなくUpdateへルーティングする傾向が強い。

応用シーン

TRIADは、Agentを実運用環境に置く必要がありながらプロンプトインジェクションを心配するすべてのチームに適します:

  • 企業オフィスAgent:メール、カレンダー、ドキュメントを処理する際、メール本文やWebページの内容に悪意ある命令が挟まれている可能性
  • データ分析Agent:外部API呼び出しやデータベースの返り値を読む際、結果に汚染が潜んでいる可能性
  • 自動化アシスタント:Web閲覧、チケット提出、CRM操作などの長チェーンタスク
  • Agent安全研究:比較可能なガードレールbaselineになれる。論文、コード、プロジェクトページはすべて公開済み

リソースリンク

筆頭著者のYuhao Sunはメルボルン大学の博士課程学生で、研究分野はTrustworthy AIとAgent Safety。共著者にはメルボルン大学のJiacheng Zhang、清華大学のZhexin Zhangが名を連ね、A/Prof. Xingliang Yuan、Dr. Feng Liu、Dr. Shaanan Cohneyの共同指導を受けています。

一言でまとめ

TRIADはAgentのガードレールを「2値分類の審判」から「フィードバック駆動の計画レギュレーター」へと再定義します——タスクがまだ修復可能かどうかに応じて、継続、計画変更、拒否を選び、すべてのリスクを同じ「拒否」出口へ向かわせることはしません。