失敗軌跡からAIエージェント安全装置を進化させるSHE

SHEは失敗実行を診断し、システム指示、規則、安全メモリ、ツール方針を部分別に更新します。

モデル外の安全層を学習

SHEはエージェント安全を重みだけでなく、文脈、メモリ、ツール、権限を管理するharnessの問題とします。System Prompt、Rule Bank、Safety Memory、Tool Policyに責任を分け、失敗軌跡から該当部分を更新します。

著者はAgent‑SafetyBenchで静的SafeHarnessより攻撃成功率を3.1倍低減し、正常作業効用も改善したと報告します。別のAgentHarmリスクと他モデルへの転移も示したとします。

実装と限界

事故を一つの長い指示へ足す代わりに、規則違反、再発記憶、危険ツール方針を分離できます。ただし査読前のベンチマーク研究です。運用で自動更新すると過剰遮断や新しい迂回を生むため、版管理、人承認、回帰試験、即時ロールバックが必要です。

原文