モデル外の安全層を学習
SHEはエージェント安全を重みだけでなく、文脈、メモリ、ツール、権限を管理するharnessの問題とします。System Prompt、Rule Bank、Safety Memory、Tool Policyに責任を分け、失敗軌跡から該当部分を更新します。
著者はAgent‑SafetyBenchで静的SafeHarnessより攻撃成功率を3.1倍低減し、正常作業効用も改善したと報告します。別のAgentHarmリスクと他モデルへの転移も示したとします。
実装と限界
事故を一つの長い指示へ足す代わりに、規則違反、再発記憶、危険ツール方針を分離できます。ただし査読前のベンチマーク研究です。運用で自動更新すると過剰遮断や新しい迂回を生むため、版管理、人承認、回帰試験、即時ロールバックが必要です。