AI 에이전트 안전장치도 업데이트돼야 한다: 실패 궤적으로 진화하는 SHE

SHE는 에이전트 실행 실패를 진단해 시스템 프롬프트·규칙·안전 메모리·도구 정책을 부분별로 갱신하는 프레임워크다.

모델 밖의 안전장치를 학습하다

SHE(Safety Harness Evolution)는 에이전트 안전을 모델 가중치만이 아니라 문맥, 메모리, 도구와 권한을 관리하는 harness의 문제로 봅니다. 시스템 프롬프트, Rule Bank, Safety Memory, Tool Policy의 네 구성요소로 책임을 나누고, 실패한 실행 궤적을 구조화된 진단으로 바꿔 해당 요소만 갱신합니다.

저자들은 Agent‑SafetyBench에서 정적 SafeHarness보다 공격 성공률(ASR)을 3.1배 낮추면서 정상 작업 효용도 개선했다고 보고합니다. 진화한 harness가 별도 AgentHarm 위험과 다른 에이전트 모델에도 추가 진화 없이 일부 일반화됐다고 설명합니다.

개발팀에 주는 아이디어

모든 사고를 더 긴 시스템 프롬프트 하나로 막기보다, 어떤 계층이 실패했는지 분리할 수 있습니다. 금지 규칙 위반은 Rule Bank, 과거 사고 재발은 Safety Memory, 위험 도구 호출은 Tool Policy에서 다루고 변경 전후에 안전성과 정상 성공률을 함께 검사하는 방식입니다.

연구의 경계

벤치마크 환경의 동료평가 전 연구이며 3.1배는 저자 설정의 상대적 ASR 감소입니다. 실제 서비스에서 자동으로 안전 규칙을 변경하면 과잉 차단, 규칙 충돌과 새 우회가 생길 수 있습니다. 운영 반영에는 버전 관리, 사람 승인, 회귀 테스트와 즉시 롤백이 필요합니다.

원문