실험 설계
7월 28일 프리프린트 Falling Behind Drives Unsafe Development는 두 참가자가 불확실한 종료 시점까지 안전 또는 불안전 AI 개발을 반복 선택하는 이상화된 경쟁 실험을 분석했습니다. 불안전 선택은 즉각적인 진전과 보상을 주지만 개인 위험을 누적했고, 최대 위험을 10%·60%·90%로 바꿨습니다.
사전 가설과 탐색 결과
사전 등록한 위험 수준 간 비교와 개인 위험 선호 효과는 데이터에서 지지되지 않았습니다. 대신 반복 구조를 본 탐색 분석에서는 상대가 불안전하게 행동한 다음 같은 선택이 늘고, 앞서면 줄며, 뒤처지면 증가했습니다. 첫 라운드 선택도 이후 행동을 예측했습니다.
연구진은 항상 안전, 항상 불안전, 조건부 안전 등 네 전략의 축약 진화 모델로 이런 경쟁 동학을 해석했습니다. 핵심 주장은 안전하지 않은 선택이 개인의 고정 성향뿐 아니라 초기 분위기, 상대 행동과 뒤처질 두려움에서 생길 수 있다는 것입니다.
정책적 의미
안전 원칙 서약만으로 충분하지 않을 수 있습니다. 경쟁자가 안전 투자를 해도 손해 보지 않는 공통 평가·감사 기준, 사고 공유, 단계적 출시와 국제 협력이 필요하다는 방향을 뒷받침합니다. 선두 기업의 초기 행동과 투명성도 후속 행위자의 기대를 만들 수 있습니다.
중요한 한계
이는 동료평가 전의 이상화된 실험이며 실제 기업·국가 경쟁을 그대로 재현하지 않습니다. 특히 주요 관계는 사전 등록 가설이 아니라 탐색 분석에서 나왔으므로 인과적 정책 결론으로 단정하면 안 됩니다. 현장 데이터와 반복 연구가 필요합니다.