AI競争で遅れると安全を捨てるのか、理想化された行動実験

安全・不安全開発を反復選択する実験で、事前登録したリスク水準効果は支持されなかった。探索分析では相手の行動と劣勢状態が不安全選択に関連した。

実験設計

7月28日の Falling Behind Drives Unsafe Development は、2人が不確実な終了まで安全・不安全なAI開発を選ぶ理想化競争を調べました。不安全は速い進展と即時報酬を与える一方、個人リスクを蓄積し、最大値を10%・60%・90%に変えました。

事前仮説と探索結果

事前登録したリスク水準差と個人のリスク選好は支持されませんでした。探索分析では、相手が不安全を選んだ後に増え、優勢では減り、劣勢では増えました。第1ラウンドも後の行動を予測しました。

著者は4戦略の縮約進化モデルで解釈し、不安全行動は固定的な性向だけでなく初期の勢い、相手、遅れる恐れから生じ得ると主張します。

政策的意味

安全宣言だけでなく、共通評価・監査、事故共有、段階導入、協力により安全投資の競争上の不利を減らす必要があります。先行組織の初期行動と透明性も期待を形成します。

限界

査読前の理想化実験で企業・国家を直接再現しません。中心的関係は事前登録検定でなく探索分析のため、確定的因果証拠ではありません。現場データと追試が必要です。

原文