安全はモデルの外側にも必要
ブラウザーやデスクトップを操作するモデルでは、解釈ミスが実アカウントやデータ変更につながります。OpenAIの公式ガイドは、環境を隔離し、アクセス可能なサイトと行動を許可リスト化し、画面・文書・ツール結果を信頼できない入力として扱うよう求めます。
購入、個人情報やファイルの送信、削除など元に戻しにくい行動は直前に利用者が確認します。フォームへの機密情報入力も送信です。手数・時間・費用上限、取消手段を設け、モデルの最終回答ではなく実際の状態を確認する必要があります。
オフアラインメント監視の役割
misalignment monitoringは、機密データの取得・送信や破壊的変更のような重大場面で、エージェントが指示を正しく解釈しているか非同期で確認します。懸念があれば会話を停止したり、安全アラートを生成したりします。
persisted reasoning、WebSocket、OpenAI compactionで文脈を保持するResponses APIでは後続実行を遮断できます。それ以外のResponsesでは通知のみの場合があり、Chat Completionsはこの監視の対象外です。
停止はロールバックではない
非同期監視なので検出前に行動が終わることがあります。停止しても以前の変更は戻らず、一般的な再開方法もありません。フラグは調査信号であり違反確定ではなく、誤検知や見逃しもあり得ます。
送信・決済・削除前の承認、行動ログ、冪等性キー、戻せる設計、事後の状態確認を維持すべきです。Astra時代の安全とは、モデルの性格ではなく行動を狭くし、重大な境界で人が決める構造です。