同じAIで得点が3倍? ARC-AGI-3が示した実行環境の影響

OpenAIはreasoning保持とcompactionにより、GPT-5.6 SolのARC-AGI-3公開セット得点が13.3%から38.3%へ上がり、出力トークンが約6分の1になったと報告しました。

何を試したのか

OpenAIは7月29日、未知の2Dゲームから規則を学ぶARC-AGI-3でGPT-5.6 Solの得点が低かった原因を調べました。

標準ハーネスは各行動後に非公開reasoningを捨て、文脈が長くなると古い行動を削除していました。OpenAIはResponses APIでハーネスを作り直し、previous response IDによるreasoning保持とrolling truncationの代わりにcompactionを有効にしました。

発表された結果

公開セットのRHAEは公式ハーネスで13.3%、二つの設定を使うと38.3%となり、出力トークンは約6分の1になったとOpenAIは報告しています。公式プレイログから推定した人間平均は48%でした。

過去の計画と観察を引き継ぎ、毎回ゲームを解釈し直さないことが差につながったという説明です。compactionは序盤の発見や失敗も長く保持しました。

なぜ重要か

ベンチマークはモデルの重みだけでなく、API設定、ツール、文脈管理、ハーネスも測ります。一方だけreasoningを失う条件では順位が大きく変わる可能性があります。

長時間動くエージェントでは状態を単純に削除せず、目標、観察、失敗、判断を圧縮して残し、成功率と総費用を一緒に測る必要があります。

限界

これはOpenAIが自社モデルとAPIで行った事業者実験です。特定の公開セットとハーネスの結果であり、他モデルや業務で同じ倍率を保証しません。比較ではハーネス設定を公開し、共通条件と製品最適条件を分けるべきです。

公式資料