SceneActBench、3Dシーンで視覚エージェントの行動判断を評価

3Dシーンを見て適切な行動を選べるかを測るSceneActBenchで、11種類の商用VLM構成は38.6〜50.2点だった。

ベンチマークの目的

SceneActBenchは画像を説明できるかではなく、3Dシーンの視覚情報から適切な行動を選べるかを評価します。映像ベースのエージェント、ロボティクス、インタラクティブなワールドモデルに必要な能力です。

構成と結果

  • 210の元シーンから520件の評価ケースを作成しています。
  • 5種類のタスクで物体・空間の理解と行動可能性を同時に確認します。
  • 研究チームが評価した11種類の商用VLM構成は38.6〜50.2点で、全タスクに一貫して強い構成はありませんでした。

重要性

美しい映像を説明する能力と、シーン内で安全かつ実行可能な行動を選ぶ能力は異なります。生成映像やワールドモデルを実働エージェントへ広げるには、時間・空間文脈と行動を結び付ける必要があります。

限界

スコアはこのベンチマークと採点手順に限定され、実機ロボットの成功率を直接測ったものではありません。また論文は査読前のプレプリントです。

公式情報