SceneActBench, 3D 장면에서 AI 에이전트의 행동 판단을 시험

3D 장면의 이미지와 프레임을 보고 에이전트가 올바른 행동을 선택하는지 평가하는 SceneActBench에서 11개 상용 VLM 구성의 점수가 38.6~50.2에 머물렀다.

어떤 벤치마크인가

SceneActBench는 텍스트 지시만 이해하는 능력이 아니라, 3D 장면의 시각 정보에 맞춰 어떤 행동을 해야 하는지를 평가합니다. 영상·프레임 기반 에이전트와 로봇, 인터랙티브 월드 모델에 필요한 장면-행동 연결 능력에 초점을 둡니다.

평가 구성과 결과

  • 210개의 원본 장면에서 520개 평가 사례를 구성했습니다.
  • 다섯 종류의 과제로 물체·공간 관계와 가능한 행동을 함께 시험합니다.
  • 연구진이 평가한 11개 상용 VLM 구성은 38.6점에서 50.2점 사이였으며, 모든 과제에서 일관되게 강한 구성은 없었습니다.

왜 중요한가

고품질 영상을 설명하는 것과 장면 속에서 안전하고 가능한 행동을 고르는 것은 다른 문제입니다. 생성형 영상과 월드 모델이 실제 에이전트로 확장되려면 시간적·공간적 맥락과 행동 가능성을 함께 이해해야 합니다.

확인할 한계

점수는 이 벤치마크의 사례와 채점 방식에 한정됩니다. 실제 로봇 환경의 물리적 성공률을 직접 측정한 결과가 아니며, 논문은 아직 동료 평가 전 사전 공개본입니다.

공식 출처