SceneActBench: 에이전트는 자신이 보는 3D 장면에서 행동할 수 있는가?
SceneActBench: Can Agents Act on the 3D Scenes They See?
TL;DR AI
1분핵심 요약
SceneActBench는 완전한 3D 장면에서 비전-언어 에이전트의 행동 능력을 평가하는 새 벤치마크다.
이미지·비디오 프레임과 일부 3D 자산을 활용해, 고정된 루프에서 5가지 시각 조건형 3D 과제를 테스트한다.
은닉된 정답과 기하학적 지표로 최종 행동을 채점하며, 210개 원본 사례에서 520개 과제 케이스를 포함한다.
평가 결과, 11개의 상용 VLM은 과제별 성능 편차가 커서 복합 3D 장면에서의 실제 행동 능력이 고르지 않았다.
