평면 조립 벤치: 가구 조립을 통한 대규모 비전-언어 모델의 시공간 이해 평가
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
TL;DR AI
1분핵심 요약
연구진은 가구 조립 영상에서 미세한 시공간 추론을 평가하는 벤치마크 Flat-Pack Bench를 공개했다.
이 벤치마크는 객관식 문항과 시각 프롬프트로 시간 순서, 상태 위치, 부품 결합, 추적 능력을 테스트한다.
실험 결과, 최신 대형 비전-언어 모델들도 이런 세부 영상 이해 과제에서 여전히 낮은 성능을 보였다.
이 벤치마크는 조립·요리 같은 실제 작업에 필요한 LVLM의 한계를 드러낸다.
