언어 바꾸기English
이전 목록

평면 조립 벤치: 가구 조립을 통한 대규모 비전-언어 모델의 시공간 이해 평가

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

TL;DR AI

핵심 요약

1분
  1. 연구진은 가구 조립 영상에서 미세한 시공간 추론을 평가하는 벤치마크 Flat-Pack Bench를 공개했다.

  2. 이 벤치마크는 객관식 문항과 시각 프롬프트로 시간 순서, 상태 위치, 부품 결합, 추적 능력을 테스트한다.

  3. 실험 결과, 최신 대형 비전-언어 모델들도 이런 세부 영상 이해 과제에서 여전히 낮은 성능을 보였다.

  4. 이 벤치마크는 조립·요리 같은 실제 작업에 필요한 LVLM의 한계를 드러낸다.

원문 보기