CaMo: 비전-언어 모델을 위한 카메라 모션 기반 평가 및 학습
CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

TL;DR AI
1분핵심 요약
새 논문은 최상위 비전-언어 모델이 직접적인 공간 질의응답은 잘하지만, 카메라 이동 이해에서는 여전히 약할 수 있음을 보여줍니다.
연구진은 모델이 공간 서술을 생성한 뒤 고정된 프록시 LLM으로 이를 추론하게 하는 Spatial Narrative Score를 제안했습니다.
또한 카메라 모션을 기반으로 학습된 CaMo를 소개했으며, 기존 두 평가 방식에서 더 일관된 성능을 보였습니다.
이번 연구는 기존 공간 벤치마크가 실제 3D 공간 지능을 과대평가할 수 있으며, 더 나은 평가·학습 방법이 필요하다는 점을 시사합니다.
