보는 비용: 거대 단일 모델 패러다임 안에서 신뢰할 수 있는 멀티모달 추론을 달성하는 방법
The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm
TL;DR AI
1분핵심 요약
연구진은 많은 비전-언어 모델이 이미지와 텍스트를 제대로 결합하지 못하고, 언어적 지름길에 과도하게 의존한다고 지적했다.
논문은 단순한 멀티모달 성능 향상이 아니라 의미적 충분성을 평가하기 위해 Modality Translation Protocol을 제안했다.
Toll, Curse, Fallacy of Seeing 같은 새로운 지표는 모델이 실제로 시각 정보를 활용하는지 측정하도록 설계됐다.
이번 연구는 기존 벤치마크가 시각적 이해를 과대평가할 수 있으며, 향후 모델 설계와 평가 기준을 재검토해야 한다고 시사한다.
