VLM은 정말 보고 있을까, 아니면 말만 하는 걸까? 시각적 재검토의 착시를 밝히다
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

TL;DR AI
1분핵심 요약
연구진은 반성적 프롬프트 이후 비전-언어 모델이 실제로 이미지를 다시 확인하는지 검증하기 위해 VisualSwap과 VS-Bench를 제안했다.
여러 모델에서 이미지를 바꾸자 정확도가 크게 떨어졌고, 특히 추론형 모델이 더 취약했다.
이번 결과는 많은 VLM이 텍스트로는 재검사를 하는 척하지만 실제로는 시각적 정보에 충분히 근거하지 않을 수 있음을 보여준다.
다중 턴 사용자 프롬프트는 시각적 주의를 높였지만, 모델이 스스로 하는 반성은 효과가 약해 이미지 이해 과제의 신뢰성 우려를 키운다.
