See2Think: 멀티모달 모델은 정말 중간 시각 상태를 사용하는가?
See2Think: Do Multimodal Models Really Use Intermediate Visual States?
TL;DR AI
1분핵심 요약
연구진이 1,200개 문제로 구성된 벤치마크와 Visual Action-of-Thought 프로토콜을 결합한 See2Think를 공개했다.
이 프레임워크는 멀티모달 LLM이 스케치, 주석 같은 중간 이미지에 실제로 의존하는지 평가한다.
실험 결과, 모델과 환경에 따라 동작이 크게 달랐고, 특히 시각적 렌더링의 충실도가 핵심 약점으로 드러났다.
손상된 시각 피드백은 정확도를 10점 이상 떨어뜨릴 수 있어, 시각 추론 성능이 중간 시각 상태의 품질에 민감함이 확인됐다.
