보는 것이 아는 것은 아니다: VLM은 언제 공간 질문에 답하지 말아야 하는지(그리고 왜인지) 알고 있는가?
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
TL;DR AI
1분핵심 요약
연구진은 공간 추론에서 비전-언어 모델의 불확실성 대응을 평가하는 벤치마크 SpatialUncertain를 공개했다.
최신 오픈소스 및 클로즈드소스 모델들은 가림과 시점 모호성이 있는 조건에서 정확도가 크게 떨어졌다.
모델들은 근거가 부족할 때도 답변을 회피하지 못했고, 도움이 될 추가 시점을 잘 고르지 못했다.
이번 결과는 비전-언어 모델이 공간 문제에서 확신에 차서 틀릴 수 있으며 실제 활용에 안전성 우려가 있음을 보여준다.
