언어 바꾸기English
이전 목록

보는 것이 아는 것은 아니다: VLM은 언제 공간 질문에 답하지 말아야 하는지(그리고 왜인지) 알고 있는가?

Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?

TL;DR AI

핵심 요약

1분
  1. 연구진은 공간 추론에서 비전-언어 모델의 불확실성 대응을 평가하는 벤치마크 SpatialUncertain를 공개했다.

  2. 최신 오픈소스 및 클로즈드소스 모델들은 가림과 시점 모호성이 있는 조건에서 정확도가 크게 떨어졌다.

  3. 모델들은 근거가 부족할 때도 답변을 회피하지 못했고, 도움이 될 추가 시점을 잘 고르지 못했다.

  4. 이번 결과는 비전-언어 모델이 공간 문제에서 확신에 차서 틀릴 수 있으며 실제 활용에 안전성 우려가 있음을 보여준다.

원문 보기