시각장애인 보조를 위한 VLM-as-a-Judge 평가 벤치마크
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

TL;DR AI
1분핵심 요약
연구진은 시각장애인 지원 3개 시나리오를 아우르는 30만 건 이상의 판단 샘플로 구성된 벤치마크 VIABLE를 공개했다.
7개의 VLM 판정 모델을 평가한 결과, 효과성·공정성·안정성이 전반적으로 낮고 자기 선호와 적대적 공격 취약성이 두드러졌다.
또한 추론 시점 하네스인 VIA-Judge-Agent를 제안해 판정 성능과 후속 지원 응답 품질을 개선했다.
이번 결과는 민감한 접근성 영역에서 현재의 비전-언어 모델 판정기가 충분히 신뢰할 수 없음을 보여준다.
