MM-JudgeBias: MLLM-as-a-Judge의 구성적 편향을 평가하기 위한 벤치마크
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
TL;DR AI
1분핵심 요약
연구진이 멀티모달 AI 심사 모델의 ‘조합적 편향’ 개념을 정의하고, 이를 측정하는 벤치마크 MM-JudgeBias를 공개했다.
MM-JudgeBias는 질문·이미지·응답에 대해 누락, 불일치, 무관한 단서를 넣는 통제된 변형으로 모델의 반응을 시험한다.
26개 멀티모달 모델을 평가한 결과, 많은 모델이 특정 모달리티를 무시하거나 체계적인 편향을 보이며 신뢰성 문제가 드러났다.
이 벤치마크는 멀티모달 AI 심사 시스템의 편향을 정량화하고 개선하는 데 필요한 기준을 제공한다.
