대규모 비전 언어 모델의 흉부 X선 추론을 위한 시각적 속성 재고
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
TL;DR AI
1분핵심 요약
연구진은 흉부 X-ray 비전-언어 모델이 실제 이미지 근거에 의존하는지 검증하는 인과 평가 프레임워크를 제안했다.
인과적 증거를 바탕으로 CXR-VQA 예시를 선별하고, 6개 오픈소스 모델에서 11개 속성화 방법을 비교했다.
그 결과 많은 기존 속성화 방법이 임상적 추론과 근거 정합성 측면에서 신뢰하기 어렵다는 점이 드러났다.
이를 개선하기 위해, 임상적으로 의미 있는 영역을 찾아 인과적 영향을 측정하는 개념 기반 방법 MedFocus를 제안했다.
MedFocus는 의료 비전-언어 모델의 설명 품질과 신뢰성을 높였다.
