언어 바꾸기English
이전 목록

잊지 않으면서 올바른 시각적 증거 찾기: 계층 간 시각적 주의 차이를 통한 LVLM 환각 완화

Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy

TL;DR AI

핵심 요약

1분
  1. 연구진은 대형 비전-언어 모델의 환각을 줄이기 위한 학습 불필요한 플러그앤플레이 방식 ILVAD를 제안했다.

  2. 이 방법은 층별 attention을 분석해 반복적으로 활성화되는 시각 토큰을 찾고, 이를 바탕으로 텍스트 생성을 더 견고하게 유도한다.

  3. 시각적 근거를 유지하고 visual forgetting을 줄여, 재학습 없이도 visual grounding을 개선한다.

  4. 여러 LVLM 구조에 적용할 수 있어 모델의 출력 신뢰도를 높이는 데 도움이 된다.

원문 보기