iVGR: 강화학습을 활용한 MLLM의 시각적 근거 추론 내재화
iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning
TL;DR AI
1분핵심 요약
연구진은 멀티모달 LLM의 텍스트 추론에 시각적 grounding 능력을 옮기는 강화학습 프레임워크 iVGR을 제안했다.
추론 시 명시적인 객체 박스 요구가 성능을 떨어뜨릴 수 있어, 일관성 보상을 활용한 듀얼 스트림 시스템을 학습했다.
이 방식은 Chain-of-Thought 추론을 시각적으로 grounding된 스트림과 정렬해 세밀한 인식 벤치마크 성능을 높였다.
iVGR은 추론 시 explicit grounding 없이도 멀티모달 이해를 강화하면서 도구 보조 워크플로우는 유지한다.
