실패에서 피드백으로: 그룹 수정으로 객체 수준 그라운딩의 난제를 풀다
From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

TL;DR AI
1분핵심 요약
연구진은 대형 비전-언어 모델의 객체 수준 그라운딩을 위한 그룹-리비전 강화학습 방법을 제안했다.
이 방식은 초기 응답을 샘플링한 뒤 수정 후보를 생성하고, 개선 기반 shaping 신호로 보상과 advantage를 정교화한다.
어려운 그라운딩 사례에서 기존 응답 수준 보상의 한계를 보완하며, referring segmentation, reasoning segmentation, REC, counting 벤치마크 전반에서 성능을 높였다.
