GRASP: 다자 비언어 상호작용에서 사회적 추론을 기반으로 한 학습
GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions
TL;DR AI
1분핵심 요약
연구진은 4.6만 개 영상으로 만든 29만 쌍 규모의 GRASP 데이터셋을 공개해, 다자 간 비언어적 상호작용의 사회적 추론을 학습하게 했다.
GRASP는 높은 수준의 사회적 질문을 시선과 지시 제스처 이벤트에 연결해, 누가 누구와 상호작용하는지 추론하도록 돕는다.
또한 grounding을 개선하는 Social Grounding Reward와 성능 평가용 GRASP-Bench도 함께 제안했다.
이 연구는 영상 AI의 핵심 약점인 미세한 사회적 단서를 이해하는 문제를 겨냥해, video QA와 멀티모달 추론 성능 향상을 목표로 한다.
