VISAFF: 대화 내 감정 인식을 위한 화자 중심 시각 정서 특징 학습
VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

TL;DR AI
1분핵심 요약
연구진은 대화 내 화자 중심 감정 인식을 위한 2단계, 튜닝 프리 프레임워크 VISAFF를 제안했다.
이 방법은 고정된 비전-언어 모델이 현재 화자의 시각적 정서 단서에 집중하도록 유도하고, 시각 정보가 불확실할 때는 텍스트와 오디오를 보완적으로 활용한다.
신뢰도 기반 보완 기법을 통해 모호한 시각 정보에 대한 의존을 줄이고 멀티모달 이해를 높인다.
두 개 데이터셋에서 강한 성능을 보이며, 비용이 큰 파인튜닝을 대체할 수 있는 효율적인 접근임을 보여줬다.
