See What I Mean: 비디오 세분화 객체 이해를 위한 비전과 언어 표현 정렬
See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
TL;DR AI
1분핵심 요약
연구진은 세밀한 비디오 객체 이해를 위한 학습 전략 SWIM을 제안했다.
SWIM은 마스크 감독과 NL-Refer 데이터셋을 활용해 언어와 대상 객체의 정렬을 개선한다.
이 방법은 교차모달 어텐션의 불일치를 바로잡아 텍스트만으로 객체를 더 잘 찾게 한다.
그 결과 추론 시 명시적 시각 프롬프트 의존도를 낮추고 언어 기반 객체 식별 성능을 높인다.
