언어 바꾸기English
이전 목록

See What I Mean: 비디오 세분화 객체 이해를 위한 비전과 언어 표현 정렬

See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

TL;DR AI

핵심 요약

1분
  1. 연구진은 세밀한 비디오 객체 이해를 위한 학습 전략 SWIM을 제안했다.

  2. SWIM은 마스크 감독과 NL-Refer 데이터셋을 활용해 언어와 대상 객체의 정렬을 개선한다.

  3. 이 방법은 교차모달 어텐션의 불일치를 바로잡아 텍스트만으로 객체를 더 잘 찾게 한다.

  4. 그 결과 추론 시 명시적 시각 프롬프트 의존도를 낮추고 언어 기반 객체 식별 성능을 높인다.

원문 보기