임베딩 모델은 개념을 어떻게 결합할 수 있을까?
How can embedding models bind concepts?
TL;DR AI
1분핵심 요약
연구진은 비전-언어 임베딩 모델에서 개념 결합이 어떻게 표현되는지, 그리고 객체가 장면으로 어떻게 조합되는지를 분석했다.
CLIP은 분리된 임베딩에서 객체 정보를 복원할 수 있지만, 개념을 구성적으로 결합하는 데는 여전히 한계가 있다.
논문은 CLIP의 결합 함수가 고복잡도라고 설명하며, 이 때문에 모달리티 간 공유 일반화가 제한된다고 본다.
반면 처음부터 학습한 트랜스포머는 더 단순한 곱셈적 결합 함수를 익혔고, 충분한 데이터가 있으면 더 잘 일반화했다.
