MODUS: 다양한 모달리티를 위한 디코더 전용 Any-to-Any 모델링
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
TL;DR AI
1분핵심 요약
연구진은 다양한 모달리티를 하나의 네트워크에서 다루는 디코더 전용 any-to-any 멀티모달 모델 Modus를 소개했다.
이 구조는 모달리티를 대칭적으로 처리하며, 모달리티별 헤드와 별도 작업 파이프라인을 없앴다.
Modus는 여러 멀티모달 벤치마크에서 강력한 성능을 보이며, 교차 모달 생성과 자기 검증도 지원한다.
강력한 디코더 전용 사전학습을 재활용해 멀티모달 학습을 더 단순하게 만든 점이 핵심이다.
