Mage-VL: 효율적인 코덱 네이티브 스트리밍 멀티모달 파운데이션 모델
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
TL;DR AI
1분핵심 요약
연구진이 실시간 인지를 위해 설계된 스트리밍 멀티모달 파운데이션 모델 Mage-VL을 공개했다.
듀얼 시스템 구조와 Mage-ViT 토크나이저는 영상에서 움직임이 큰 영역만 선별적으로 인코딩해 시각 토큰 사용량을 75% 이상 줄였다.
대규모 비라벨 이미지·비디오 코퍼스로 처음부터 학습한 이 모델은 정적, 비디오, 공간 추론 과제에서 강력한 기준 모델과 비슷하거나 더 나은 성능을 보였다.
추론 속도는 최대 3.5배 빨라졌다고 보고돼, 라이브 애플리케이션에서 멀티모달 AI의 활용성을 높일 수 있다.
