언어 바꾸기English
이전 목록

Mage-VL: 효율적인 코덱 네이티브 스트리밍 멀티모달 파운데이션 모델

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

TL;DR AI

핵심 요약

1분
  1. 연구진이 실시간 인지를 위해 설계된 스트리밍 멀티모달 파운데이션 모델 Mage-VL을 공개했다.

  2. 듀얼 시스템 구조와 Mage-ViT 토크나이저는 영상에서 움직임이 큰 영역만 선별적으로 인코딩해 시각 토큰 사용량을 75% 이상 줄였다.

  3. 대규모 비라벨 이미지·비디오 코퍼스로 처음부터 학습한 이 모델은 정적, 비디오, 공간 추론 과제에서 강력한 기준 모델과 비슷하거나 더 나은 성능을 보였다.

  4. 추론 속도는 최대 3.5배 빨라졌다고 보고돼, 라이브 애플리케이션에서 멀티모달 AI의 활용성을 높일 수 있다.

원문 보기