LLaVA-OneVision-2: 차세대 지각 지능을 향하여
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
TL;DR AI
1분핵심 요약
연구진이 다중모달 인식을 위한 차세대 비전-언어 모델 LLaVA-OneVision-2를 공개했다.
이 모델은 codec-stream tokenization, windowed attention, 공유 3D 위치 인코딩을 활용해 긴 영상과 공간 입력을 더 잘 처리한다.
수백만 건의 공개 영상·공간 샘플로 학습돼 영상 이해, 그라운딩, 트래킹 벤치마크에서 큰 성과를 냈다.
세밀한 시간적 위치 파악과 영상·공간 과제 전반의 통합 성능을 개선하며, 선도 경쟁 모델보다 우수한 결과를 보였다.
