픽셀에서 단어로 — 대규모 네이티브 원비전 모델을 향하여
From Pixels to Words -- Towards Native One-Vision Models at Scale

TL;DR AI
1분핵심 요약
연구진은 픽셀-단어 및 프레임 간 관계를 종단간으로 학습하는 네이티브 비전-언어 파운데이션 모델 NEO-ov를 소개했다.
이 모델은 외부 인코더, 어댑터, 사후 융합을 제거해 더 단순한 멀티모달 구조를 지향한다.
NEO-ov는 세밀한 시각 과제에서 강한 성능을 보였고, 전체적으로는 모듈형 모델과 거의 대등한 수준을 보였다.
논문은 네이티브 비전-언어 모델을 설계하고 학습하는 데 필요한 아키텍처 및 트레이닝 가이드도 제시한다.
