긴 영상 이해를 위한 선형 확장 비디오 VLM
Linear Scaling Video VLMs for Long Video Understanding
TL;DR AI
1분핵심 요약
StateKV는 긴 비디오 VLM을 위한 추론 전용 기법으로, 프레임 간 문맥을 고정 크기 순환 상태에 보존하고 디코딩에는 전체 캐시를 사용한다.
세 개의 벤치마크와 일곱 개 모델에서 전체 self-attention에 가까운 성능을 유지했으며, 일반적인 슬라이딩 윈도우나 최근성 기반 스트리밍 방식보다 뛰어났다.
미세조정이나 구조 변경 없이 prefill 비용을 선형 시간으로 줄여, 긴 비디오 이해와 스트리밍 확장성을 높인다.
