EarlyTom: 빠른 비디오 이해를 완성하는 조기 토큰 압축
EarlyTom: Early Token Compression Completes Fast Video Understanding
TL;DR AI
1분핵심 요약
연구진은 비디오 LLM을 위한 학습 없이 적용 가능한 토큰 압축 프레임워크 EarlyTom을 공개했다.
후처리식 가지치기 대신, 비전 인코더 내부에서 분리된 공간 토큰 선택으로 시각 토큰을 더 일찍 압축한다.
LLaVA-OneVision-7B에서 time-to-first-token을 최대 2.65배 줄이고 FLOPs를 최대 61% 절감했다.
정확도는 전체 토큰 기준 성능에 가깝게 유지돼, 비디오 이해 모델의 배포 비용과 지연을 낮출 수 있다.
