언어 바꾸기English
이전 목록

EarlyTom: 빠른 비디오 이해를 완성하는 조기 토큰 압축

EarlyTom: Early Token Compression Completes Fast Video Understanding

TL;DR AI

핵심 요약

1분
  1. 연구진은 비디오 LLM을 위한 학습 없이 적용 가능한 토큰 압축 프레임워크 EarlyTom을 공개했다.

  2. 후처리식 가지치기 대신, 비전 인코더 내부에서 분리된 공간 토큰 선택으로 시각 토큰을 더 일찍 압축한다.

  3. LLaVA-OneVision-7B에서 time-to-first-token을 최대 2.65배 줄이고 FLOPs를 최대 61% 절감했다.

  4. 정확도는 전체 토큰 기준 성능에 가깝게 유지돼, 비디오 이해 모델의 배포 비용과 지연을 낮출 수 있다.

원문 보기