PARCEL: 조건부 탄성 쿼리를 활용한 풀 앵커 리샘플링 기반 효율적 비전-언어 이해
PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding
TL;DR AI
1분핵심 요약
연구진은 pool token과 조건부 query token을 결합한 PARCEL을 제안해, 시각 토큰을 유연하게 압축하는 새로운 비전-언어 모델 방식을 소개했다.
PARCEL은 pool token을 공간 앵커로 활용해 연산량을 줄이면서도, pooling만 사용할 때의 세부 정보 손실과 query-only 방식의 grounding 문제를 완화한다.
27개 벤치마크에서 PARCEL은 다양한 토큰 예산 구간에 걸쳐 기존 matryoshka 스타일 기준선보다 더 좋은 성능을 보였다.
이를 통해 이미지 토큰 예산이 달라져도 정확도와 연산 효율의 균형을 더 잘 맞출 수 있다.
