LocateAnything: 병렬 박스 디코딩을 통한 빠르고 고품질의 비전-언어 그라운딩
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
TL;DR AI
1분핵심 요약
연구진은 박스와 포인트를 순차적으로가 아니라 병렬로 디코딩하는 통합 grounding·detection 프레임워크 LocateAnything을 공개했다.
Token-by-token 생성 대신 Parallel Box Decoding을 적용해 추론 속도와 처리량을 높였다.
또한 1억 3,800만 개가 넘는 샘플로 구성된 LocateAnything-Data를 구축해 대규모 학습을 지원했다.
여러 벤치마크에서 높은 IoU의 위치 정밀도를 더 잘 유지하면서도 빠른 성능을 보였다.
