Think, Act, Build: 비전·언어 모델 기반 제로샷 3D 시각 그라운딩 에이전트 프레임워크
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
TL;DR AI
1분핵심 요약
논문은 2D VLM과 다중뷰 기하를 결합한 TAB 프레임워크를 제안한다.
TAB는 원시 RGB-D 스트림에서 2D→3D 재구성 방식으로 3D-VG를 수행한다.
Semantic-Anchored Geometric Expansion은 참조에서 위치를 고정해 프레임 간 위치를 전파한다.
ScanRefer와 Nr3D 평가에서 TAB는 기존 제로샷 방법과 일부 지도 기준을 능가했다.
