AgentGrounder: 멀티모달 언어 모델을 활용한 제로샷 3D 시각 포인트클라우드 그라운딩
AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

TL;DR AI
1분핵심 요약
연구진은 멀티모달 언어 모델을 활용해 자연어 객체 질의를 3D 포인트 클라우드에서 찾는 제로샷 프레임워크 AgentGrounder를 제안했다.
이 파이프라인은 먼저 색상 포인트 클라우드로 객체 조회 테이블을 만들고, 이후 온라인 에이전트가 후보를 검색해 기하 정보를 점수화하며 필요할 때만 뷰를 렌더링한다.
AgentGrounder는 ScanRefer와 Nr3D에서 SeeGround보다 더 좋은 성능을 보여, 3D 전용 학습 없이도 더 강한 제로샷 3D 비주얼 그라운딩을 입증했다.
이 방법은 선택적 검색, 기하 추론, 필요 시 시각 확인을 결합해 객체 위치 추정을 개선한다.
