언어 바꾸기English
이전 목록

AgentGrounder: 멀티모달 언어 모델을 활용한 제로샷 3D 시각 포인트클라우드 그라운딩

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

TL;DR AI

핵심 요약

1분
  1. 연구진은 멀티모달 언어 모델을 활용해 자연어 객체 질의를 3D 포인트 클라우드에서 찾는 제로샷 프레임워크 AgentGrounder를 제안했다.

  2. 이 파이프라인은 먼저 색상 포인트 클라우드로 객체 조회 테이블을 만들고, 이후 온라인 에이전트가 후보를 검색해 기하 정보를 점수화하며 필요할 때만 뷰를 렌더링한다.

  3. AgentGrounder는 ScanRefer와 Nr3D에서 SeeGround보다 더 좋은 성능을 보여, 3D 전용 학습 없이도 더 강한 제로샷 3D 비주얼 그라운딩을 입증했다.

  4. 이 방법은 선택적 검색, 기하 추론, 필요 시 시각 확인을 결합해 객체 위치 추정을 개선한다.

원문 보기