언어 바꾸기English
이전 목록

3D VQA를 넘어: 향상된 기하 추론을 위해 비전-언어 모델에 3D 공간 사전 지식 주입

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

TL;DR AI

핵심 요약

1분
  1. 연구진은 비전-언어 모델의 트랜스포머 층에 기하학적 공간 priors를 주입하는 GASP 프레임워크를 제안했다.

  2. GASP는 딥 슈퍼비전, 대응점 매칭, 대비 학습, 영상 기하 기반 깊이 일관성 손실을 활용한다.

  3. 이 방법은 내부 대응 정확도, 시간적 강건성, 3D 공간 벤치마크 성능을 모두 향상시킨다.

  4. 기존 3D VQA 미세조정보다 더 잘 일반화하며 과적합을 줄일 수 있음을 보여준다.

원문 보기