Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
TL;DR AI
2 min readKey summary
Researchers propose GASP, a framework that injects geometric spatial priors into vision-language model transformer layers.
GASP uses deep supervision, correspondence matching, contrastive learning, and depth-consistency losses from video geometry.
The method improves internal correspondence accuracy, temporal robustness, and performance on 3D spatial benchmarks.
It outperforms standard fine-tuning on 3D VQA data, suggesting geometric priors can generalize better and reduce overfitting.
