비전-언어 내비게이션의 한계는 무엇인가?
What Limits Vision-and-Language Navigation?

TL;DR AI
1분핵심 요약
연구진은 실제 로봇 내비게이션을 위한 비전-언어-행동 내비게이션 시스템 StereoNav를 제안했다.
이 논문은 VLN이 지각 잡음과 모호한 지시문에 취약하며, 공간적 grounding과 강건성이 부족하다는 점을 지적한다.
StereoNav는 지속적인 목표 위치 사전정보와 스테레오 깊이 단서를 결합해 흐림, 조명 변화, 불명확한 명령에도 더 잘 대응한다.
벤치마크 데이터셋과 실제 로봇 실험에서 기존 대규모 확장 중심 방법보다 더 높은 정확도와 일관성을 보였다.
