언어 바꾸기English
이전 목록

WorldVLN: 항공 비전-언어 내비게이션을 위한 자기회귀형 월드 액션 모델

WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

TL;DR AI

핵심 요약

1분
  1. 연구진은 공중 시각-언어 내비게이션을 위한 자기회귀형 월드-액션 모델 WorldVLN을 제안했다.

  2. 이 시스템은 비디오로부터 단기 상태 변화를 예측해 웨이포인트 행동으로 변환하고, 폐루프 방식으로 문맥을 계속 갱신한다.

  3. 학습은 내비게이션 기반 사전학습과 Action-aware GRPO 강화학습으로 구성된 2단계 파이프라인을 사용한다.

  4. WorldVLN은 실내·실외 벤치마크에서 기존 방법보다 12% 이상 높은 성공률을 보였고, 실제 드론 비행으로도 제로샷 전이됐다.

원문 보기