언어 바꾸기English
이전 목록

가이드, 생각, 행동: 비전-언어-행동 모델의 상호작용적 구현 추론

Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models

TL;DR AI

핵심 요약

1분
  1. 연구진은 로봇 제어를 위한 상호작용형 비전-언어-행동 프레임워크 GTA-VLA를 제안했다.

  2. 포인트, 박스, 궤적 같은 공간적 단서를 받아 공간-시각 체인 오브 소트로 통합해 계획한다.

  3. 가벼운 액션 헤드가 실행을 담당해 추론과 제어를 분리한다.

  4. 실험에서 SimplerEnv WidowX에서 최고 수준의 성능을 보였고, 시각적 변화와 모호한 장면에서도 성공률이 더 높았다.

  5. 이 방식은 로봇이 사람의 시각적 지도를 활용해 실패와 분포 변화에 더 잘 대응하도록 도울 수 있다.

원문 보기