가이드, 생각, 행동: 비전-언어-행동 모델의 상호작용적 구현 추론
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models

TL;DR AI
1분핵심 요약
연구진은 로봇 제어를 위한 상호작용형 비전-언어-행동 프레임워크 GTA-VLA를 제안했다.
포인트, 박스, 궤적 같은 공간적 단서를 받아 공간-시각 체인 오브 소트로 통합해 계획한다.
가벼운 액션 헤드가 실행을 담당해 추론과 제어를 분리한다.
실험에서 SimplerEnv WidowX에서 최고 수준의 성능을 보였고, 시각적 변화와 모호한 장면에서도 성공률이 더 높았다.
이 방식은 로봇이 사람의 시각적 지도를 활용해 실패와 분포 변화에 더 잘 대응하도록 도울 수 있다.
