GesVLA: 제스처 인식 비전-언어-행동 모델 임베디드 표현
GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations

TL;DR AI
1분핵심 요약
연구진은 복잡한 환경에서 로봇 조작을 위한 제스처 인지형 비전-언어-행동 모델 GesVLA를 제안했다.
GesVLA는 제스처 표현을 시각·언어 정보와 결합하고, 합성 제스처-이미지 데이터와 2단계 학습을 활용한다.
이 시스템은 블록 조작, 상품 선택, 농산물 선택 과제에서 타깃 정합과 상호작용 성능을 높였다.
이번 결과는 제스처 입력이 지시의 모호성을 줄이고 실제 로봇 작업 성능을 향상시킬 수 있음을 보여준다.
