FineVLA: 조향 가능한 비전-언어-행동 정책을 위한 세밀한 지시 정렬
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

TL;DR AI
1분핵심 요약
연구진은 로봇 비전-언어-행동 정책을 세밀한 실행 지시로 학습시키는 오픈 프레임워크 FineVLA를 제안했다.
여러 로봇 데이터셋, 홀드아웃 벤치마크, 특화된 annotator를 결합해 행동과 접촉에 대한 상세한 감독 신호를 만들었다.
세밀한 지시와 목표 수준 지시를 함께 학습한 정책은 목표만 학습한 방식보다 더 좋은 성능을 보였다.
이 방법은 과제 성공률을 유지하거나 개선하면서 자세, 색상, 접근 방향에 대한 제어력을 높였다.
