언어 바꾸기English
이전 목록

FineVLA: 조향 가능한 비전-언어-행동 정책을 위한 세밀한 지시 정렬

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

TL;DR AI

핵심 요약

1분
  1. 연구진은 로봇 비전-언어-행동 정책을 세밀한 실행 지시로 학습시키는 오픈 프레임워크 FineVLA를 제안했다.

  2. 여러 로봇 데이터셋, 홀드아웃 벤치마크, 특화된 annotator를 결합해 행동과 접촉에 대한 상세한 감독 신호를 만들었다.

  3. 세밀한 지시와 목표 수준 지시를 함께 학습한 정책은 목표만 학습한 방식보다 더 좋은 성능을 보였다.

  4. 이 방법은 과제 성공률을 유지하거나 개선하면서 자세, 색상, 접근 방향에 대한 제어력을 높였다.

원문 보기