언어 바꾸기English
이전 목록

Qwen-VLA: 작업, 환경, 로봇 형태 전반의 비전-언어-행동 모델링 통합

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

TL;DR AI

핵심 요약

1분
  1. Qwen-VLA는 로봇의 시각·언어 이해를 연속적인 행동 생성으로 확장한 통합 비전-언어-행동 기반 모델이다.

  2. 로봇 조작, 내비게이션, 시뮬레이션, 보조 비전-언어 데이터를 함께 사전학습하고, embodiment-aware 프롬프트로 다양한 로봇 플랫폼에 맞춘다.

  3. LIBERO, Simpler-WidowX, RoboTwin, R2R, RxR, ALOHA, DOMINO 등 여러 벤치마크에서 조작·이동·궤적 예측 성능이 뛰어났다.

  4. 분포 밖 상황에서도 강한 일반화 성능을 보여, 과제·환경·로봇 종류를 가로지르는 더 범용적인 로봇 AI로 이어질 가능성을 보여준다.

원문 보기