언어 바꾸기English
이전 목록

CoTinyVLA: 10억 파라미터 미만 비전-언어-행동 모델을 위한 체인 오브 쏘트 증류

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

TL;DR AI

핵심 요약

1분
  1. 연구진은 Qwen3.5-0.8B를 기반으로 한 0.9B급 소형 vision-language-action 모델 CoTinyVLA를 공개했다.

  2. 이 모델은 듀얼 뷰 시계열 입력, 35B 교사 모델의 계층적 chain-of-thought distillation, 패러프레이즈 증강을 활용한다.

  3. CoTinyVLA는 LIBERO-Plus와 여러 벤치마크에서 강건성을 높이며 3B~7B 파라미터급 기준 모델을 앞섰다.

  4. 성능 대비 GPU 메모리 사용이 낮아, 임베디드 로봇과 폐루프 제어에 특히 유용하다.

원문 보기