CoTinyVLA: 10억 파라미터 미만 비전-언어-행동 모델을 위한 체인 오브 쏘트 증류
CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

TL;DR AI
1분핵심 요약
연구진은 Qwen3.5-0.8B를 기반으로 한 0.9B급 소형 vision-language-action 모델 CoTinyVLA를 공개했다.
이 모델은 듀얼 뷰 시계열 입력, 35B 교사 모델의 계층적 chain-of-thought distillation, 패러프레이즈 증강을 활용한다.
CoTinyVLA는 LIBERO-Plus와 여러 벤치마크에서 강건성을 높이며 3B~7B 파라미터급 기준 모델을 앞섰다.
성능 대비 GPU 메모리 사용이 낮아, 임베디드 로봇과 폐루프 제어에 특히 유용하다.
