TurboVLA: RTX 4090에서 1GB 미만 VRAM으로 32Hz 실시간 비전-언어-행동 모델
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
TL;DR AI
1분핵심 요약
TurboVLA는 비전과 언어를 직접 로봇 행동으로 연결하는 소형 비전-언어-행동 모델로, 기존의 LLM 중심 파이프라인을 대체한다.
이 모델은 0.2B 파라미터로 LIBERO에서 평균 97.7% 성공률을 기록했고, 지연 시간은 31.2ms, 추론 VRAM은 0.9GB에 불과했다.
RTX 4090에서 32Hz 실시간 로봇 제어를 구현하며, 훨씬 적은 자원으로도 뛰어난 조작 성능을 보였다.
이 효율성은 소비자용 하드웨어에서도 로봇 배포를 더 현실적으로 만들 수 있다.
