TurboVLA: RTX 4090에서 32Hz로 동작하는 1GB 미만 VRAM의 실시간 비전-언어-행동 모델
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TL;DR AI
1분핵심 요약
연구진이 로봇 조작용 소형 비전-언어-행동 모델 TurboVLA를 공개했다.
TurboVLA는 LLM 중심 파이프라인을 줄이고, 비전과 언어를 직접 결합해 저지연으로 행동을 예측한다.
이 모델은 RTX 4090에서 32Hz 실시간 제어를 달성하면서 VRAM을 1GB도 채 쓰지 않는다.
그 결과, 소비자용 하드웨어에서도 더 저렴하고 빠른 로봇 정책 실행이 가능해질 전망이다.
