언어 바꾸기English
이전 목록

StableVLA: 추가 데이터 없이 더 견고한 비전-언어-행동 모델을 향하여

StableVLA: Towards Robust Vision-Language-Action Models without Extra Data

TL;DR AI

핵심 요약

1분
  1. 연구진은 최신 비전-언어-행동(VLA) 모델이 보지 못한 시각적 교란에 크게 취약하다는 점을 확인했다.

  2. 이를 해결하기 위해 정보 병목 기반의 경량 모듈인 IB-Adapter를 제안해 노이즈를 걸러내고 강건성을 약 30% 높였다.

  3. 추가되는 파라미터는 1천만 개 미만이며, 별도의 추가 학습 데이터도 필요하지 않다.

  4. 그 결과 실제 환경의 시각적 노이즈 속에서도 로봇 정책을 더 안정적으로 만들 수 있음을 보여줬다.

원문 보기