VLAs는 왜 서로 다르게 실패하는가: 블랙박스 동작 모니터링이 드러낸 아키텍처별 실패 시그니처
How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures

TL;DR AI
1분핵심 요약
세 가지 비전-언어-행동 로봇 정책 연구에서 실패 신호는 모델 구조에 따라 달라져, 모니터링도 일괄적 접근이 아니라 구조별로 설계해야 한다는 점이 드러났다.
450개 에피소드 분석에서 방향 반전(direction reversal)은 실패를 예측하는 강력한 공통 지표로 나타났다.
jerk는 VQ-BeT 같은 이산 토큰 모델에서 주로 유용했지만, 속도(velocity) 점검은 특히 연속형 정책에서 약하거나 효과가 없는 경우가 많았다.
연구진은 컨포멀 보정을 적용한 학습 없는 블랙박스 모니터링 도구 SafeContract를 제안해 로봇 정책 실패 탐지를 강화했다.
