행동 잔차를 넘어: 병목 잠재 강화학습을 통한 실제 로봇 정책 조향
Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning

TL;DR AI
1분핵심 요약
연구진은 사전학습된 모방 정책은 고정한 채, 작은 잠재공간에서만 잔여 보정을 학습하는 ZPRL을 제안했다.
이 방법은 시뮬레이션 8개 과제와 실제 로봇 4개 과제에서 평가됐으며, 강력한 기준선들을 능가하고 샘플 효율도 높였다.
실세계 실험에서는 ZPRL이 기본 모방 정책 대비 평균 성공률을 33.7% 끌어올렸다.
이 접근은 액션 공간 보정보다 더 안전하고 구조화된 온라인 로봇 적응 방법을 제공한다.
