비평가 유도를 활용한 샘플 효율적인 확산 기반 강화학습
Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance

TL;DR AI
1분핵심 요약
연구진은 강화학습을 위한 학습 없이 동작하는 크리틱 유도 확산 정책 최적화 기법 CGPO를 제안했다.
CGPO는 행동 생성을 높은 가치의 영역으로 유도하고, 그 행동을 회귀 타깃으로 활용한다.
이 방법은 5개 MuJoCo 이동 벤치마크에서 최고 성능을 기록했고, Franka 로봇 집기 과제에서도 강한 성능을 보였다.
확산 기반 강화학습에서 탐색과 활용의 균형을 개선해 샘플 효율을 높인 것이 핵심이다.
