TMRL: 확산 타임스텝 조절 사전학습으로 효율적인 정책 파인튜닝을 위한 탐색 가능
TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TL;DR AI
1분핵심 요약
연구진은 정책 사전학습에 확산 노이즈를 더하는 CSP와, 미세조정 중 확산 timestep을 조절해 탐색을 늘리는 TMRL을 제안했다.
이 방법은 사전학습된 로봇 정책을 강화학습으로 적응시킬 때 탐색과 샘플 효율을 높인다.
논문은 실제 로봇 조작 작업에서 1시간 이내의 미세조정 성공 사례를 보고했다.
전반적으로 이 방식은 더 적은 데이터로 로봇 정책을 빠르게 배포할 수 있게 한다.
