ProRL: Rectified Policy Gradient Estimation을 통한 proactive recommendation을 위한 효과적인 강화학습
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
TL;DR AI
1분핵심 요약
연구진은 능동적 추천을 위한 강화학습 기법 ProRL을 제안했으며, 기존 정책경사법의 두 가지 문제인 길이 편향과 높은 분산을 해결했다.
ProRL은 단계별 보상 중심화와 위치별 advantage 추정을 사용해 critic 없이도 학습을 안정화한다.
이 방법은 MovieLens-1M, Steam, Amazon-Book에서 여러 기준선보다 뛰어난 성능을 보였고, 경로 품질과 다양성도 개선했다.
또한 GRU4Rec, BERT4Rec, LightSANs 같은 보지 못한 보상 신호와 추천 모델에도 더 잘 전이됐다.
