언어 바꾸기English
이전 목록

LLM 강화학습을 위한 예측적 발산 마스크

Predictive Divergence Masks for LLM RL

TL;DR AI

핵심 요약

1분
  1. 이 논문은 LLM 강화학습에서 신뢰 영역 검증에 쓰는 것과 같은 divergence를 이용해 정책 업데이트를 마스킹할지 판단하는 predictive divergence mask를 제안한다.

  2. 기존 PPO의 샘플 토큰 비율 기반 방향 판정을 더 일관된 divergence 기반 기준으로 대체한다.

  3. 또한 discrete softmax 정책에 대한 폐형식 해를 유도하고, 어휘가 잘린 rollout 시스템을 위한 top-K 추정기를 도입한다.

  4. 이 방법은 마스킹 결정과 정책 드리프트 제어를 맞춰 학습 안정성과 일관성을 높이며, 다양한 모델 크기와 정밀도에서 성능 향상을 보인다.

원문 보기