언어 바꾸기English
이전 목록

어디서뿐 아니라 언제도: RLVR을 위한 시간적 스케줄링

Not Only Where, But When: Temporal Scheduling for RLVR

TL;DR AI

핵심 요약

1분
  1. 연구진은 RLVR에서 보상 할당 기준을 시간에 따라 조정하는 temporal scheduling을 제안했다. 초기에는 토큰 수준의 특정 행동에 집중하고, 후반에는 더 넓은 최적화로 전환한다.

  2. trajectory percentile을 활용해 행동을 구분하는 방식이 잘 작동했으며, 학습 안정성도 향상됐다.

  3. 이 방법은 정책 다양성을 유지하면서 수학 및 일반 추론 벤치마크 성능을 끌어올렸다.

원문 보기