언어 바꾸기English
이전 목록

DenoiseRL: 노이즈가 섞인 프리픽스에서 복구하도록 추론 모델을 부트스트래핑하는 방법

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

TL;DR AI

핵심 요약

1분
  1. 연구진은 실패한 추론 흔적을 학습해 대형 언어 모델의 추론 성능을 높이는 강화학습 프레임워크 DenoiseRL을 공개했다.

  2. 이 방법은 약한 모델의 잘못된 추론을 활용해 복구, 탐색, 자기 교정을 학습시키며, 강한 교사 모델과 정제된 데이터 의존도를 줄인다.

  3. DenoiseRL은 수학과 일반 추론 벤치마크에서 강력한 온폴리시 RL 기준선보다 더 좋은 성능을 보였다.

  4. 이 접근은 성공 사례만이 아니라 실수로부터 학습함으로써 더 확장 가능한 추론 모델 개선 경로를 제시한다.

원문 보기