언어 바꾸기English
이전 목록

GDSD: 확산 언어 모델을 위한 유도 디노이저 자기 증류로서의 강화 학습

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

TL;DR AI

핵심 요약

1분
  1. 연구진은 강화학습으로 확산 언어모델을 훈련하는 Guided Denoiser Self-Distillation(GDSD)을 제안했습니다.

  2. GDSD는 reverse-KL로 정규화한 RL에서 얻은 self-teacher에 denoiser logits를 맞추며, 편향이 생길 수 있는 ELBO 기반 likelihood 대리값을 피합니다.

  3. 계획, 수학, 코딩 벤치마크에서 LLaDA-8B와 Dream-7B에 적용했을 때 정확도와 학습 안정성이 모두 향상됐습니다.

  4. 최대 19.6%의 성능 향상이 보고됐으며, train-inference mismatch 없이 diffusion LLM을 개선할 유망한 방법으로 보입니다.

원문 보기