언어 바꾸기English
이전 목록

보상 편향 분포 정합을 통한 소수 스텝 생성기 강화

Reinforcing Few-step Generators via Reward-Tilted Distribution Matching

TL;DR AI

핵심 요약

1분
  1. 연구진은 몇 스텝 이미지 생성 정렬을 위한 2단계 기법 RTDMD를 제안했다.

  2. 먼저 일관성 인지 분포 매칭으로 생성기를 증류한 뒤, 보상 최적화로 미세 조정한다.

  3. 하이브리드 정책 그래디언트와 저분산 SubGRPO를 결합해 인간 선호에 더 잘 맞춘다.

  4. RTDMD는 SD3, SD3.5, FLUX.2에서 빠른 추론을 유지하면서 4스텝 텍스트-이미지 생성의 최고 성능을 달성했다.

원문 보기