보상 편향 분포 정합을 통한 소수 스텝 생성기 강화
Reinforcing Few-step Generators via Reward-Tilted Distribution Matching
TL;DR AI
1분핵심 요약
연구진은 몇 스텝 이미지 생성 정렬을 위한 2단계 기법 RTDMD를 제안했다.
먼저 일관성 인지 분포 매칭으로 생성기를 증류한 뒤, 보상 최적화로 미세 조정한다.
하이브리드 정책 그래디언트와 저분산 SubGRPO를 결합해 인간 선호에 더 잘 맞춘다.
RTDMD는 SD3, SD3.5, FLUX.2에서 빠른 추론을 유지하면서 4스텝 텍스트-이미지 생성의 최고 성능을 달성했다.
