선호 라벨이 불충분할 때: 실제 데이터에서 확산 모델 정렬하기
When Preference Labels Fall Short: Aligning Diffusion Models from Real Data

TL;DR AI
1분핵심 요약
연구진은 실제 이미지가 확산 모델의 선호도 정렬을 지도할 수 있는지 살펴봤습니다.
생성 샘플에서 만든 선호 쌍 대신, 실제 기준 이미지와 생성·변형된 출력값을 비교해 선호 신호를 구성했습니다.
이 데이터 중심 접근은 효과적으로 작동했으며, 기존 선호 기반 정렬 방법과 비슷한 성능을 보였습니다.
즉, 별도의 복잡한 라벨링 없이도 실제 데이터를 활용해 생성 모델을 더 간단하고 효율적으로 조정할 수 있음을 보여줍니다.
