DPO와 RLHF의 조건부 동등성: 암묵적 가정, 실패 양상, 그리고 증명 가능한 정렬
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
TL;DR AI
1분핵심 요약
새 논문은 DPO가 RLHF와 일치하는 것은 RLHF 최적 정책이 이미 인간이 선호하는 응답을 더 높게 평가한다는 좁은 가정이 있을 때뿐이라고 지적했다.
그 가정이 깨지면 DPO는 다른 목적을 최적화해 바람직하지 않은 행동으로 수렴할 수 있어, 정렬(alignment) 실패 가능성을 드러낸다.
연구진은 DPO를 음수 타깃도 가질 수 있는 소프트 마진 랭킹 방식으로 해석해, 왜 등가성이 깨지는지 설명했다.
또한 더 단순한 구현을 유지하면서 정렬 보장을 보강하는 제약 기반 방법인 CPO(Constrained Preference Optimization)를 제안했다.
