SyncDPO: 선호 학습을 통한 비디오-오디오 공동 생성의 시간 동기화 향상
SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning

TL;DR AI
1분핵심 요약
연구진은 비디오-오디오 생성 모델의 시간적 정렬을 개선하는 후학습 기법 SyncDPO를 제안했다.
이 방법은 자동으로 만든 시간 왜곡 음성·영상 네거티브 샘플과 Direct Preference Optimization을 활용한다.
커리큘럼 학습을 통해 세밀한 오디오-비주얼 동기화를 더 효과적으로 학습한다.
논문은 4개 벤치마크에서 더 강한 정렬 성능과 더 나은 일반화를 보고했다.
