언어 바꾸기English
이전 목록

LongAV-Compass: T2AV, I2AV, V2AV 전반의 분 단위 오디오-비주얼 생성을 위한 통합 평가를 향하여

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

TL;DR AI

핵심 요약

1분
  1. 연구진은 텍스트·이미지·비디오 조건의 분 단위 오디오-비주얼 생성을 평가하는 벤치마크 LongAV-Compass를 공개했다.

  2. 이 벤치마크는 284개 테스트 케이스로 T2AV, I2AV, V2AV를 하나의 프레임워크에서 자동·지각 지표로 평가한다.

  3. 품질, 일관성, 의미 정렬, 동기화, 서사적 응집성 등 20개 이상의 측면을 측정한다.

  4. 11개 모델을 대상으로 한 평가와 인간 정렬 검증을 통해, 장시간 출력에서의 성능 유지 여부를 더 잘 드러낸다.

원문 보기