UniAudio-Token: 일반 오디오 인식을 통해 의미 기반 음성 토크나이저를 강화하다
UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

TL;DR AI
1분핵심 요약
연구진이 음성 중심의 의미 토크나이저를 더 넓은 오디오 인지로 확장한 새 오디오 토크나이저 UniAudio-Token을 소개했다.
이 프레임워크는 단일 코드북 의미 토크나이저 방식을 유지하면서, Semantic-Acoustic Primitives와 콘텐츠 인지 게이팅 기법인 Semantic-Acoustic Equilibrium으로 음향 정보 손실을 줄인다.
통합 오디오 인터페이스로 평가한 결과, 이해와 생성 벤치마크 모두에서 단일 코드북 기준선보다 더 나은 성능을 보였다.
음성만이 아니라 다양한 오디오를 다루면서도 고품질 음성 출력을 유지해 audio-LLM 인터페이스를 개선하는 것이 목표다.
