PilotTTS: 경쟁력 있는 음성 합성을 위한 규율 있는 모듈형 레시피
PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

TL;DR AI
1분핵심 요약
연구진이 20만 시간의 공개 처리 데이터로 학습한 오픈소스 자기회귀 TTS 시스템 PilotTTS를 공개했다.
다단계 데이터 필터링·라벨링 파이프라인과 Q-Former 기반 조건화를 통해 화자 정체성과 말하기 스타일을 분리했다.
PilotTTS는 제로샷 보이스 클로닝, 감정·준언어적 음성 합성, 중국어 방언 생성을 지원한다.
이 모델은 Seed-TTS Eval에서 강력한 성능을 보이며, 작은 구조로도 경쟁력 있는 품질을 입증했다.
전체 파이프라인, 사전학습 가중치, 코드가 공개돼 다른 팀도 같은 레시피를 재사용할 수 있다.
