Mistral AI, 저지연 다국어 음성 생성용 4B 오픈 웨이트 TTS 'Voxtral' 공개
Mistral AI Releases Voxtral TTS: A 4B Open-Weight Streaming Speech Model for Low-Latency Multilingual Voice Generation

TL;DR AI
2분핵심 요약
Mistral AI는 Voxtral TTS를 공개 가중치 텍스트-투-스피치 모델로 출시했으며, 이는 오디오 생성 제공 항목의 일부다.
Voxtral TTS는 독점 음성 API의 직접적 경쟁자로 포지셔닝되며, 실시간 음성 워크플로에 통합되도록 설계된 모듈형 구성요소다.
해당 모델은 CC BY-NC 라이선스로 공개되었다.
하이브리드 4B 매개변수 아키텍처: 3.4B Transformer 디코더(텍스트 이해 및 음성의 의미 표현 예측), 390M Flow-Matching Acoustic Transformer(의미 표현을 음향 특성으로 변환), 300M Neural Audio Codec(음향 특성을 고품질 오디오 파형으로 매핑).
저지연 스트리밍 추론에 최적화되어 있으며, 예시로 500자 입력의 10초 음성 샘플에서 모델 지연은 70ms로 대화형 에이전트와 실시간 번역에 적합하다.



