언어 바꾸기English
이전 목록

Mistral AI가 ElevenLabs를 앞선다고 밝힌 음성합성 모델을 공개하고 가중치를 무료 배포

Mistral AI just released a text-to-speech model it says beats ElevenLabs — and it's giving away the weights for free

TL;DR AI

핵심 요약

1분
  1. Mistral AI 모델 가중치를 공개했다, voxtral TTS 전체 모델 가중치를 무료로 배포.

  2. Voxtral TTS 모델 크기를 3.4B 파라미터로 발표했다 트랜스포머 디코더 백본 3.4억? Actually 3.4- billion-parameter라고 명시.

  3. 모델이 노트북과 스마트폰에서 실행될 수 있다고 밝혔다 양자화하면 추론 시 약 3GB RAM 필요.

  4. 입력에 대해 첫 오디오까지 90밀리초가 소요된다고 보고했다 일반적 입력 기준 시간-투-퍼스트-오디오 90ms.

  5. 모델이 최대 6배 실시간 속도로 음성을 생성한다고 밝혔다 음성 생성 속도는 약 6배 실시간.

원문 보기