Microsoft가 MAI 음성 및 이미지 모델을 개발자들에게 공개
Microsoft opens MAI speech and image models to developers

TL;DR AI
2분핵심 요약
Microsoft가 MAI-Transcribe-1, MAI-Voice-1, MAI-Image-2 모델을 Foundry에 추가했다.
요금: 전사 $0.36/시간, 음성 $22/1M 문자, 이미지 생성 $5/1M 텍스트 입력 토큰 + $33/1M 이미지 출력 토큰.
MAI-Transcribe-1은 상위 25개 언어 FLEURS 벤치마크에서 선두이며 WAV·MP3·FLAC을 지원하고 자막, 회의록, 통화 분석, 접근성, 음성 에이전트용으로 튜닝되었으나 실시간 전사·화자 분리·컨텍스트 바이어스는 아직 미지원이다.
MAI-Voice-1은 60초 오디오를 1초에 생성할 수 있고 Foundry에서 수초 분량의 오디오로 커스텀 보이스를 만들 수 있으며 2025년에 Copilot Daily·Podcasts·Copilot Labs에 소개된 바 있다.
MAI-Image-2는 창작 및 상업용을 목표로 하며 MAI Playground에 2026년 3월 19일 출시되었고 MAI Playground의 테스트는 미국 전용이며 Satya Nadella가 2026년 4월 2일 이 변화를 트윗했다.
