Mega-ASR: 대규모 실세계 음향 시뮬레이션을 통한 실제 환경^2 음성 인식으로 나아가기
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
TL;DR AI
1분핵심 요약
연구진이 거친 실제 음향 환경에 강한 통합 음성인식 프레임워크 Mega-ASR를 공개했다.
Mega-ASR는 200만 샘플 규모의 시뮬레이션 데이터셋 Voices-in-the-Wild-2M과 단계적 학습을 활용해 심한 왜곡과 복합 잡음을 처리한다.
이 시스템은 VOiCES, NOIZEUS 등 여러 벤치마크에서 기존 모델보다 뛰어난 성능과 더 낮은 오류율을 보였다.
이번 연구는 현재 ASR의 약점을 보완해, 실제 환경에서 음성 서비스의 신뢰도를 높일 수 있다.
