StepFun, StepAudio 2.5 Realtime 공개: 역할극 특화 RLHF와 준언어적 이해를 갖춘 엔드투엔드 음성 모델
StepFun Releases StepAudio 2.5 Realtime: An End-to-End Voice Model with Roleplay-Specific RLHF and Paralinguistic Comprehension

TL;DR AI
1분핵심 요약
스텝펀이 중국어와 영어를 지원하는 실시간 엔드투엔드 음성 LLM ‘StepAudio 2.5 Realtime’를 공개했다.
이 모델은 오디오 입력-오디오 출력 단일 파이프라인을 사용하며, 맞춤형 페르소나를 지원하고 WebSocket API로 제공된다.
스텝펀은 대규모 페르소나 증강, 롤플레이 중심 RLHF, 음성 이해·생성 결합 방식으로 학습했다고 밝혔다.
회사 측은 운율·감정 등 발화 특징 이해 성능도 강하다고 설명하며, 더 풍부한 대화형 음성 비서와 롤플레이 활용 가능성을 제시했다.
