대규모 오디오 언어 모델 조사: 일반화, 신뢰성, 그리고 전망
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
TL;DR AI
1분핵심 요약
이 서베이는 대형 오디오 언어 모델의 일반화, 신뢰성 위험, 그리고 더 안전한 오디오 지능을 위한 방어 전략을 다룬다.
LALM의 아키텍처, 정렬 방법, 그리고 환각·강건성 부족·안전성 문제 같은 주요 실패 양상을 분석한다.
또한 교차모달 탈옥, 잠재 음향 백도어, 생체정보 프라이버시 유출 등 위협을 포괄하는 위험 분류체계를 제시한다.
오디오 AI의 발전이 보안·신뢰성 대책보다 빠르다고 지적하며, 실제 배포에서 신뢰·프라이버시·안전의 중요성을 강조한다.
