오디오-비주얼 대형 언어모델은 실제로 보고 듣는가?
Do Audio-Visual Large Language Models Really See and Hear?
TL;DR AI
1분핵심 요약
연구진이 AVLLM의 계층별 통합을 기계적으로 해석했다.
중간층에는 풍부한 오디오 의미가 있으나 최종 출력에는 반영되지 않았다.
더 깊은 융합층이 시각을 우선하고 훈련 정렬에서 오디오 정렬이 제한적이었다.
Do Audio-Visual Large Language Models Really See and Hear?
연구진이 AVLLM의 계층별 통합을 기계적으로 해석했다.
중간층에는 풍부한 오디오 의미가 있으나 최종 출력에는 반영되지 않았다.
더 깊은 융합층이 시각을 우선하고 훈련 정렬에서 오디오 정렬이 제한적이었다.