언어 바꾸기English
이전 목록

오디오-비주얼 대형 언어모델은 실제로 보고 듣는가?

Do Audio-Visual Large Language Models Really See and Hear?

TL;DR AI

핵심 요약

1분
  1. 연구진이 AVLLM의 계층별 통합을 기계적으로 해석했다.

  2. 중간층에는 풍부한 오디오 의미가 있으나 최종 출력에는 반영되지 않았다.

  3. 더 깊은 융합층이 시각을 우선하고 훈련 정렬에서 오디오 정렬이 제한적이었다.

원문 보기