LatentOmni: 통합 오디오-비주얼 잠재 추론을 통한 옴니모달 이해의 재고
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
TL;DR AI
2분핵심 요약
연구진은 텍스트와 오디오-비주얼 잠재 상태를 교차로 결합하는 크로스모달 추론 프레임워크 LatentOmni를 제안했다.
이 방법은 feature-level supervision과 temporal consistency embedding을 추가해, 모달리티 전반의 미세한 증거를 더 잘 보존한다.
Omni-Sync Position Embedding, LatentOmni-Instruct-35K 같은 구성요소와 함께, 여러 벤치마크에서 명시적 텍스트 기반 chain-of-thought보다 더 좋은 성능을 보였다.
이번 결과는 잠재 공간에서 추론을 유지하는 방식이 temporal grounding과 멀티모달 LLM 성능을 높일 수 있음을 시사한다.
