언어 바꾸기English
이전 목록

LoMo: 더 깊은 비전-언어 융합을 위한 로컬 모달리티 치환

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

TL;DR AI

핵심 요약

1분
  1. 연구진은 비전-언어 모델용 경량 학습 전략인 Local Modality Substitution(LoMo)을 제안했다.

  2. LoMo는 단일 모달 프롬프트를 텍스트와 이미지가 섞인 형태로 바꿔, 같은 의미가 서로 다른 표현 매체에 나타나도록 한다.

  3. 13개 멀티모달 벤치마크에서 일반적인 지도 미세조정보다 더 좋은 성능을 보였고, LLaVA-OneVision-1.5-8B와 Qwen3.5-9B도 개선했다.

  4. 이 방법은 텍스트와 이미지 간 모달 편향을 줄여, 표현 방식이 바뀌어도 더 강건한 멀티모달 추론을 가능하게 한다.

원문 보기