Switch language한국어
Back to the list

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

TL;DR AI

Key summary

2 min read
  1. Researchers proposed Local Modality Substitution (LoMo), a lightweight training strategy for vision-language models.

  2. LoMo rewrites single-modality prompts into mixed text-image sequences, so equivalent meaning appears across different carriers.

  3. On 13 multimodal benchmarks, it outperformed standard supervised fine-tuning and improved models like LLaVA-OneVision-1.5-8B and Qwen3.5-9B.

  4. The method aims to reduce modality bias and make VLMs more robust when text is presented as images, or vice versa.

Read the original