LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
TL;DR AI
2 min readKey summary
Researchers proposed Local Modality Substitution (LoMo), a lightweight training strategy for vision-language models.
LoMo rewrites single-modality prompts into mixed text-image sequences, so equivalent meaning appears across different carriers.
On 13 multimodal benchmarks, it outperformed standard supervised fine-tuning and improved models like LLaVA-OneVision-1.5-8B and Qwen3.5-9B.
The method aims to reduce modality bias and make VLMs more robust when text is presented as images, or vice versa.
