보는 것에서 생각하는 것으로: 지각과 추론의 분리로 향상되는 비전-언어 모델의 사후 학습
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
TL;DR AI
1분핵심 요약
연구진은 비전-언어 모델의 후학습을 지각, 시각 추론, 텍스트 추론의 단계로 분리하는 방식을 제안했다.
이 방식은 여러 모델과 벤치마크에서 통합 학습보다 일관되게 더 높은 성능을 보였으며, WeMath와 RealWorldQA에서도 우수했다.
핵심은 지각을 먼저 다듬으면 정확도가 높아지고 추론 과정도 더 짧아진다는 점이다.
SFT와 RL을 결합한 커리큘럼형 학습으로, 오픈웨이트 VLM을 위한 더 강력한 레시피를 제시한다.
