VLM은 적응형 테스트 시간 최적화를 통해 비디오 추론을 가르치는 좋은 교사다
VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

TL;DR AI
1분핵심 요약
연구진은 비전-언어 모델을 비디오 추론의 직접 해결사가 아니라 테스트 시점의 교사로 활용하는 방법을 제안했다.
VLM에서 과제 규칙과 진행 상황 신호를 추출한 뒤, 이를 미분 가능한 보상으로 변환한다.
이 보상은 비디오 생성 모델의 가벼운 LoRA 모듈에 대한 온라인 업데이트를 유도한다.
이 접근은 상징적·일반 비디오 추론 벤치마크에서 기존 VLM-as-solver와 Best-of-N 방식보다 큰 성능 향상을 보였다.
