VLM은 적응형 테스트 시점 최적화를 통해 비디오 추론에 좋은 교사다
VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization
TL;DR AI
1분핵심 요약
연구진은 비전-언어 모델이 과제 규칙을 추론해 이를 미분 가능한 보상으로 바꾸고, 이를 테스트 시점 최적화에 활용하는 프레임워크를 제안했다.
이 보상은 추론 중 가벼운 LoRA 모듈만 갱신해 비디오 생성 모델을 유도하며, 핵심 모델 자체는 수정하지 않는다.
VBVR-Bench와 RULER-Bench에서 평균 성능이 16.7포인트 향상됐고, 기존 VLM-as-solver 및 Best-of-N 방식보다 우수했다.
이번 결과는 VLM이 테스트 시점에서 비디오 추론의 교사이자 평가자로 효과적으로 작동할 수 있음을 보여준다.
