언어 바꾸기English
이전 목록

VLM은 적응형 테스트 시간 최적화를 통해 비디오 추론을 가르치는 좋은 교사다

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

TL;DR AI

핵심 요약

1분
  1. 연구진은 비전-언어 모델을 비디오 추론의 직접 해결사가 아니라 테스트 시점의 교사로 활용하는 방법을 제안했다.

  2. VLM에서 과제 규칙과 진행 상황 신호를 추출한 뒤, 이를 미분 가능한 보상으로 변환한다.

  3. 이 보상은 비디오 생성 모델의 가벼운 LoRA 모듈에 대한 온라인 업데이트를 유도한다.

  4. 이 접근은 상징적·일반 비디오 추론 벤치마크에서 기존 VLM-as-solver와 Best-of-N 방식보다 큰 성능 향상을 보였다.

원문 보기