비주얼 대조 자기 증류
Visual Contrastive Self-Distillation
TL;DR AI
1분핵심 요약
연구진은 비전-언어 모델용 대조적 자기 증류 기법인 VCSD를 제안했다.
VCSD는 이미지가 반영된 출력과 이미지가 제거된 출력의 차이를 활용해, 외부 교사나 특권 라벨 없이 학습 신호를 만든다.
ViRL39K 실험에서 Qwen3-VL과 Qwen3.5 모델의 벤치마크 성능이 향상됐다.
이 방식은 외부 감독 의존도를 줄이면서도 정확도를 높여 멀티모달 학습을 더 단순하고 확장 가능하게 만든다.
