QueenVIS: 쿼리 강화로 비디오 인스턴스 분할을 위한 이미지 전용 학습 재고
QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment

TL;DR AI
1분핵심 요약
QueenVIS는 이미지 단위 학습만으로 영상 인스턴스 분할 성능을 높이는 새 프레임워크다.
Mask2Former의 object query를 feature-prediction과 center-prediction 보조 손실로 강화해 쿼리 품질과 안정성을 개선한다.
추론 시에는 query propagation과 memory bank를 활용해 프레임 간 인스턴스 정체성을 유지한다.
YouTube-VIS와 OVIS에서 기존 image-only baseline을 능가하며, 비디오 클립 학습 없이도 강한 결과를 보였다.
