명시적 정규화 없이 비디오 객체 중심 학습에서 시간적 일관성 내재화
Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization

TL;DR AI
1분핵심 요약
연구진은 비디오 객체 중심 학습용 xSSC를 제안하며, 기존의 slot-slot 대조학습을 내장형 시간 모델링으로 대체했다.
Chrono-Channel Decomposition은 슬롯의 정적 정보와 동적 정보를 분리한다.
Cross-Temporal Reconstruction은 표준 재구성 손실로 인접 프레임 간 특징을 복원하도록 학습시킨다.
추가 대조 손실을 없애 효율성을 높였고, 객체 발견·인식 벤치마크에서 새로운 성능을 기록했다.
