Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization

TL;DR AI
2 min readKey summary
Researchers introduced xSSC for video object-centric learning, replacing slot-slot contrastive learning with built-in temporal modeling.
Chrono-Channel Decomposition separates static and dynamic slot information.
Cross-Temporal Reconstruction trains the model to reconstruct features across adjacent frames using a standard reconstruction loss.
The method removes an extra contrastive objective, improving efficiency and achieving new results on object discovery and recognition benchmarks.
