HiSem: Hierarchical Semantic Disentangling for Remote Sensing Image Change Captioning

TL;DR AI
2 min readKey summary
Researchers introduced HiSem, a hierarchical semantic disentangling network for remote sensing image change captioning.
HiSem uses bidirectional differential attention modulation and hierarchical adaptive semantic disentanglement to separate coarse change detection from fine-grained description.
This design addresses a key flaw in prior models by treating changed and unchanged regions at different semantic levels.
The model outperformed previous methods on benchmark datasets, including a 7.52% BLEU-4 improvement on WHU-CDC.
