TensorX

TensorX · Paper Blog

CDHNet: An implicit calibration and difference-guided hierarchical perception change detection network for remote sensing images

Hongquan Cheng (Pengcheng Laboratory, Wuhan University), Jie Zheng, Kunlun Qi, Huayi Wu, Shifa Ma · 2026-07-09

Change DetectionRemote SensingImplicit CalibrationMulti-scale PerceptionDeep Learning

本文深入解析了专为遥感图像变化检测设计的CDHNet模型。该模型通过隐式自校准与互对齐机制,攻克了非配准情况下的伪变化难题,并结合多阶差异特征与多尺度自适应融合,实现了高精度的细粒度变化识别。

💡 核心创新点

传统的遥感图像变化检测(Change Detection, CD)方法通常假设双时相图像已经过高精度的几何校正与配准。然而在实际应用中,由于观测角度变化地形起伏季节性辐射差异,图像之间不可避免地存在像素级的几何非配准问题。这种非配准在模型进行简单的特征拼接或差分时,极易产生伪变化(Pseudo-changes)并模糊边界,严重制约了变化检测算法的实际应用效能。

针对这一痛点,本文介绍了一种隐式校准与差异引导的分层感知变化检测网络(CDHNet)。该模型彻底打破了传统方法依赖外部预配准或硬性光流对齐的局限性,在端到端的深度网络中嵌入了三个极具创新性的核心模块:

  1. 隐式校准与差异引导增强(CDA)模块:通过可变形卷积机制,实现像素级的自校准与跨分支的互对齐。在不引入外部配准算法的前提下,动态调整双时相特征的空间对应关系,从根本上压制因非配准带来的伪变化噪声。
  2. 阶段性双域交互(SDI)模块:首次将变化检测特征提取划分为“语义特征域”与“多阶差异域”。通过通道维度的跨注意力机制,SDI 实现了两个特征域之间的动态平衡与互补增强,避免了单一特征表征带来的背景混淆。
  3. 自适应多尺度感知(AMP)模块:在解码阶段摒弃了直接上采样或跳跃连接等容易引入空间模糊的传统手段。AMP 采用多尺度的通道与空间双重分解-融合架构,保证了模型对极小目标(如单体建筑)与超大尺度目标(如区域地表覆盖过渡)均能实现高空间一致性的边界勾勒。

这些创新机制的融合,使得 CDHNet 能够直接在**部分非配准(Unregistered)**的数据源上运行,并展现出对微小区域结构变化的极致敏锐度,同时对复杂的全局噪声干扰保持极高的鲁棒性。

CDHNet的整体网络架构

🔍 背景与动机

高分辨率遥感影像蕴含着丰富的空间地物细节,为城市规划、生态环境监测以及防灾减灾等领域提供了强大的数据支撑。然而,利用这些影像进行精准的变化检测却是一项极具挑战的任务。其难度可以用一个生动的例子来解释:就像是在不同季节、不同光照,甚至拿着不同像素质量的相机,去拍摄同一条热闹街道的‘找茬’游戏。 树木的生长枯荣、太阳高度角带来的建筑阴影偏移,甚至是相机轻微的抖动,都会在对比图中产生巨大的“视觉差异”。在算法眼里,这些干扰项与真正发生的建筑拆迁、道路修建等“地物变化”在光谱和纹理上高度相似,从而造成大量的误报。

现有的深度学习变化检测模型(如基于 CNN 或 Transformer 的 Siamese 架构)虽然在一定程度上缓解了特征表达不足的问题,但它们在面对非理想成像条件时,依然存在以下两个致命瓶颈:

🎯 核心结论

  1. 几何错位导致的‘伪变化’失控:当双时相图像存在 5 到 10 个像素的微小错位时,传统的直接求差(Differencing)或拼接(Concatenation)会在目标物边缘产生极其刺眼的‘红绿边缘’(即误报)。
  2. 特征深层衰减与信息纠缠:随着网络深度的增加,用于定位边界的浅层空间细节被逐渐稀释,而深层的语义特征又容易将‘背景变化’(如季节更替)与‘真实变化’(如建筑变化)相纠缠,使得边界提取残缺不全。

因此,如何在特征提取与融合的过程中,主动、隐式地纠正这种几何形变,并在解码阶段维持多尺度地物的空间完整性,是当前遥感变化检测领域急需攻克的硬骨头。

📊 数据集与实验环境

为全面验证 CDHNet 的先进性,研究团队在四个公开的配准变化检测数据集,以及两个专门模拟的非配准数据集上进行了严苛的测试。这些数据集的具体信息如下:

  • LEVIR-CD:高分辨率建筑变化检测数据集,包含 637 对 1024×1024 像素 的图像,共计 31,333 个建筑变化实例,分辨率为 0.5 米。实验中将其切分为 256x256 像素的斑块进行训练。
  • CDD (Change Detection Dataset):包含 10,000 对训练集和 3,000 对验证/测试集,空间分辨率从 3 厘米到 100 厘米不等,地物类型极其丰富。
  • WHU-CD:巨幅单时相图像(32,507 × 15,354 像素),切分为 5,947 个训练斑块、743 个验证斑块和 744 个测试斑块。
  • HRCUS-CD:针对复杂城市级变化的数据集,包含 11,388 对 0.5 米分辨率的 256×256 图像。
  • LEVIR-CD-unregistered / CDD-unregistered:为了测试模型在未配准情况下的鲁棒性,研究者对 Time A 图像的四个角点应用了 5–10 像素的随机几何扰动,从而人为制造了非线性空间失配。

🛠️ 实验超参及软硬件配置

在实验部署上,团队采用了业内顶级的硬件平台与规范化的优化策略,以确保对比的公正性:

  • 硬件平台:单卡 NVIDIA RTX 4090 GPU (24 GB 显存);在对比大模型 CDMamba 时,由于其显存需求极高,采用了 RTX 6000 Ada GPU (48 GB 显存)
  • 开发框架:PyTorch 深度学习框架。
  • 骨干网络选择:支持 MobileNetV2(轻量化版本 CDHNet-M)与 SegFormer-B0(性能更强的 Transformer 版本 CDHNet-S)作为 Siamese 编码器。
  • 优化器AdamW 优化器,学习率初始范围设为 5e-51.5e-4
  • 权重衰减(Weight Decay):LEVIR-CD 和 HRCUS-CD 设为 0.005,CDD 和 WHU-CD 设为 0.01
  • 训练策略:采用余弦退火(Cosine Annealing)调度器,batch size = 8,共训练 100 个 epochs,无额外数据增强。
  • 联合损失函数:模型优化采用二分类交叉熵(BCE)损失与广义 Dice 损失(GD Loss)的加权组合,平衡极端的类别不均衡问题。

🛠️ 核心机制与研究方法

CDHNet 的卓越性能源于其对物理世界中“对齐错位”与“尺度多变”的深刻洞察。下面我们将对其三大核心模块的设计进行逐一剖析。

1. 隐式校准与差异引导增强模块(CDA)

CDA 模块(如图 2 所示)是应对空间非配准的“第一道防线”。不同于传统方法在图像输入层强行用外部算法对齐,CDA 在特征提取的中期,利用**可变形卷积(Deformable Convolution)**自适应地学习像素偏移量。

CDA模块的内部结构与多阶差分流

首先,输入图像经过 Siamese 骨干网络提取特征后,先通过自校准(Self-Calibration)分支获取各自空间偏移场:

FTcal(x)=k=1KwkF^T(x+pk+ΔPkT)\mathcal{F}_T^{cal}(x) = \sum_{k=1}^K w_k \cdot \hat{\mathcal{F}}_T(x + p_k + \Delta \mathcal{P}_k^T)

在公式 (1) 中,\mathcal{F}_T^{cal}(x) 表示 T 时相自校准后的特征映射,\hat{\mathcal{F}}_T 是融合了全局感受野的初始特征,p_k 是标准卷积核的相对坐标,而 \Delta \mathcal{P}_k^T 是网络自主学习到的像素级空间偏移量,用于修正单时相内的非线性形变。

紧接着,为了解决双时相之间的相对位移,CDA 引入了**互对齐(Mutual Alignment)**机制,将两路校准后的特征拼接后预测残差偏移量 \Delta \mathcal{Q}_k,对第一时相特征进行二次修正:

F~1(x)=k=1KwkF1cal(x+pk+ΔQk)\tilde{\mathcal{F}}_1(x) = \sum_{k=1}^{K'} w'_k \cdot \mathcal{F}_1^{cal}(x + p_k + \Delta \mathcal{Q}_k)

完成空间对齐后,融合特征通过双分支互补拼接获得:

Ffused=σ(BN(Wf[F~1,F2cal]))\mathcal{F}_{fused} = \sigma \left( \text{BN} \left( W_f * [\tilde{\mathcal{F}}_1, \mathcal{F}_2^{cal}] \right) \right)

其中,W_f 为融合卷积核,\sigma\text{BN} 分别为激活函数与批归一化。基于高精度对齐的特征,CDA 进一步并行计算了多阶差分度量

{D(F1align,F2align)1=inF1,ialignF2,ialignD(F1align,F2align)2=in(F1,ialignF2,ialign)2D(F1align,F2align)h=F1alignF2aligncos\begin{cases} \mathcal{D}(\mathcal{F}_1^{align}, \mathcal{F}_2^{align})^1 = \sum_{i}^n |\mathcal{F}_{1,i}^{align} - \mathcal{F}_{2,i}^{align}| \\ \mathcal{D}(\mathcal{F}_1^{align}, \mathcal{F}_2^{align})^2 = \sqrt{\sum_{i}^n (\mathcal{F}_{1,i}^{align} - \mathcal{F}_{2,i}^{align})^2} \\ \mathcal{D}(\mathcal{F}_1^{align}, \mathcal{F}_2^{align})^h = \lVert \mathcal{F}_1^{align} - \mathcal{F}_2^{align} \rVert_{cos} \end{cases}

在公式 (4) 中,三个并列公式分别定义了:第一阶绝对值差分(捕获一阶光谱强度的直接变化)、第二阶欧氏距离差分(量化特征向量在欧氏空间内的距离),以及高阶余弦相似度变化。其中高阶余弦变化具体展开为:

D(F1align,F2align)h=1ΦReLU(F1alignF2alignF1alignF2align)\mathcal{D}(\mathcal{F}_1^{align}, \mathcal{F}_2^{align})^h = 1 - \Phi_{\text{ReLU}} \left( \frac{\mathcal{F}_1^{align} \cdot \mathcal{F}_2^{align}}{|\mathcal{F}_1^{align}| * |\mathcal{F}_2^{align}|} \right)

通过公式 (5),利用 \Phi_{\text{ReLU}} 激活函数过滤低响应的噪声,并将余弦相关性取反(1 - cos),转换为对高维语义差异的高度敏感特征 \mathcal{F}^{(1:4)}_D

2. 阶段性双域交互模块(SDI)

变化检测不仅需要关注“变了哪里”(由多阶差异特征描述),还需要知道“原本是什么”(由语义融合特征描述)。SDI 模块(如图 3 所示)通过一种通道维度的多头跨注意力交互机制(DIMH),将这两者完美融合。

SDI模块:语义域与差异域的动态跨注意力交互

在 SDI 中,自校准融合特征 \mathcal{F}_{fused} 作为 Query(查询项),而多阶差异特征 \mathcal{F}_D 充当 Key(键)和 Value(值)。这种设计能引导模型在关注变化区域的同时,利用完好的背景语义约束边界,从而避免在边界处产生斑驳的毛刺。最后,交互后的特征与残差特征通过协同融合架构,再次利用轻量级可变形卷积消除分支间残留的微小错位,最终输出高度一致的编码特征 \mathcal{F}_{encoded}

3. 自适应多尺度感知模块(AMP)

AMP 模块(如图 5 所示)位于解码器的最末端。针对遥感图像中变幻莫测的物体尺度(从几像素的小车到几千像素的整片农田),AMP 设计了“宽幅分解-融合”的两阶段架构:

  • 通道维度的分解与融合:利用四组不同卷积核尺寸(3\times 3, 5\times 5, 7\times 7, 9\times 9)的并行分组卷积,自适应调整通道权重,初步构建跨感受野的多尺度空间表征,并通过局部通道注意力(ECA 变体)加强邻近通道的依赖性。
  • 空间维度的分解与融合:采用多尺度自适应汇聚(Adaptive Pooling)将空间尺寸统一,并在各个尺度上利用轻量级的空间注意力机制(Spatial Attention)进行加权融合。这确保了在恢复图像空间分辨率时,大目标的内部不会出现空洞,小目标的边缘不会被平滑抹除。

AMP模块:通道和空间双分解多尺度解码机制

📈 结果与深度分析

在与 SNUNet、TinyCD、ChangeFormer、BiFA、CDMamba 等十个先进 Baseline 的同台竞技中,CDHNet 在所有数据集上均取得了压倒性的性能优势。

1. 经典配准数据集量化对比

如表 1 所示,在最常用的 LEVIR-CD 数据集上,CDHNet-S 取得了 91.72% 的 F1-Score,相比于目前最强的 Baseline 算法 BiFA(90.86%)提升了 0.86 个百分点;在 WHU-CD 数据集上,其 F1-Score 达到 95.14%,超越最强 Baseline SEIFNet 达 2.18%。这有力地证明了在标准地物场景下,CDHNet 的多阶差分特征提取能力远超单一差分度量。

LEVIR-CD与CDD经典数据集定量评估

2. 非配准数据集对抗测试

在更贴近实战的非配准数据集(LEVIR-CD-unregistered)上,可视化对比(见图 10)展现了令人震撼的结果:

  • 传统方法(如 SNUNet、TinyCD)在图像发生边缘畸变(紫色虚线框所示的白边空洞)时,其预测图上出现了大面积的红色假阳性误报斑块。
  • 相较之下,CDHNet 几乎完全免疫了这种几何畸变的影响,其预测图(White 区域)保持了极高的边界完整度与定位精度。这直接归功于 CDA 模块中自校准和互对齐公式对几何错位的隐式重映射。

非配准数据集LEVIR-CD-unregistered上的抗畸变可视化对比

3. 效率与复杂度的完美平衡

如表 4 所示,在运行效率方面:

  • 轻量化版本 CDHNet-M 拥有 17.90 M 的参数量,在 RTX 4090 上可实现 36.11 FPS 的极速推理。
  • 相比于庞大的 Transformer 模型 ChangeFormer(41.03 M 参数,202.79 G FLOPs),CDHNet 的计算开销仅为其八分之一左右,却在各项精度指标上实现了全面反超。

模型参数量、计算量与推理速度对比

4. 消融实验与局限性剖析

通过对各模块的逐一剥离,消融实验揭示了各个设计组件的作用:

  • 无任何组件的 Siamese 基线 在 LEVIR-CD 的 F1-Score 仅为 90.69%。
  • 仅引入 CDA 模块 后,F1-Score 提升至 90.94%,在未配准数据集上提升尤为显著(F1-Score 从 85.03% 飙升至 90.06%,大幅提升 5.03 pp),直接证实了隐式自校准算法的生命力。

⚠️ 局限性与挑战: 尽管 CDHNet 展现出了卓越的抗畸变能力,但作者在论文中也坦诚地指出了模型当前的局限性:由于大量使用了变形卷积(Deformable Convolution)与多头跨注意力(Cross-Attention)操作,模型在移动端及嵌入式设备上的非连续内存访问开销较大,对纯硬件推理延迟不够友好。未来研究将聚焦于变形算子的硬件级轻量化算子重构,并尝试将该架构拓展至 SAR(合成孔径雷达)与多光谱图像的跨模态变化检测任务中。

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号