TensorX

TensorX · Paper Blog

What Makes Synthetic Data Effective in Image Segmentation

Jinjin Zhang, Xiefan Guo, Yizhou Jin, Nan Zhou, Di Huang (Beihang University) · 2026-05-19

Synthetic DataImage SegmentationOptimal TransportLatent Diffusion Models

本文系统分析了扩散模型生成的合成图像在语义分割任务中的有效性,指出‘稠密场景构图’与‘细粒度实例保真度’是核心增益因子,并提出全新的半监督分割框架 SENSE。

💡 核心创新点

近年来,随着扩散模型(Diffusion Models)的爆发,如何利用合成图像提升下游视觉任务的性能,成为了学术界和工业界最关注的热点。然而,现有的合成数据方案在密集的像素级语义分割任务上面临巨大的噪声瓶颈。基于此,本工作深入探索了合成数据驱动语义分割的底层机制,取得了多项核心突破:

  • 首次揭示合成数据的核心增益因子:通过严格控制变量的定性和定量实验,指出稠密场景构图(Dense Scene Composition)和细粒度实例保真度(Fine Instance Fidelity)是决定合成数据有效性的两个最具决定性的关键品质。
  • 提出无模型依赖的 SENSE 框架:设计了一种名为 SENSE(Synthetically ENhanced SEgmentation)的半监督分割统一框架,可无缝接入各种主流分割模型,有效缓解生成图像过程中的各种随机不稳定幻觉。
  • 引入最优传输(Optimal Transport)标签映射机制:通过构建全局的熵正则化最优传输,规避了传统伪标签方法对单个像素孤立评估造成的累积误差,显著提升了分割网络在合成图像上的边界对齐品质。

🎯 核心结论:相比于追求合成图的多样性或一味扩大生成数量,合成图像的“构图复杂度”和“边界局部高频保真度”才是大幅提升下游语义分割模型泛化性能的最关键钥匙。

🔍 背景与动机

现有方案面临的瓶颈与幻觉挑战

在计算机视觉领域,语义分割一直被视为最具挑战性且标注成本最高昂的任务之一。一幅复杂的城市街景图像,往往需要耗费专业标注员数十分钟来进行精确到像素级的轮廓勾勒。使用生成式扩散模型合成图像并自动匹配感知标签,理论上是一种极具吸引力、极具性价比的解决方案。

然而,现有的条件生成模型(如 ControlNet)在密集场景下经常出现生成失真。例如,给模型输入一个包含“人行道(sidewalk)”的语义掩码引导生成街景图,生成模型可能会由于随机噪声,在此处合成出“车道(road)”区域的纹理,导致自动生成的伪标签与实际生成的图像内容出现严重的语义错位。

💡 关键技巧:在存在生成幻觉时,直接将输入的引导 mask 作为下游模型的强监督标签会造成严重的偏见传播(confirmation bias)。我们需要一种更柔性、具有全局自适应微调能力的标签匹配策略。

这种不稳定性就像是在一本印满排版错误的教科书里学习,下游分割模型会迅速“学坏”并丧失泛化力。为了解决此问题,本工作首先对现代扩散模型(如 Flux 和 SD3.5-large)所产出合成数据的“质效因素”进行了深入且体系化的解构,并在这些洞察之上设计了自适应纠偏框架 SENSE。

📊 数据集与实验环境

为了全面验证 SENSE 的优越性,本工作在三个极具代表性的公开语义分割数据集上进行了密集评测:

  • Cityscapes:经典的城市街景数据集。包含 2,975 张真实训练图像,19 类对象。在实验中额外合成了 5,950 张高质量城市街景图像作为辅助训练集。
  • COCO:多类别复杂自然场景。拥有 118,287 张真实训练图像。通过扩散模型配套生成了 236,574 张两倍规模的合成图数据。
  • ADE20K:具有 150 个超多类别的室内外密集场景,共 20,210 张真实图像。额外补充了 40,420 张双倍于真实量的合成图像。

💻 硬件配置与超参设置

对于所有的训练与评测过程,实验均在严格的基准下运行。其软硬件规约如下:

  • 硬件平台:DPT 模型使用 1 片 NVIDIA A800 GPU 训练;Swin-L 与 Mask2Former 使用两片 NVIDIA A800(80GB 显存)执行分布式训练。
  • 优化器与权重衰减:使用 AdamW 优化器,DPT 的权重衰减设为 0.01,Mask2Former 的权重衰减设为 0.05
  • 学习率策略:预训练 Encoder 基础学习率设为 5e-6,随机初始化的解码器模块设为 2e-45e-5。采用幂指数为 0.9 的 Polynomial Learning Rate Schedule。
  • 图像分辨率:在 Cityscapes 上输入分辨率固定为 1024x1024;在 COCO 和 ADE20K 上固定为 640x640

🛠️ 核心机制与研究方法

🧠 核心探索:探明合成数据的关键特征

本工作首先研究了合成数据究竟需要具备什么特性,才能最大限度地帮助模型在真实数据上提升泛化度。作者设计了包含两大维度的严格控制变量实验:

1. 场景构图:稀疏 vs. 稠密

作者利用 Flux 扩散模型,对比了使用 CLIP 式简单模版提示词生成的“稀疏构图”(Sparse Composition)数据集,与利用多模态大模型(MLLM)在真实图像分布指导下生成的富有多物体交互的“稠密构图”(Dense Composition)数据集:

fig-02

定量实验(如表 1 所示)清晰地表明,稠密复杂的构图不仅让平均每幅图像包含的对象数量从 11.48 增加到了 22.21,还将 Cityscapes 上的验证 mIoU 从 61.81 显著提升到了 66.56,带来了 +4.75 pp 的大幅跃进:

fig-03

2. 局部保真度:粗糙 vs. 精细

在保持构图完全一致的前提下,作者对比了标准 Flux 产生的略显平滑和模糊的实例边缘(Coarse Fidelity),与引入高频细节增强后的 Flux-WLF(Fine Fidelity):

fig-04

根据表 2 显示,局部保真度的精细化使下游分割模型的 mIoU 从 66.56 进一步提升至 68.17,有效弥补了生成图像在局部材质纹理上的“高频细节缺失”:

fig-05

基于这两项发现,本工作确认:同时确保图像具有稠密的语义构图与精细的局部保真度,是充分释放合成数据红利的先决条件。


🧩 SENSE 统一框架:最优传输全局匹配机制

在生成图像具备上述优势后,如何防止生成不确定性所导致的语义标签失效成了关键。SENSE 框架并没有使用 rigidity 的硬性像素对齐监督,而是将标签映射重新建模为全局多对多匹配的**最优传输(Optimal Transport, OT)**问题。

1️⃣ 最优传输问题表征 (Optimal Transport Formulation)

我们将合成图每个像素对特定类别的预测偏差当做运输成本,通过熵正则化来强制标签分布保持全局的结构一致性。该优化问题的目标函数及边界约束定义如下:

minπR+n×kπ,c+βH(π)s.t.π1k=1n1n,π1n=1k1k,1nπ1k=1\min_{\pi \in \mathbb{R}_+^{n \times k}} \langle \pi, c \rangle + \beta \cdot H(\pi) \quad \text{s.t.} \quad \pi \mathbf{1}_k = \frac{1}{n}\mathbf{1}_n, \pi^\top \mathbf{1}_n = \frac{1}{k}\mathbf{1}_k, \mathbf{1}_n^\top \pi \mathbf{1}_k = 1

在公式 (4) 中,π\pi 代表需要求解的最优传输策略,即每个像素到具体类别标签的最优映射比例;cc 代表传输成本,由网络对合成图像在空间坐标 (h,w)(h, w) 上的负对数似然概率 logpθ- \log p_\theta 构成;H(π)=ijπijlogπijH(\pi) = - \sum_{ij} \pi_{ij} \log \pi_{ij} 为熵正则化项,用以增加映射的平滑性;β\beta 是控制传输成本与全局平滑度折中的超参数。通过运用 Sinkhorn-Knopp 迭代算法,可以在极低的计算时间里逼近该凸优化问题的全局最优解:

π=diag(u)Kdiag(v)\pi^* = \text{diag}(u) \cdot K \cdot \text{diag}(v)

其中,内核矩阵 K=exp(c/ν)K = \exp(-c/\nu),而 uuvv 分别是左右两端的行、列重归一化缩放标量。这套自适应约束能强制保持全图各类别比例,极大程度地消除了传统阈值筛选伪标签法带来的累积语义漂移。

2️⃣ 针对像素级分割的 SENSE (SENSE for Pixel-based Segmentation)

在应用于常规密集像素分类模型(如 DPT)时,SENSE 协同考虑弱增强分支 ω()\omega(\cdot) 与强增强分支 Ω()\Omega(\cdot)。通过将弱增强分支输入给网络,求解公式 (5) 的最优传输计划 π\pi^* 作为柔性监督伪标签,并施加给处于强增强下的网络输出进行损失优化,从而强力确保了密集空域预测的特征稳定性。

3️⃣ 针对查询式分割的 SENSE (SENSE for Query-based Segmentation)

对于像 Mask2Former 这类基于 Learnable Queries 集合预测的 Transformer 架构,由于其不直接在二维稠密格点上输出分类,这给最优传输匹配带来了极大的阻碍。SENSE 通过在决策空间执行“投影-匹配-回传”闭环打破了这一壁垒:

  1. 全局密集概率聚合:根据 Mask2Former 空间多 query 输出组合,将稀疏的 class-mask 对通过求和还原到密集二维像素尺度;
  2. 求解最优传输:利用还原后的密集概率图作为基础运输成本,求解得出在二维空域上的最优全局最优传输计划 π\pi^*
  3. 标签匹配回传:将 π\pi^* 纠正后的柔性语义分配标签,通过经典的匈牙利双边匹配算法(Hungarian Bipartite Matching)精准映射回各个 sparse query 预测分支中,完成模型更新。

📈 结果与深度分析

本工作开展了全方位的交叉验证,其核心性能提升总结在表 3 中:

fig-06

由表 3 可见,在加入 SENSE 纠偏的合成数据后:

  • Cityscapes 上,以 DINOv2-S 为骨干网络的 DPT 模型单尺度(s.s.)mIoU 从 78.11 飞升至 80.65(+2.54 pp);Mask2Former (DINOv3-L) 在多尺度(m.s.)下提升到了 84.88%+1.59 pp)的历史级高位。
  • COCO 上,模型获得了约 +1.2 pp 的一致性能加持;在难度最大的 ADE20K (150类) 复杂室内外场景下,SENSE 赋能的 DPT 系列和 Mask2Former 均取得了多尺度 mIoU 超 +1.4 pp 的全面跃迁。

📈 类别维度 IoU 分析 (Class-wise Analysis)

通过对 Cityscapes 各类别的细分 IoU 分析(如图 4 所示),我们可以发现在引入合成数据之后,基础道路(road)和天空(sky)等高饱和高频样本的提升相对较小。然而,对于分布处于极度长尾、背景错综复杂的难例类别(例如:围栏 fence, 电线杆 pole, 路人 rider),SENSE 带来的多尺度分类 IoU 指标获得了跨越式的改善:

fig-07

⏱️ 效率分析与消融实验研究

许多人担心在每轮训练迭代中嵌入 Sinkhorn 最优传输计算,会导致网络吞吐率和显存表现大幅雪崩。然而,实测效率数据(如表 11 所示)证明这种担忧完全是不必要的:

fig-08

在 A800 平台上,运行 SENSE (DPT, DINOv2-S) 的总迭代耗时为每轮 0.535 秒,而其中最优传输的分配计算(OT Time/Iter.)仅仅耗费了极其轻微的 0.016 秒(仅占总时间的 2.9%)。这证明了其在大规模语义分割工业部署中的巨大潜在价值。

最后,从 Figure 6 我们可以更直观地见证 SENSE 在三大基准库上的绝佳泛化结果。无论是错综复杂的街道,还是室内杂乱无章的陈设,模型都能输出干净、利落的边界分割图:

fig-01

🚀 重大突破:相比此前依靠 20 倍或 50 倍合成图像暴力灌水、堆叠算力的前沿算法(如 FreeMask 和 SegGen),SENSE 仅靠 2 倍的低合成图开销,便在 ADE20K 实现了更卓越的分割精度,展示了“精细构图+最优匹配”机制无与伦比的数据使用效率。

⚠️ 局限性与未来展望

虽然 SENSE 表现惊艳,但作者指出当前对合成数据集整体语义构图的生成约束,依然极其依赖于预训练 MLLM(如 Gemma 3, Gemini 2.5)提取的多模态 Caption 引导。如果多模态大模型在极端极端密集的室内场景下出现属性识别错误(如将小茶杯误认为玻璃碗),则可能导致扩散模型在起步阶段就产生一定程度的偏差。未来,探索一套从感知模型边界特征反向自适应驱动扩散模型 Prompt 纠偏的“闭环回路”,将是消除合成数据本源幻觉的终极解决方案。

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号