💡 核心创新点
传统的开放词汇目标检测器(如 GroundingDINO 和 GLIP)主要依赖视觉-语言模型(VLMs)的文本提示进行目标分类与定位。然而,在跨领域少样本目标检测(Cross-Domain Few-Shot Object Detection, CD-FSOD)场景中,这种纯文本驱动的方式面临着严重的语义-外观失配(Semantic-Appearance Mismatch)以及混淆上下文(Confusable Context)问题。为此,本文提出了多模态原型学习框架(Learns Multi-modal Prototypes, LMP),通过融合源域语义抽象与目标域特定外观细节,显著提升了跨域泛化能力。
双分支并行交互架构
LMP 搭建了一个双分支并行检测流水线:保持 GroundingDINO 原始的文本引导分支(Text-Guided Branch)以保留开放词汇泛化语义,同时引入全新的视觉引导分支(Visual-Guided Branch)。该视觉分支通过注入来自目标域少样本支持集的视觉原型,动态适应新域的外观特征,最终在推理阶段将两分支预测结果组合增强。
结构化视觉原型构建
不同于直接将原始支持图像作为无结构视觉提示的方案,LMP 设计了视觉原型构建模块(Visual Prototype Construction)。该模块不仅从支持集 RoI 特征中聚合成类级别正原型(Class-Level Prototypes),还创造性地在查询图像上通过目标框随机抖动产生动态硬负样本原型(Hard-Negative Prototypes),显式对目标域背景干扰物和局部重叠区域建模。
极简高效的训练机制
通过将正原型与硬负原型统一映射至同一个交叉注意力空间,模型可以直接在分类特征通道中学习区分真目标与易混淆背景。这一设计省去了额外的对比学习损失(Contrastive Loss),直接使用标准 Focal Loss 即可实现高判别力的特征选择与边界框精化。
🚀 重大突破:在包含 6 个极具视觉差异的跨域目标数据集上,LMP 在 1-shot 极度缺乏数据的设置下较 Baseline 实现了 8.0 mAP 的爆发性提升,平均 mAP 达到了 34.3。
🔍 背景与动机
跨领域少样本目标检测(CD-FSOD)的目标是将源域预训练检测器的泛化能力迁移至先前未见的全新目标域,且每个新类别仅提供少量(如 1/5/10 个)标注样本。在实际应用场景中,目标域与源域往往存在极大的数据分布偏移(Domain Shift)。
例如:从自然日常场景(如 MS-COCO)迁移到遥感俯瞰图像(如 DIOR)、卡通插画(如 Clipart1k)、工业金属表面缺陷(如 NEU-DET)或水下生物图像(如 DeepFish/UODD)时,物体的视角、渲染风格、纹理细节和背景噪声会发生剧烈变化。

现有基于 VLM 的开放词汇检测器在跨域少样本设置下暴露了两个系统性失效模式:
- 语义-外观失配:文本提示(如单词 "airplane")编码的是跨领域不变的高层语义概念。然而,自然图像中的飞机、遥感图像中的近正射俯视飞机以及卡通中的变形飞机,其低阶视觉特征存在天壤之别。仅靠文本无法约束模型对特定领域的几何形状和纹理细节产生精准定位。
- 混淆上下文:在极少样本(1-shot)场景下,缺少足够的正样本约束,大量与目标外观相似的背景区域或附近物体(如飞机跑道、水下泥沙纹理)极其容易触发误报(False Positives)。如果直接将原始支持图像作为视觉 Prompt 输入(如图 1(b) 所示),无结构的视觉特征会将非目标背景与类证据混杂在一起,无法有效消除干扰。
🎯 核心结论:针对上述痛点,LMP 框架利用少样本支持集提取领域自适应类原型,同时利用查询图像的随机框抖动生成硬负样本原型(如图 1(c) 所示),彻底解决了无结构视觉提示特征混杂的问题。
📊 数据集与实验环境
跨域测试基准数据集
为了全面验证 LMP 框架对不同分布偏移的适应能力,实验严格遵循 1st CD-FSOD Challenge(CD-ViTO 基准)的开源评估协议,在 6 个具备独特视觉特性的目标域数据集上展开测试:
- ArTaxOr:节肢动物分类数据集,包含自然写实高分辨昆虫图片,类别命名为粗粒度分类学名称(如 Coleoptera, Diptera),视觉纹理复杂。
- Clipart1k:卡通风格图像,具有高艺术化线条和夸张的几何形变。
- DIOR:光学遥感图像,具有近正射俯视角、目标尺度极小且背景复杂的特点。
- DeepFish:水下环境鱼类检测,具有低对比度、水体散射噪声及极小目标定位难题。
- NEU-DET:工业热轧钢带表面缺陷检测,背景为具有强纹理噪声的金属表面。
- UODD:水下障碍物检测,包含模糊浑浊的水下自然场景。
评估指标采用标准 mAP,在 1-shot、5-shot 与 10-shot 三种经典少样本设置下进行测评。
硬件与训练超参数设置
- 基础模型架构:以预训练的 GroundingDINO 为 Baseline,图像骨干网络采用 Swin-Transformer Base (Swin-B),文本编码器采用 BERT-base。
- 硬件平台:单张 NVIDIA GeForce RTX 3090 GPU (24 GB 显存)。
- 优化器与学习率:采用 AdamW 优化器,基础学习率设置为
1e-4,Weight Decay 设置为1e-4,Backbone 学习率衰减设置为1e-5。 - 训练策略与阶段:采取两阶段微调。微调第一阶段仅使用视觉损失
L_visual训练视觉引导分支;第二阶段使用联合总损失L_total联合微调两个分支。损失平衡系数alpha = 1.0,查询框数量N_q = 900,采样硬负样本数N = 3。
🛠️ 核心机制与研究方法

整体架构与双分支机制
LMP 系统的整体架构如图 2 所示。输入由少量支持集图像 与查询图像 组成。整个网络保留了GroundingDINO 的原始文本分支,并并行构建了视觉分支:
- 文本引导分支:接收类别名称文本,经由文本编码器投影为文本原型特征矩阵,引导图像特征增强与文本查询选择。
- 视觉引导分支:通过视觉原型构建模块合成包含正类与硬负类的视觉原型矩阵,并行经过视觉原型特征增强器、视觉引导查询选择与视觉解码器。
- 集成预测:在推理阶段,合并两分支生成的检测框与预测类别概率,实现领域不变语义与领域特定细节的补充。
视觉原型构建与硬负样本采样
类级别原型聚合
针对 -way -shot 设置,对于类别 的每个支持实例 ,从图像编码器的最低金字塔层级获取 RoI 提取特征,经过全局平均池化(GAP)得到特征向量。对同类别所有支持实例求均值并进行 归一化,得到类原型:
动态抖动盒难负样本生成
为了捕获目标域特定的易混淆背景,LMP 在训练阶段针对查询图像上的每个 Ground-Truth 框 ,进行随机缩放与偏移抖动。采样 个扰动框:
在公式 (1) 中, 表示抖动变换, 代表在区间 内均匀抽样的缩放比例, 代表在宽高边界 范围内抽样的二维中心偏移量。算法保留与原真实框交并比满足 的扰动框。这些框捕捉到了物体的局部边缘、背景交界及易混淆邻域。随后通过 RoIAlign 和 GAP 提取出对应的硬负原型特征:
在公式 (2) 中, 代表最低金字塔层级的查询图像特征,最终经过 归一化。拼接所有类原型与难负原型,得到统一的视觉原型序列:
其中 。
视觉原型精化与解码器设计
视觉原型特征增强器
获得视觉原型序列 和多尺度图像特征 后,两者输入至由 6 层 Self-Attention 与 Cross-Attention 堆叠的特征增强器中。图像特征与视觉原型相互交互,使图像特征感知特定领域的类外观,同时让原型吸收上下文信息,输出适配后的图像特征 与视觉原型 。
视觉引导的查询选择
给定原型增强后的图像 Token ,计算其与所有视觉引导 Token 的最大余弦相似度得分:
挑选得分最高的 Top- () 个索引作为查询种子,结合预测的动态锚框与可学习内容嵌入生成初始 Query。
视觉解码与双分支优化
视觉解码器包含 6 层 Transformer 解码层,每层顺序执行:
- Queries 之间的自注意力机制;
- 多尺度变形跨注意力(Multi-scale Deformable Cross-Attention)融合图像特征;
- 跨注意力机制融合适配后的视觉原型 ;
- 前馈神经网络(FFN)迭代更新边界框位置与类别得分。
分类预测通过计算 Query 嵌入与类视觉原型 的余弦相似度得出。硬负原型 不单独作为新类别,而是在交叉注意力注意力流中将混淆背景的激活拉低,通过标准 Focal Loss 显式惩罚假阳性误报。
📈 结果与深度分析
主实验对比分析
表 1 展示了 LMP 与代表性 FSOD 方法(如 TFA, FSCE, DeFRCN)、Vision-Language 方法(如 ViTDet-FT, Detic-FT, CD-ViTO)以及基于 GroundingDINO 的强 Baseline(ETS, Domain-RAG)在 6 大跨域数据集上的 mAP 综合对比:

💡 关键技巧:实验数据表明,LMP 在所有 shot 设置下均刷新了 SOTA 或取得了极具竞争力的成绩:
- 1-shot 平均 mAP 达到了 34.3,超越先前最佳方法 Domain-RAG(33.6)以及 Baseline GroundingDINO(26.3),实现了 +8.0 mAP 的巨大跃升;
- 5-shot 平均 mAP 达到 44.0(对比 GroundingDINO 40.4,提升 +3.6 mAP);
- 10-shot 平均 mAP 达到 46.6(对比 GroundingDINO 43.9,提升 +2.7 mAP)。
值得特别关注的是,在 ArTaxOr 数据集中,由于类别名均为高级分类学专业词汇(如 "Coleoptera" 鞘翅目),文本提示无法提供具体外观形状细节,传统文本基线表现极差(1-shot 仅 26.3 mAP)。引入 LMP 视觉原型后,1-shot 飙升至 58.5 mAP,提升超过 32 个百分点!
消融实验与超参数分析

通过图 3(a) 的消融柱状图可以看出:
- 仅使用纯文本原型的 Baseline 在各个域的表现受限;
- 加入类级别视觉原型后,6 个数据集的检测性能均得到稳定提升;
- 进一步叠加抖动盒难负样本原型后,获得了最佳表现,特别是在背景极其复杂的 DeepFish 和 NEU-DET 上表现尤为显著。
在超参数分析方面(图 3(b)):
- 难负样本采样数 :当每个 GT 框采样 个硬负样本时效果最好。当 增加到 5 时,冗余的负样本可能重叠过高,导致正向特征信号被过度稀释。
- 损失权重系数 :当平衡系数 时,视觉分支与文本分支达到最佳协同,兼顾开放词汇语义约束与领域特定细节。
特征隐空间与定性预测对比

图 4 展示了 ArTaxOr 隐空间的 t-SNE 可视化结果。三角形代表检测 Query 特征,圆形代表采样的难负样本特征。可以看出,难负样本精准地交织分布在不同类别的决策边界混淆区域。这证明了 LMP 能够主动学习边界上的可判别特征,而无需额外的对比损失约束。

定性对比图(图 5)进一步印证了 LMP 的强大定位能力:
- 在 Clipart1k 中,文本基线会将终端或背景建筑误检为巴士,而 LMP 成功滤除了背景杂物;
- 在 NEU-DET 工业表面缺陷检测中,LMP 准确区分了极易混淆的平坑与斑点缺陷;
- 在 DeepFish 水下低对比度场景中,LMP 大幅减少了小目标的漏检;
- 在 ArTaxOr 昆虫检测中,LMP 克服了重复框问题,输出了边界更加紧致的预测框。
局限性与未来展望
⚠️ 局限性:虽然 LMP 取得了优异性能,但其依赖于双分支同时运行,增加了推理阶段的计算开销与显存占用。此外,当少样本支持集包含非典型(Outlier)极度异常样本时,生成的类原型质量可能会有所下降。
未来研究方向包括:探究自适应原型剪枝与精炼机制、引入更轻量化的跨分支知识蒸馏(Distillation)将视觉分支能力压缩至单分支中部署,以及扩展 LMP 至视频少样本目标检测等更广阔的领域。