💡 核心创新点
传统的遥感大模型(RSFMs)在面对农业制图任务时,往往表现得差强人意。其核心瓶颈在于:多数模型要么为了计算效率完全放弃了时间维度的建模,要么采用基于 Vision Transformer (ViT) 的固定大小分块(如 16x16 补丁),这直接导致了边界信息丢失和空间结构破坏。针对这一行业痼疾,本文提出了 AgriFM 模型,实现了遥感基础模型在农业制图领域的重大技术突破。
AgriFM 的核心创新主要体现在以下三个方面:
- 同步时空下采样机制(Synchronized Spatiotemporal Downsampling):AgriFM 在 Video Swin Transformer 的主干网络中,首次引入了空间与时间同步下采样策略。该机制不仅能自适应地处理长度从 3 到 32 个时间步不等的卫星时间序列,还能在多尺度上完美保留农作物的细微空间边界与独特的物候特征。
- 地理先验弱监督预训练(Land Cover Fraction Supervision):不同于主流的掩码图像建模(MIM)或对比学习(CL),AgriFM 直接利用全球地表覆盖产品 GLC_FCS30D 提取的土地覆盖丰度(Fraction)作为监督信号。这种做法直接赋予了模型深厚的地理常识,大幅提升了模型的收敛速度与特征表征的鲁棒性。
- 非对齐多传感器融合技术:AgriFM 彻底打破了“多源遥感融合必须在输入端空间对齐”的严格假设。它通过将 MODIS、Landsat-8/9 和 Sentinel-2 数据通过独立的 3D 卷积嵌入模块转化至统一的通道维度,在特征层面实现了高效的跨传感器联合训练。

🔍 背景与动机
农业遥感制图的“多尺度时空谜题”
随着全球气候变化与人口增长的加剧,精准的农业制图已成为维护全球粮食安全的核心支柱。然而,要真正做好这一任务,算法必须解开一个复杂的“多尺度时空谜题”:
- 在空间尺度上,农田地块边界可能小至数米,要求算法具备极高的细粒度局部感知能力;
- 在时间尺度上,农作物生命周期极短,需要模型在数月甚至数周的窗口内,精准捕捉其快速变化的物候(如返青、抽穗、成熟和收获)。
🎯 核心结论:单纯的空间 CNN 无法建模时间维度上的物候轨迹,而传统的三维卷积(3D CNN)或循环神经网络(LSTM)由于计算效率和参数量限制,难以实现大范围的扩展与泛化。
近年崛起的遥感基础模型(RSFMs)虽然带来了参数规模化的曙光,但 ViT 的侵入式下采样导致像素级分类效果惨淡,农田边界往往呈现出一片模糊。因此,开发一款兼具 分层多尺度空间感知 与 动态变长时序对齐 能力的农业专用遥感大模型,是学术界与工业界迫在眉睫的共同期盼。
📊 数据集与实验环境
为了训练和验证所提出模型的有效性,作者构建并收集了极其庞大的数据集体系,涵盖了多源预训练和多样化的下游任务。
全球代表性地标覆盖先验
AgriFM 在全球范围内构建了一个包含超过 25,244,211 张影像 的多源时序预训练数据集,其数据分布涵盖:
- MODIS (250 m & 500 m): 提取了 2020 至 2022 年间共 51,964 条时序轨迹,包含 1,574,451 张图像;
- Landsat-8/9 (30 m): 提取了 2022 年 335,985 条包含 6 个光谱波段的时序轨迹,共计 13,392,029 张图像;
- Sentinel-2 (10 m & 20 m): 包含 2021 和 2022 年 345,843 条具有 10 个光谱波段的时序轨迹,共计 10,277,731 张图像。
在预训练阶段,影像大小被裁剪为 224×224 像素。监督信号源自全球 30 米分辨率的土地覆盖变化监测产品 GLC_FCS30D,提取出包括作物、森林、灌木、草地等在内的 8 种主要土地覆盖类别的面积丰度。
在微调阶段,模型在 ARA 地区、季风亚洲和亚洲其他地区,针对 5 类复杂的制图任务进行了极限验证:

实验环境与超参数设置
为了确保预训练和下游微调的稳定进行,实验团队在高性能硬件和标准训练流程下开展了工作:
- 硬件平台:预训练在 10 张 NVIDIA L40 (48GB) 显卡上进行;下游微调在 4 张 L40 显卡上执行。
- 预训练超参:采用 AdamW 优化器,基础学习率为
1e-5,经过 5000 次温和启动(Warm-up)阶段后逐步衰减,训练共持续 50 epochs。单卡 batch size 设为 80。 - 微调超参:统一设置学习率为
6e-5,batch size 设置为 16,训练迭代 50 epochs,同时引入了硬样本挖掘(Hard Sample Mining)技术来缓解农业类别不平衡的问题。
🛠️ 核心机制与研究方法
AgriFM 的核心架构如图 2 所示。整个处理流程在设计上实现了高度的优雅与极佳的可扩展性,能够有效应对异构遥感数据的特征提取工作。

统一时空建模框架体系
1. 同步时空下采样机制(Synchronized Spatiotemporal Downsampling)
在传统的三维 Swin 架构中,空间下采样通常是通过拼贴和线性投影(Patch Merging)来实现的,而时间维度的下采样往往被忽视。AgriFM 彻底改变了这一点,在不同阶段的交界处,使用同步时空下采样将特征维度的压缩同步推向空间和时间:
这里,(4) 严格规范了特征图尺寸在阶段跃迁时的演变。其中, 表示时间下采样因子(通常设置为 2), 表示空间下采样率(设置为 2)。
💡 关键技巧:在输入短序列时,时间下采样因子会自动退化。这一设计使得原本可能由于时序缺失导致前向传播崩溃的问题得到了根本性的解决,让极短的时序影像能够被无缝地送入多层网络处理。
2. 弱监督地表覆盖丰度头(Supervised Land Cover Fraction Heads)
不同于自监督大模型中昂贵的解码重建,AgriFM 直接在 Stage 4 提取的深层三维张量 上执行时空全局平均池化(Spatiotemporal Global Average Pooling),将其高度浓缩为一维特征向量 :
在公式 (5) 中, 分别代表最终特征图的时间帧数、高度和宽度。得到的向量 通过一个轻量化的多层感知机(MLP)和 Sigmoid 激活函数,直接输出模型对 8 大类地物所占比例的预测值。这种设计显著降低了计算和收敛复杂度。
3. 多传感器特征对齐与Mean-Teacher框架
由于遥感产品的真值标签往往带有局限性与时间滞后误差,弱监督预训练非常容易被标注噪声污染。AgriFM 整合了 Mean-Teacher(均值教师)机制来抑制标签噪音的影响。教师模型参数 通过指数移动平均(EMA)的方式,从学生模型的权重 中继承而得:
利用公式 (9),衰减系数 被严格设定为 0.999。通过学生与教师之间的持续对齐和温和的一致性损失,AgriFM 在全球地理大尺度预训练中展现出了极强的抗噪和自适应收敛特性。
多功能解码器:支持下游多元化制图任务
针对不同的下游应用(如地块边界、作物类型等),AgriFM 专门配备了Versatile Decoder(多功能解码器)。该解码器具有以下三大核心特点:
- 分层特征跨尺度跳跃连接(Skip Connections):将骨干网络中 Stage 1、Stage 2、Stage 3、Stage 4 的多尺度特征图与上采样特征融合,确保精细的空间纹理特征不丢失;
- 时空重组操作(Rearrange):在解码上采样前,首先将时序特征通过转置和张量重排的方式,优雅地融合进通道(Channel)维度,以在不损失物候信息的前提下,进行高精度的逐像素空间恢复;
- 任务无关对齐设计:仅需微调最末端的线性分类映射层,即可在同样的骨干结构下,灵活支持从单类回归到复杂精细多分类的广泛下游需求。
📈 结果与深度分析
主干网络与预训练效果评估
AgriFM 在多项最具挑战性的农业下游任务上展现出了堪称惊艳的优异性能。在 Sentinel-2 时序数据下开展的农田范围制图和边界提取任务中,AgriFM 相比基线方法表现卓越。

在定量结果方面,我们能直观看到 AgriFM 的代际领先优势:

从数据中可以看出,AgriFM 取得了 83.09% 的正类别 F1-score 和 84.61% 的总体准确率 (OA)。相比以往最顶尖的遥感 Swin 架构(如 GFM 的 81.06% F1),取得了超越 2 个百分点的绝对领先,更远远将各种主流 ViT 基础大模型(如 Prithvi 73.69% F1,SMARTIES 74.76% F1)抛在身后。
而在针对粗空间分辨率(250 m)物候提取的 MODIS 冬小麦制图任务中,AgriFM 的跨尺度、深时序特征表达能力再次得到了验证:

🚀 重大突破:在包含 11 个时间步的极低空间分辨率场景下,AgriFM 以 75.85% 的 F1-score 占据统治地位。而由于 ViT 的 16x16 补丁破坏了混合像元原本就十分脆弱的空间连续性,ViT-b 在该任务上直接溃败至 66.61% F1。
消融实验与泛化性验证
根据消融实验结果(如表 9 和表 10 所示),我们能清晰还原 AgriFM 的成功轨迹:
- Mean-Teacher 与地表覆盖弱监督训练在大部分任务中带来了约 1.5% - 2.5% 的绝对 F1 涨幅,充分证明了地理先验的价值;
- 同步时空下采样 在保持高精度的同时,在不同下游任务中释放了恐怖的效率优势:缩短了 40% - 45% 的训练时间,同时降低了将近 60% - 70% 的计算 FLOPs(如农田提取任务中计算开销由 804G 暴跌至 256G)。
⚠️ 局限性:虽然 AgriFM 在大部分边界提取任务中取得了领先,但当农田地块极度破碎、或在森林边界等混合地物严重混淆的区域,像素语义分割在连续边界提取的保证上仍显吃力。未来的研究工作将探索融合矢量拓扑损失(Topology Loss)来进一步克服此瓶颈。
⚠️ 局限性2这篇文章的核心问题是训练数据过少,模型结果不可信。