遥感大模型研究全景
从单一模态到多模态的演进与突破 | 2025年技术综述
📖 文章目录
一、引言 二、单一模态遥感基础模型 2.1 基础模型(图像理解) 2.2 图像分割模型 三、文本-图像多模态遥感模型 3.1 多模态基础模型 3.2 参考遥感图像分割(RRSIS) 四、前沿趋势与未来展望 五、总结一、引言
遥感技术作为对地观测的核心手段,正经历着一场由深度学习驱动的范式革命。从传统的基于手工特征的分类方法到如今的大规模基础模型,遥感智能解译的精度和泛化能力得到了质的飞跃。近年来,随着自监督学习、Transformer架构以及多模态对齐技术的成熟,遥感领域涌现出一批具有里程碑意义的基础模型。这些模型不仅能够从海量无标注遥感影像中学习通用视觉表征,还能通过文本、图像、时序等多模态信息的融合,实现更复杂的场景理解与推理能力。
本文旨在系统梳理遥感大模型领域的关键研究成果,涵盖单一模态(图像)基础模型、图像分割模型以及文本-图像多模态模型三大方向。我们将深入分析每个模型的核心创新点、技术架构、训练策略以及性能表现,并探讨其在实际应用中的潜力与局限。文章力求做到信息详实、观点独到,同时避免简单的文献堆砌,而是通过横向对比与纵向演进分析,揭示遥感基础模型发展的内在逻辑与未来趋势。
二、单一模态遥感基础模型
单一模态模型以遥感图像(光学、SAR、多光谱等)为主要输入,通过大规模预训练学习通用视觉特征。这一方向是遥感基础模型的基石,其核心挑战在于如何设计适合遥感图像特点的自监督任务(如尺度感知、多光谱、时间序列等)。
2.1 基础模型(图像理解)
本节介绍7个具有代表性的单一模态基础模型,它们在架构设计、预训练策略或数据集构建上各有创新。
1. RingMo: 遥感基础模型的先驱
发表时间:2022.7.28 | 论文:IEEE TGRS | GitHub:RingMo
RingMo(Remote Sensing Foundation Model)由华为与中科院团队联合提出,是遥感领域最早的大规模基础模型之一。其核心创新在于:第一,构建了一个包含200万张遥感图像的大规模数据集,覆盖全球多种地貌与地物类型;第二,针对遥感图像中目标密集、尺度差异大、背景复杂等特点,设计了专门的掩码图像建模(Masked Image Modeling, MIM)策略。RingMo采用Swin Transformer作为骨干网络,通过随机掩码掉图像中的部分patch并重建,迫使模型学习到丰富的上下文语义信息。实验表明,RingMo在场景分类、目标检测、语义分割等下游任务上均取得了显著的性能提升,尤其在小样本场景下优势明显。
- 大规模遥感专用数据集(2M images)
- 针对遥感场景优化的MIM策略(重叠掩码、多尺度重建)
- Swin Transformer骨干 + 分层特征提取
2. Advancing Plain Vision Transformer Towards Remote Sensing Foundation Model
发表时间:2023.1 | 论文:arXiv
该工作由北京航空航天大学团队提出,旨在探索普通Vision Transformer(ViT)在遥感基础模型中的潜力。与RingMo使用分层Swin不同,该研究坚持使用“plain” ViT(无金字塔结构),并发现通过适当的数据增强和预训练策略,普通ViT也能在遥感任务上达到SOTA。其核心贡献在于提出了一个名为“RS- ViT”的训练框架,包括:多尺度裁剪、随机擦除、以及针对遥感图像旋转不变性的数据增强。作者还公开了一个大规模遥感预训练模型(基于ImageNet-21K + 遥感数据),为后续研究提供了重要基线。
该工作的启示在于:并非所有的遥感任务都需要复杂的分层架构,简单的ViT配合精心设计的预训练策略同样可以取得优异效果,这为模型轻量化提供了思路。
3. SatMAE: 面向时序与多光谱的预训练Transformer
发表时间:2022.11 | 论文:NeurIPS 2023 | GitHub:SatMAE
SatMAE由斯坦福大学团队提出,是首个专门针对遥感图像时间序列和多光谱特性的掩码自编码器。其创新点在于:将时间维度和光谱维度纳入MIM框架。具体地,SatMAE将输入图像划分为时空-光谱patch,然后在预训练中随机掩码这些patch,并利用可见patch重建被掩码的多光谱时间序列。这种设计使得模型能够同时学习到地物的空间纹理、时间变化以及光谱特征。在作物类型分类、土地覆盖变化检测等任务上,SatMAE显著优于基于单帧图像的预训练方法。
# SatMAE核心思想示意(伪代码)
# 输入: 多光谱时间序列影像 (T, C, H, W)
# 划分patch: (T, C, H_p, W_p) -> 展平为序列
# 随机掩码: 掩码比例75%
# 重建目标: 预测被掩码patch的像素值(归一化)
# 损失: MSE between reconstructed and original patches
4. Scale-MAE: 尺度感知的掩码自编码器
发表时间:2023.6 | 论文:ICCV 2023
遥感图像具有显著的多尺度特性——同一地物在不同分辨率下呈现不同的形态。Scale-MAE针对这一问题提出了尺度感知的预训练策略。它采用多尺度输入(同时输入同一区域的不同分辨率图像),并通过交叉注意力机制融合不同尺度的特征。在预训练阶段,模型被要求同时重建所有尺度的掩码区域,从而学习到跨尺度的表征一致性。实验表明,Scale-MAE在多个遥感分割和检测基准上取得了领先性能,尤其擅长处理尺度变化剧烈的场景(如城市与农田交界处)。
5. A Billion-scale Foundation Model for Remote Sensing Images
发表时间:2023.8 | 论文:arXiv
该工作由百度研究院与武汉大学联合推出,提出了一个十亿参数级别的遥感基础模型(简称“Billion-scale RS Foundation Model”)。该模型基于ViT-Giant架构,在超过10亿张遥感图像(包含光学、SAR、多光谱)上进行预训练。为了处理如此大规模的数据,作者设计了一种分布式预训练框架,并采用了混合精度训练、梯度检查点等优化技术。该模型在场景分类、目标检测等任务上展现了惊人的泛化能力,甚至能够零样本迁移到某些未见过的遥感任务中。这是目前公开报道中参数规模最大的遥感基础模型之一。
| 模型 | 参数量 | 预训练数据 | 骨干网络 | 核心创新 |
|---|---|---|---|---|
| RingMo | ~200M | 2M RS images | Swin Transformer | RS专用MIM |
| SatMAE | ~300M | 1M multi-temporal | ViT-L | 时序+光谱MIM |
| Scale-MAE | ~400M | 1.5M multi-scale | ViT-L | 多尺度交叉注意力 |
| Billion-scale RS | 1B+ | 1B+ images | ViT-Giant | 超大规模预训练 |
6. SatlasPretrain: 大规模遥感图像理解数据集
发表时间:2023.3 | 论文:NeurIPS 2023 Datasets | GitHub:Satlas
SatlasPretrain由Allen AI研究所发布,其核心贡献并非一个新模型,而是一个大规模、高质量的多任务遥感预训练数据集。该数据集包含超过3亿个标注样本,覆盖场景分类、语义分割、实例分割、目标检测等7类任务。SatlasPretrain的独特之处在于:所有标注均由专业地理空间分析师手工完成,质量极高;同时提供了统一的基准评估框架。该数据集已成为遥感基础模型评估的重要标准,许多后续模型都采用SatlasPretrain进行预训练或微调。
7. Towards Geospatial Foundation Models via Continual Pretraining
发表时间:2023.6 | 论文:ICML 2023
该工作探讨了如何通过持续预训练(Continual Pretraining)将通用视觉基础模型(如CLIP、DINOv2)迁移到遥感领域。作者发现,直接在遥感数据上持续预训练通用模型,可以显著提升其在遥感任务上的表现,同时保留通用视觉能力。他们提出了一种混合持续预训练策略:在通用数据(如ImageNet)和遥感数据之间交替训练,并引入弹性权重巩固(EWC)防止灾难性遗忘。这一思想为后续多模态模型的研究奠定了基础。
2.2 图像分割模型
图像分割是遥感应用中最核心的任务之一,包括语义分割、实例分割、全景分割等。SAM(Segment Anything Model)的出现为遥感分割带来了新的范式——从传统的全监督训练转向基于提示的分割。本节介绍5个代表性工作。
1. SAMRS: 利用SAM扩展遥感分割数据集
发表时间:2023.8 | 论文:arXiv
SAMRS的核心思想是:利用SAM强大的零样本分割能力,自动为遥感图像生成高质量的分割标注,从而低成本地构建大规模遥感分割数据集。具体地,作者将遥感图像输入SAM,通过调整提示点密度和IoU阈值,生成多尺度、多类别的分割掩码。然后通过人工校验和自动过滤,筛选出高质量标注。最终构建了包含50万张遥感图像、超过2亿个分割掩码的SAMRS数据集。实验证明,在该数据集上训练的模型在多个遥感分割基准上取得了与完全人工标注相当甚至更好的性能。
2. RSPrompter: 基于提示的遥感实例分割
发表时间:2023.10 | 论文:NeurIPS 2024
RSPrompter将SAM的提示学习范式引入遥感实例分割。不同于SAM需要手动提供点或框作为提示,RSPrompter设计了一个轻量级的提示生成器,能够自动从遥感图像中学习生成高质量的提示。该提示生成器采用可变形注意力机制,能够适应遥感目标的不同形状和方向(如旋转的建筑物、弯曲的道路)。在多个遥感实例分割数据集上,RSPrompter超越了传统的两阶段检测器(如Mask R-CNN)和SAM的零样本结果。
3. The Segment Anything Model (SAM) for Remote Sensing Applications: From Zero to One Shot
发表时间:2023.9 | 论文:IEEE GRSM
这是一篇深度综述性文章,系统评估了SAM在不同遥感任务中的表现,包括语义分割、变化检测、目标提取等。作者发现,SAM在遥感场景中表现出“零样本”能力,但精度受限于遥感图像的复杂背景和尺度变化。他们提出了“one-shot”微调策略:仅需少量标注样本(如每类5-10个),即可显著提升SAM在遥感任务上的性能。该工作为SAM在遥感领域的应用提供了实用指南。
4. RingMo-SAM: 多模态遥感图像分割基础模型
发表时间:2024.1 | 论文:arXiv
RingMo-SAM是华为与中科院在RingMo基础上的进一步扩展,将SAM的思想引入多模态遥感图像(光学+SAR+多光谱)。其核心创新在于:设计了多模态特征融合模块,将不同模态的图像对齐到同一特征空间,然后输入SAM的分割头。该模型在光学-SAR联合分割、多光谱土地覆盖分类等任务上取得了SOTA性能,尤其擅长处理云遮挡或夜间场景下的分割任务。
5. SAM-Assisted Remote Sensing Imagery Semantic Segmentation with Object and Boundary Constraints
发表时间:2024.3 | 论文:IEEE TGRS
该工作针对遥感语义分割中的边界模糊问题,提出利用SAM来辅助边界学习。具体地,作者从SAM生成的高质量掩码中提取物体边界先验,并将其作为额外的约束条件加入分割网络的损失函数中。同时设计了一个边界增强模块,利用SAM的边界注意力图来细化分割结果。在ISPRS Vaihingen和Potsdam数据集上,该方法在边界区域的IoU提升了约5个百分点。
三、文本-图像多模态遥感模型
多模态模型将视觉与语言信息融合,使得遥感解译从单纯的“看图说话”升级为“理解与推理”。这类模型通常采用对比学习(如CLIP)或生成式预训练(如GPT)范式,在遥感领域展现出巨大的潜力。
3.1 多模态基础模型
1. RemoteCLIP: 遥感领域的视觉-语言基础模型
发表时间:2023.6 | 论文:ICCV 2023 | GitHub:RemoteCLIP
RemoteCLIP是首个专门针对遥感场景的视觉-语言对比学习模型。它基于CLIP架构,但在预训练数据上做了关键改进:收集了超过10万对遥感图像-文本描述对,文本描述由遥感专家撰写,包含地理实体、空间关系、场景语义等信息。RemoteCLIP在遥感图像检索、零样本分类、视觉问答等任务上表现优异,尤其擅长处理“细粒度”的遥感概念(如“带有蓝色屋顶的工业建筑”)。该工作开源了模型权重和数据集,推动了遥感多模态研究的发展。
“RemoteCLIP证明了视觉-语言预训练在遥感领域的有效性,使得零样本遥感理解成为可能。” —— 论文摘要
2. RS5M: 大规模遥感视觉-语言数据集
发表时间:2023.10 | 论文:NeurIPS 2024 Datasets
RS5M是一个包含500万对遥感图像-文本描述的大规模数据集,由中国科学院团队构建。其数据来源包括谷歌地球、Bing Maps、以及社交媒体上的地理标签图像。文本描述通过多模态大模型(如BLIP-2)自动生成,并经过人工筛选。RS5M的规模是RemoteCLIP数据集的50倍,为训练更大规模的多模态模型奠定了基础。基于RS5M预训练的模型在多个遥感理解任务上取得了当时的最佳结果。
3. RSGPT: 遥感生成式预训练模型
发表时间:2023.12 | 论文:arXiv
RSGPT将大语言模型(LLM)与遥感视觉编码器结合,实现了遥感图像的生成式理解。它采用Q-Former作为视觉-语言连接器,将遥感图像特征映射到LLM的输入空间,然后通过指令微调(Instruction Tuning)让模型学会执行多种遥感任务,如场景描述、目标计数、变化解释等。RSGPT在RSVQA和UCM-Caption等基准上展现了强大的多任务能力,甚至能够进行简单的遥感推理(如“为什么这片区域的植被减少了?”)。
4. GeoChat: 面向遥感的地面化大视觉语言模型
发表时间:2024.2 | 论文:CVPR 2024
GeoChat是首个将“空间定位”能力融入遥感视觉-语言模型的尝试。它不仅能够回答关于遥感图像的问题,还能在图像中定位出所描述的对象(即“指代分割”)。GeoChat采用了一个新颖的“空间感知解码器”,在生成文本的同时输出分割掩码。该模型在RSVQA-Loc和RefCOCO-remote等数据集上取得了领先的指代分割性能,标志着遥感多模态模型从“理解”向“交互”的迈进。
5. REMOTE SENSING VISION-LANGUAGE FOUNDATION MODELS WITHOUT ANNOTATIONS VIA GROUND REMOTE ALIGNMENT
发表时间:2024.5 | 论文:arXiv
该工作提出了一种无需人工标注的遥感视觉-语言模型训练方法,称为“Ground Remote Alignment”。其核心思想是利用地理空间数据(如OpenStreetMap标签、GPS坐标)作为弱监督信号,自动对齐遥感图像与文本描述。例如,将一张带有GPS坐标的遥感图像与对应地点的维基百科描述进行匹配,从而构建图像-文本对。这种方法大大降低了多模态数据的构建成本,在零样本遥感分类和检索任务上取得了与有监督方法相当的性能。
| 模型 | 视觉编码器 | 语言模型 | 预训练数据 | 核心能力 |
|---|---|---|---|---|
| RemoteCLIP | ViT-L | Text Transformer | 10万对 | 零样本分类/检索 |
| RSGPT | ViT-G | LLaMA-7B | 500万对+指令 | 生成式问答/描述 |
| GeoChat | ViT-L | LLaMA-13B | 200万对 | 指代分割+问答 |
| Ground Remote | ViT-L | BERT | 1亿对(自动) | 零样本对齐 |
3.2 参考遥感图像分割(RRSIS)
参考遥感图像分割(Referring Remote Sensing Image Segmentation, RRSIS)是近年兴起的新任务,要求模型根据自然语言描述(如“位于图像左上角的白色建筑物”)分割出对应的目标。这一任务将视觉-语言理解与像素级分割相结合,具有重要的应用价值。
1. RRSIS: 参考遥感图像分割
发表时间:2024.3 | 论文:CVPR 2024
该工作首次正式定义了RRSIS任务,并构建了专用的基准数据集(包含5万张遥感图像和对应的指代描述)。作者提出了一个基于Transformer的基线模型,该模型将文本特征与图像特征通过交叉注意力融合,然后使用轻量级分割头生成掩码。实验发现,遥感场景中的指代分割比自然图像更具挑战性,因为遥感图像中物体密集、方向多变,语言描述往往需要包含空间关系(如“南侧的建筑”)。该工作为RRSIS的研究奠定了基础。
2. Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation
发表时间:2024.6 | 论文:IEEE TGRS
针对遥感目标具有旋转不变性的特点,该网络引入了旋转自适应模块和跨尺度交互机制。旋转自适应模块通过可学习的方向编码,使模型能够理解“旋转45度的房屋”等描述;跨尺度交互机制则融合了多尺度特征,以应对遥感图像中目标大小的剧烈变化。在RRSIS基准上,该方法在分割精度和推理速度上均取得了SOTA。其核心公式可概括为:
F_multi = CrossScaleFusion(F_low, F_mid, F_high) # 多尺度融合
F_rot = RotAttn(F_multi, theta) # 旋转注意力
mask = SegHead(F_rot, text_features) # 分割头
四、前沿趋势与未来展望
从上述梳理可以看出,遥感大模型正朝着以下方向发展:
- 多模态深度融合: 视觉、语言、光谱、时序、SAR等模态的联合预训练成为主流,GeoChat和Ground Remote Alignment代表了两种不同路径。
- 模型轻量化与高效部署: 十亿参数模型虽强,但推理成本高。近期出现了基于知识蒸馏、量化、剪枝的轻量化遥感模型研究,如“RemoteDistill”系列。
- 可解释性与可靠性: 遥感应用对模型的可解释性要求较高,如何让模型“说出”其判断依据(如“识别为农田是因为有规则的纹理”)成为研究热点。
- 持续学习与自适应: 遥感数据随时间变化(如城市扩张、季节变化),模型需要具备持续学习能力,避免灾难性遗忘。
- 生成式遥感: 利用扩散模型或GAN生成高保真遥感图像,用于数据增强或模拟极端场景(如灾害前后对比)。
五、总结
本文系统梳理了遥感大模型领域的重要研究成果,从单一模态的基础模型到多模态的视觉-语言模型,再到参考分割等新兴任务,展现了这一领域的快速演进。RingMo、SatMAE、Scale-MAE等模型在图像理解上奠定了坚实基础;SAMRS、RSPrompter等则推动了分割范式的变革;而RemoteCLIP、RSGPT、GeoChat等将遥感智能推向了多模态推理的新高度。尽管仍存在数据标注成本高、模型泛化性不足、计算资源消耗大等挑战,但遥感大模型无疑正在重塑我们对地球的观测与理解方式。未来,随着更多创新技术的涌现,遥感大模型将在智慧城市、精准农业、灾害应急、气候变化研究等领域发挥不可替代的作用。
—— 本文基于公开研究资料整理,观点仅代表作者个人思考。
