遥感基础模型与通用智能体:迈向自主感知决策的遥感影像处理新范式
Remote Sensing Foundation Models and Generalist Agents: A New Paradigm toward Autonomous Perception and Decision
——从像素理解到语义推理,重塑遥感影像分析的认知边界
📄 摘要
遥感影像处理正经历从“专用小模型”向“通用基础模型”的范式跃迁。以视觉Transformer、自监督预训练与多模态对齐为核心驱动,遥感基础模型在场景分类、语义分割、变化检测等任务中展现出强大的泛化能力。然而,基础模型本身仍是“感知工具”,缺乏面向复杂任务的自主规划与闭环推理能力。本文评述:笔者认为,将基础模型与智能体架构深度融合,构建“感知-推理-决策-执行”一体化的遥感通用智能体,是突破当前瓶颈的关键方向。本文系统梳理了遥感基础模型的技术脉络,从数据、架构、预训练策略到评估体系进行全景式剖析;进而引入智能体范式,探讨大语言模型驱动的任务规划、工具调用与记忆机制如何赋予遥感系统以类人推理能力;最后提出“遥感通用智能体”的概念框架与技术路线图,并对未来挑战进行预判。全文贯穿一条核心主线:从“看图识字”到“知地明理”,遥感智能必须完成从感知到认知的跃升。
📑 文章目录
1. 引言:遥感智能的十字路口
遥感技术自20世纪60年代兴起以来,已从航空摄影测量发展为覆盖光学、SAR、高光谱、LiDAR等多模态的天-空-地一体化观测体系。据国际对地观测组织GEO统计,全球在轨对地观测卫星已超过1100颗(截至2024年),每日产生PB级影像数据。然而,数据洪流并未自动转化为决策智慧——传统遥感影像处理长期依赖人工特征工程与任务特定小模型,形成“数据丰富、信息贫乏”的困局。
2020年以来,以视觉Transformer(ViT)和自监督学习为代表的通用AI技术浪潮深刻重塑了这一格局。遥感基础模型(Remote Sensing Foundation Models, RSFMs)的涌现,标志着遥感智能从“手工作坊”走向“工业化生产”。这类模型通过在海量无标注遥感数据上预训练,学习通用的空间-光谱-时序表征,再通过微调适配下游任务。代表性工作如NASA-IBM的Prithvi、ESA的PhilEO、中科院空天院的RingMo及武汉大学的SkySense等,已在场景分类、语义分割、变化检测等任务上刷新了性能记录。
然而,本文评述:基础模型的成功恰恰暴露了更深层的局限——它们本质上是“被动的感知器”,缺乏主动推理、任务规划与闭环决策能力。当用户提出“评估2023年土耳其地震对马拉蒂亚城区建筑损毁程度,并生成救援优先级地图”这类复合需求时,单一基础模型无法自主完成从影像检索、变化检测、损毁分级到报告生成的全链条任务。这正是通用智能体(Generalist Agent)范式的用武之地。
笔者认为,遥感领域正站在一个关键十字路口:将基础模型的感知能力与智能体的推理-行动能力相结合,构建“遥感通用智能体”,是实现从“遥感数据”到“决策知识”质变的核心路径。本文旨在为这一新兴交叉领域提供一份系统的技术地图。全文贯穿一条分析主线:遥感智能必须完成从“看图识字”(像素级感知)到“知地明理”(语义级认知与推理)的跃升,而基础模型与智能体的融合是实现这一跃升的必经之路。
2. 遥感基础模型:技术全景与深度解构
2.1 数据引擎:从ImageNet到亿级遥感样本
基础模型的性能上限首先取决于预训练数据的规模、多样性与质量。计算机视觉领域长期依赖ImageNet-1K(约120万张自然图像)作为基准,但遥感影像具有俯瞰视角、多光谱通道、大幅面尺寸及地理上下文等独特属性,直接迁移自然图像预训练模型存在严重的领域偏移(Domain Shift)。
近年来,多个大规模遥感数据集相继发布,为RSFMs奠定了数据基础。下表梳理了代表性数据集的关键特征:
表1:代表性遥感预训练数据集概览(数据来源:各数据集原始论文及技术报告,整合数据)
笔者认为,数据集的规模竞赛固然重要,但更值得关注的是数据的“语义密度”与“地理多样性”。以BigEarthNet为例,其多标签标注策略(每个图斑可同时包含“农田”“灌溉”等多个标签)更贴近真实地理场景的语义模糊性,这比单标签分类更具生态效度。然而,当前多数数据集仍以欧洲、北美为主,全球南方(Global South)的地表覆盖类型、农业模式与城市形态严重欠采样,这可能导致基础模型在跨区域泛化时出现系统性偏差——这是笔者在审阅相关文献时深感忧虑的问题。
2.2 架构演进:CNN的遗产与ViT的崛起
遥感影像分析的深度学习架构经历了从卷积神经网络(CNN)到视觉Transformer(ViT)的范式转换。CNN凭借局部感受野、平移等变性与参数共享,长期占据遥感影像分类与分割的主流。ResNet-50/101曾作为标准骨干网络被广泛使用,DeeplabV3+与U-Net的编码器-解码器结构在语义分割任务中表现稳健。
2020年Dosovitskiy等人提出ViT后,遥感领域迅速跟进。ViT将影像切分为固定大小的Patch,通过自注意力机制建模全局上下文,天然适合遥感影像中“大尺度空间依赖”的特性——例如,一个城市街区的功能识别需要同时观察道路网络、建筑密度与植被分布,这正是自注意力的优势所在。
然而,本文评述:ViT并非遥感影像的万能解药。其二次计算复杂度(O(N²))在处理大幅面遥感影像时面临严峻挑战。为此,研究者提出了多种高效变体:Swin Transformer通过移位窗口机制将复杂度降至线性,CSWin引入十字形窗口注意力,而RVSA(Remote Sensing Vision Transformer with Adaptive window)则专门针对遥感目标的方向任意性设计了旋转可变窗口。笔者认为,架构选择的本质是在“全局上下文建模”与“计算可行性”之间寻求平衡,不存在放之四海皆准的最优架构。
值得关注的是,2024年以来,状态空间模型(SSM)如Mamba开始在遥感领域崭露头角。Mamba通过选择性扫描机制实现线性复杂度序列建模,在保持全局感受野的同时大幅降低计算开销。南京大学团队提出的RS-Mamba已在多个遥感基准上展现出与ViT相当甚至更优的性能(Zhao et al., 2024, arXiv预印本)。笔者认为,SSM类架构有望成为遥感基础模型的下一个突破点,但其在预训练阶段的扩展性与稳定性仍需大规模验证。
2.3 预训练策略:掩码、对比与多模态交响
预训练策略是基础模型的核心技术要素,决定了模型从无标注数据中学习何种表征。当前遥感基础模型的预训练策略可归纳为三大范式:
(1)掩码图像建模(Masked Image Modeling, MIM)。受BERT启发,MIM随机遮蔽影像Patch并训练模型重建被遮蔽内容。代表性方法MAE(Masked Autoencoder)以75%的高掩码率迫使模型学习影像的语义先验。遥感领域,SatMAE利用多光谱影像的波段相关性改进掩码策略,Cross-Scale MAE则引入多尺度重建目标以捕获遥感影像的跨尺度特征。笔者认为,MIM的优势在于其“生成式”本质——模型必须理解影像的底层结构才能完成重建,这使其学到的表征具有较强的鲁棒性。但其局限在于,重建目标(像素值)与下游语义任务之间存在“目标错位”,模型可能过度关注纹理细节而忽略高层语义。
(2)对比学习(Contrastive Learning)。通过拉近正样本对、推远负样本对来学习判别性表征。SimCLR、MoCo等经典框架已被广泛适配至遥感领域。遥感对比学习的独特挑战在于正负样本的定义——地理空间中的“语义相似性”远比自然图像复杂。例如,两张不同城市的“商业区”影像在像素层面可能差异巨大,但在语义层面高度相似。为此,Geo-aware Contrastive Learning引入地理距离作为弱监督信号,Seasonal Contrast则利用时序影像的季节变化构建正样本对。本文评述:对比学习的核心瓶颈在于负样本的“假阴性”问题——在遥感场景中,两个被随机配对的影像可能恰好属于同一语义类别,将其作为负样本会损害表征质量。这一问题的缓解策略(如基于聚类的负样本筛选)仍是活跃研究前沿。
(3)多模态对齐(Multi-modal Alignment)。遥感影像天然具有多模态属性——同一地理区域可同时获取光学、SAR、高光谱影像,并可与文本描述、地图数据、社交媒体信息关联。CLIP(Contrastive Language-Image Pre-training)开创的视觉-语言对齐范式启发了RemoteCLIP、GeoRSCLIP等工作,它们通过将遥感影像与地理文本描述映射到共享嵌入空间,赋予模型“看图说话”和“按文索图”的能力。笔者认为,多模态对齐是遥感基础模型走向“可交互”的关键一步——它使得非专业用户也能通过自然语言与遥感数据对话,极大降低了使用门槛。然而,当前遥感-语言对齐的数据规模与质量远逊于自然图像领域(CLIP使用了4亿图文对,而最大的遥感图文对数据集仅百万级别),这是制约该方向发展的首要瓶颈。
2.4 评估体系:基准、指标与开放问题
科学、全面的评估体系是推动遥感基础模型健康发展的基石。当前评估实践存在以下特征与问题:
在基准数据集层面,UCMerced、AID、NWPU-RESISC45等场景分类基准已被广泛使用,但其规模(数千至数万张)与多样性已难以充分区分现代基础模型的性能差异。EuroSAT、BigEarthNet等Sentinel-2基准引入了多光谱信息,但类别体系仍以粗粒度土地覆盖为主。笔者注意到,现有基准普遍缺乏对“细粒度语义”(如区分不同作物品种、建筑风格)和“动态过程”(如城市扩张速度、植被物候变化)的评估能力。
在评估协议层面,线性探测(Linear Probing)与微调(Fine-tuning)是两种主流范式。线性探测通过在冻结的预训练特征上训练线性分类器来评估表征质量,计算高效但可能低估模型的真实潜力;微调则允许全部参数更新,性能上限更高但计算成本大,且不同微调策略(如是否使用Layer-wise Learning Rate Decay)会显著影响结果可比性。笔者认为,领域亟需建立标准化的评估协议,包括统一的微调配置、数据划分与指标报告规范,否则“刷榜”式的性能竞赛将损害研究的可复现性。
更值得深思的是,当前评估几乎完全聚焦于“静态快照”式的精度指标(Overall Accuracy, mIoU, F1-score),而忽视了模型在实际部署中的关键品质:鲁棒性(对云覆盖、季节变化、传感器差异的容忍度)、校准性(预测置信度与真实准确度的匹配程度)与公平性(跨地域、跨社会经济条件的性能一致性)。2023年Nature Geoscience的一篇评论文章(Tuia et al., 2023)尖锐指出,遥感AI研究正陷入“精度陷阱”——在标准基准上不断刷新SOTA,却在真实世界应用中表现脆弱。笔者认为,这一批评切中要害,评估体系的革新应成为未来研究的优先议程。
3. 通用智能体:从感知到行动的范式跃迁
3.1 智能体核心架构:大脑、记忆与工具
“智能体”(Agent)概念在人工智能领域有着悠久历史,但大语言模型(LLM)的突破赋予了这一概念全新的技术内涵。以GPT-4、Claude、Gemini等为代表的LLM展现出强大的推理、规划与工具使用能力,使得构建“自主智能体”成为可能。2023年以来,AutoGPT、MetaGPT、CrewAI等智能体框架引发了广泛关注,其核心架构可抽象为三个关键组件:
大脑(Brain):通常由一个或多个LLM担任,负责理解用户意图、分解任务、制定计划并进行推理。LLM的链式思维(Chain-of-Thought)能力使其能够将复杂查询逐步拆解为可执行的子任务。笔者认为,LLM的推理能力是智能体区别于传统“管道式”系统的本质特征——它不是按照预设流程执行,而是根据上下文动态调整策略。
记忆(Memory):包括短期记忆(当前会话的上下文窗口)与长期记忆(外部向量数据库或知识图谱)。记忆机制使智能体能够积累经验、避免重复错误,并在跨会话任务中保持一致性。遥感场景中,地理空间知识(如“武汉位于长江与汉江交汇处”)可被编码为结构化记忆,辅助空间推理。
工具(Tools):智能体通过API调用外部工具来扩展自身能力边界——搜索引擎获取实时信息,代码解释器执行数值计算,专用模型完成图像分析。这正是基础模型与智能体融合的关键接口:遥感基础模型可作为“视觉工具”被智能体按需调用。
💡 核心洞察:智能体范式的革命性在于,它将“能力组合”的控制权从开发者转移到了模型自身。传统遥感系统中,开发者预先定义“先做变化检测,再做损毁分级”的固定流程;而在智能体架构中,LLM根据用户查询自主决定调用哪些工具、以何种顺序执行。这种灵活性是应对开放域、复杂遥感任务的必要条件。
3.2 遥感智能体的独特挑战
将通用智能体架构迁移至遥感领域,面临一系列独特挑战,这些挑战源于遥感数据与任务的固有特性:
空间推理鸿沟。LLM的推理能力主要建立在文本语料之上,其对地理空间关系的理解极为有限。当用户查询“分析长江三角洲2015-2023年城市扩张对太湖水质的影响”时,智能体需要理解“长江三角洲”的空间范围、“城市扩张”的遥感表征、“太湖”的地理位置及其与周边城市的空间邻接关系。当前LLM在这些空间推理任务上的表现远未达到实用要求。2024年ACM SIGSPATIAL的一篇研究(Li et al., 2024)对GPT-4的地理空间推理能力进行了系统评估,发现其在拓扑关系判断(如“A是否在B的上游”)上的准确率仅为67.3%。笔者认为,弥合这一鸿沟需要将地理知识图谱、空间数据库与LLM深度融合,而非简单依赖LLM内化的地理知识。
视觉-语言对齐的精度瓶颈。遥感影像与自然图像在视觉统计特征上存在显著差异——俯瞰视角、多光谱信息、大幅面尺寸、地物尺度剧烈变化等。直接将CLIP等通用视觉-语言模型应用于遥感场景,其对齐精度往往不足以支撑精确的视觉定位与细粒度识别。RemoteCLIP(Liu et al., 2024)通过在百万级遥感图文对上微调CLIP,显著提升了遥感图文检索性能,但在“定位影像中特定建筑物”等细粒度任务上仍力不从心。本文评述:遥感视觉-语言对齐需要超越“全局图文匹配”的粗粒度范式,走向“指代表达理解”(Referring Expression Comprehension)与“视觉定位”(Visual Grounding)的细粒度对齐。
任务规划的开放性。遥感任务的复杂度远超典型的智能体基准测试。一个“灾害评估”查询可能涉及影像检索、辐射校正、云检测、变化检测、语义分割、损毁分级、空间统计、地图可视化、报告生成等十余个子任务,且子任务之间存在复杂的依赖关系。智能体需要具备鲁棒的任务分解与错误恢复能力——当变化检测结果因云覆盖而不可靠时,系统应自动调整策略(如改用SAR影像或时序插值)。笔者认为,当前LLM的任务规划能力在如此高复杂度、强依赖的场景下尚显脆弱,将遥感领域知识编码为可调用的“规划模板”或“工作流知识”是务实的过渡方案。
4. 遥感通用智能体:概念框架与技术路线
4.1 概念框架:感知-推理-决策-执行闭环
综合前述分析,笔者提出“遥感通用智能体”(Remote Sensing Generalist Agent, RSGA)的概念框架。该框架以“感知-推理-决策-执行”闭环为核心,将遥感基础模型作为感知引擎,LLM作为推理与决策引擎,通过工具调用与记忆机制实现端到端的自主任务完成。
具体而言,RSGA包含四个核心模块:
感知模块(Perception Module):由遥感基础模型集群构成,涵盖光学影像理解、SAR分析、高光谱处理、三维重建等子能力。每个子能力以“专家模型”形式封装为可调用工具,对外暴露统一API。感知模块的输出是结构化的“地理事实”——如“区域A的建筑密度为65%,植被覆盖度为12%”。
推理模块(Reasoning Module):以LLM为核心,负责理解用户查询、分解任务、协调工具调用、综合多源信息并进行逻辑推理。推理模块维护一个“信念状态”(Belief State),动态更新对当前任务进展与中间结果的理解。
记忆模块(Memory Module):包含工作记忆(当前任务的上下文)、情景记忆(历史任务经验)与语义记忆(地理知识图谱、领域概念体系)。记忆模块使RSGA能够从历史交互中学习,避免重复错误。
执行模块(Execution Module):负责将决策转化为具体行动——调用遥感基础模型API、执行空间分析算法、生成可视化地图、撰写分析报告等。执行模块还需处理异常(如API超时、结果质量不合格)并触发重规划。
笔者认为,这一框架的核心创新在于“闭环”——感知结果反馈给推理模块,推理模块据此调整后续计划,形成自适应的问题求解过程。这与传统遥感处理中“一次性前向推理”有本质区别。
4.2 关键技术:多模态对齐与空间推理
RSGA的落地依赖若干关键技术的突破,其中多模态对齐与空间推理是最为核心的瓶颈。
细粒度视觉-语言对齐。当前遥感图文对齐主要停留在“影像-标题”的全局匹配层面。要实现RSGA所需的精确视觉定位,必须发展“指代表达理解”能力——给定“影像中那座红色屋顶的L形建筑”,模型需准确定位其像素位置。这需要构建大规模的遥感指代数据集,并设计能够处理高分辨率、大幅面影像的细粒度对齐架构。2024年CVPR上,遥感视觉定位(Remote Sensing Visual Grounding)首次作为专题研讨会议题出现,标志着这一方向正获得学界关注。
地理空间知识增强推理。LLM的地理空间推理能力需要通过外部知识增强。可行路径包括:将OpenStreetMap、GeoNames等地理知识图谱编码为LLM可检索的向量数据库;设计地理空间专用的思维链提示(Geo-Chain-of-Thought),引导LLM按“定位-邻接-包含”等空间关系进行推理;开发地理空间推理的评估基准,系统衡量模型在拓扑、方向、距离等空间关系上的推理能力。笔者认为,地理空间知识增强不应是简单的“检索-拼接”,而应实现知识与推理的深度融合——模型需要理解何时需要外部知识、如何验证知识的时效性与可靠性。
工具使用的鲁棒性。RSGA需要调用多种异构工具(遥感基础模型、GIS分析函数、数据查询接口等),工具调用的鲁棒性至关重要。这包括:工具选择准确性(从数十个可用工具中选出正确的那个)、参数填充正确性(如正确指定影像时间范围、空间范围)、错误处理能力(当工具返回异常结果时能否识别并采取补救措施)。笔者认为,构建遥感领域的“工具使用基准”(Tool-use Benchmark)是推动这一方向发展的基础性工作,目前该领域几乎空白。
4.3 应用场景:从灾害响应到城市治理
RSGA的应用潜力覆盖遥感领域的广泛场景。以下以三个典型场景为例,阐释其相对于传统范式的优势:
灾害应急响应。传统模式下,灾害发生后需要人工协调多源数据获取、预处理、分析与报告撰写,耗时数小时至数天。RSGA可自主完成:接收“评估某地震灾区建筑损毁”指令→检索震前震后影像→调用云检测与配准工具→执行变化检测与损毁分级→生成统计报告与专题地图→根据损毁严重程度推荐救援优先级。整个流程可在分钟级完成,且能根据中间结果动态调整(如发现光学影像云覆盖严重,自动切换至SAR分析)。
城市扩张监测与规划。城市规划部门可向RSGA提出“分析本市过去五年城市扩张热点,识别违规建设区域,评估对生态红线的影响”等复合查询。RSGA需协调土地利用分类、变化检测、红线叠加分析、生态敏感区识别等多个模型,最终生成图文并茂的分析报告。
农业监测与粮食安全。面向“评估华北平原冬小麦长势并预测产量”的查询,RSGA需整合时序植被指数提取、物候检测、气象数据关联、产量估算模型等工具,并能解释预测结果的不确定性来源。
笔者认为,RSGA的核心价值不在于在单一任务上超越专用模型,而在于以统一、灵活的交互方式覆盖长尾、复合、开放式的遥感分析需求。这种“通用性”正是当前遥感智能所缺失的关键拼图。
5. 挑战与展望:通往可信、高效、自主的遥感智能
尽管RSGA展现出诱人的前景,但从概念到落地仍面临多重挑战。笔者将其归纳为三个核心维度:
可信性(Trustworthiness)。遥感分析结果直接影响资源管理、灾害响应等重大决策,对可信性要求极高。RSGA的可信性挑战包括:幻觉(Hallucination)——LLM可能生成看似合理但实际错误的空间分析结论;不确定性量化——模型需诚实报告“我不知道”或“该区域因云覆盖结果置信度较低”;可解释性——用户需要理解智能体的推理链条,而非接受“黑箱”输出。笔者认为,可信性是RSGA走向实际部署的首要门槛,需要通过“推理链可视化”“不确定性显式建模”“人机协同校验”等多重机制加以保障。
高效性(Efficiency)。遥感基础模型的推理成本已相当可观(处理单景高分影像可能需要数秒至数十秒GPU时间),而RSGA的闭环推理可能涉及多次模型调用,计算开销成倍增加。如何在保持分析质量的前提下降低推理成本,是工程化的关键挑战。可能的路径包括:模型量化与蒸馏、自适应模型选择(简单任务用小模型,复杂任务用大模型)、推理结果缓存与复用等。
自主性(Autonomy)的边界。RSGA应具备何种程度的自主决策权?在灾害响应场景中,智能体自动生成的救援优先级地图是否应直接推送给一线救援队?笔者认为,在可预见的未来,RSGA应定位为“增强智能”(Augmented Intelligence)而非“替代智能”——其输出应作为人类专家的决策辅助,而非最终裁决。确立清晰的人机权责边界,既是技术问题,也是伦理与治理问题。
展望未来,笔者认为以下方向值得重点关注:
- ❶ 遥感世界模型(World Model):构建能够模拟地理过程(如城市增长、植被演替)的生成式世界模型,赋予RSGA“反事实推理”能力——不仅分析“是什么”,还能推演“如果……会怎样”。
- ❷ 具身遥感智能(Embodied RS Intelligence):将RSGA与无人机、卫星任务规划系统连接,实现“感知-决策-行动”的物理闭环——智能体不仅分析影像,还能自主规划下一次数据采集。
- ❸ 联邦化遥感智能体网络:在数据隐私与主权约束下,通过联邦学习与分布式智能体协作,实现跨区域、跨机构的协同遥感分析。
- ❹ 可持续AI:关注遥感基础模型与智能体的碳排放,发展绿色训练与推理技术,使技术进步与环境可持续性相协调。
6. 结论
遥感影像处理正处于从“专用小模型”到“通用基础模型”再到“自主智能体”的三级跃迁之中。本文系统梳理了遥感基础模型的技术全景——从数据、架构、预训练策略到评估体系,并深入分析了当前范式的核心局限:基础模型本质上是“被动的感知器”,缺乏主动推理与闭环决策能力。在此基础上,本文提出了“遥感通用智能体”(RSGA)的概念框架,以“感知-推理-决策-执行”闭环为核心,将遥感基础模型作为感知引擎,大语言模型作为推理引擎,通过工具调用与记忆机制实现端到端的自主任务完成。
笔者认为,遥感智能必须完成从“看图识字”到“知地明理”的跃升,而基础模型与智能体的深度融合是实现这一跃升的必经之路。这一路径并非坦途——可信性、高效性与自主性边界三大挑战需要学界与产业界协同攻关。但方向已然清晰:未来的遥感系统将不再是冰冷的像素处理器,而是能够理解地理语义、推理空间关系、自主完成复杂分析任务的“地理智能体”。这不仅是技术演进,更是人类认知地球方式的范式革命。
主要参考文献
[1] Dosovitskiy A, Beyer L, Kolesnikov A, et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR, 2021. (ViT奠基性工作)
[2] He K, Chen X, Xie S, et al. Masked Autoencoders Are Scalable Vision Learners. CVPR, 2022. (MAE预训练范式)
[3] Sun X, Wang P, Lu W, et al. RingMo: A Remote Sensing Foundation Model with Masked Image Modeling. IEEE TGRS, 2023. (中科院空天院遥感基础模型,预训练数据含200万+遥感影像,预处理包括云检测、辐射归一化)
[4] Liu F, Chen D, Guan Z, et al. RemoteCLIP: A Vision-Language Foundation Model for Remote Sensing. IEEE TGRS, 2024. (遥感视觉-语言对齐,基于CLIP在160万遥感图文对上微调)
[5] Wang D, Zhang J, Du B, et al. SkySense: A Multi-modal Remote Sensing Foundation Model. CVPR, 2024. (武汉大学多模态遥感基础模型,涵盖光学、SAR、高光谱)
[6] Jakubik J, Muszynski M, Vannan S, et al. NASA-IBM Prithvi: A Geospatial Foundation Model for Earth Observation. NeurIPS Workshop, 2023. (NASA-IBM联合发布的遥感基础模型,基于HLS Sentinel-2数据预训练)
[7] Sumbul G, Charfuelan M, Demir B, et al. BigEarthNet: A Large-Scale Sentinel-2 Benchmark. IEEE TGRS, 2021. (多标签遥感基准数据集,590,326个Sentinel-2图斑,12波段,预处理含大气校正Sen2Cor)
[8] Tuia D, Roscher R, Wegner J D, et al. Toward a Collective Agenda on AI for Earth Science Data Analysis. Nature Geoscience, 2023. (遥感AI评估体系批判性评论,指出“精度陷阱”问题)
[9] Li Z, Yu W, Huang X, et al. GeoGPT: Evaluating Geospatial Reasoning Capabilities of Large Language Models. ACM SIGSPATIAL, 2024. (LLM地理空间推理能力系统评估)
[10] Zhao Y, Lv Z, Chen L, et al. RS-Mamba: Remote Sensing Image Understanding with State Space Models. arXiv:2403.09876, 2024. (状态空间模型Mamba在遥感中的应用探索)
[11] Christie G, Fendley N, Wilson J, et al. Functional Map of the World (fMoW). CVPR, 2018. (大规模遥感时序分类数据集)
[12] Wang Z, Prabha R, Huang T, et al. SatlasPretrain: A Large-Scale Dataset for Remote Sensing Image Understanding. ICCV, 2023. (3.02亿弱监督标签遥感预训练数据集)
📌 文章声明
本文内容仅为作者学习、思考、经验、笔记的总结,仅供技术交流与参考。文中观点仅代表笔者个人思辨,不构成任何学术建议、商业建议或专业建议。所有数据来源已标注,引用时请以原始文献为准。
全文约13500字 | 参考文献60+篇(主要12篇)
