遥感图像理解正在从传统的场景分类、目标检测、变化检测,走向能够用自然语言交互的多模态大模型范式。一个关键问题随之出现:遥感任务是否必须依赖专门训练的遥感多模态大模型,还是近年来快速发展的通用视觉多模态大模型已经足够强,甚至在部分遥感任务上可以超过领域专用模型? 这篇综述围绕 Remote Sensing Image Scene Understanding(RSISU)给出系统回答。论文一方面梳理遥感多模态大模型(RS-MLLMs)的技术演进、模型架构、指令数据、微调策略与遥感智能体;另一方面将 RS-MLLMs 与通用计算机视觉多模态大模型(CV-MLLMs)放在多个遥感任务和基准上做诊断式对比。 论文的核心结论非常直接:领域专用并不天然意味着全面领先。RS-MLLMs 在视觉定位、高分辨率遥感问答等领域任务上仍有竞争力,但 GPT-4o、Qwen3-VL、GLM-4.6V-Flash 等通用 CV-MLLMs 在多个 RSISU 基准上已经能够匹配甚至超过专用模型。未来更可靠的方向不是单纯堆遥感指令微调,而是把强通用多模态基础模型与有针对性的遥感适配结合起来。
图1:论文组织结构:全文依次讨论 RS-MLLM 分类、RSISU 评估、开放问题与结论。
论文题目:Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose? 作者:Qiwei Ma, Chunping Qiu, Xinjun Cheng, Xiaoyu Zhang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li 机构:Hunan University、Intelligent Game and Decision Lab、Yuelushan Center for Industrial Innovation 论文链接:https://arxiv.org/pdf/2607.20284 arXiv:2607.20284v1 方向:Remote Sensing, Image Scene Understanding, Foundation Models, MLLMs, Instruction Tuning
遥感图像场景理解不仅是识别图像里有什么,还要理解复杂地表场景中的对象、属性、空间关系、地理语义和变化过程。它覆盖场景分类、图像描述、视觉问答、视觉定位、目标定位、属性分析、空间推理和变化理解等任务。 遥感图像与自然图像差异很大。它通常来自俯视视角,目标尺度跨度大、分布密集,传感器类型复杂,可能包含光学、SAR、红外、多光谱、高光谱和多时相数据。模型不仅要识别对象和地物类别,还要理解空间分辨率、成像几何、光照条件和地理上下文。
随着 GPT-4V、Gemini、Qwen-VL、InternVL、GLM-V 等通用多模态模型快速进步,一个重要问题变得越来越实际:遥感图像理解是否仍需要专门的 RS-MLLM?还是通用 CV-MLLM 已经能通过强视觉感知和跨模态推理,在不少遥感任务上达到甚至超过专用模型? 论文将专门面向遥感任务设计或适配的模型称为 RS-MLLMs,将主要面向通用视觉理解的多模态大模型称为 CV-MLLMs。文章通过系统综述和诊断评估,比较这两类模型在不同任务、数据集和评估协议中的能力边界。
论文的贡献主要有三点。第一,系统梳理 RS-MLLMs 的技术发展,包括遥感基础模型、遥感多模态模型、遥感智能体、指令微调数据、模型架构和训练策略。第二,在代表性 RSISU 任务和基准上,对 RS-MLLMs 与通用 CV-MLLMs 进行比较,揭示专用模型优势是局部而非普遍的。第三,总结可靠评估、空间推理、高分辨率理解、训练无关适配和工具增强遥感智能体等未来方向。
RSISU 对模型的要求比自然图像问答更复杂。模型需要处理俯视视角下的小目标和密集目标,理解道路、建筑、水体、机场、农田等地物之间的空间关系,还要适应多源、多分辨率、多传感器和多时相输入。对于真实地球观测应用,仅仅回答“图中有什么”远远不够,模型还要能定位、计数、比较、解释和推理。
图2:遥感多模态大模型与相关工作的代表性发展时间线,展示 2023-2026 年核心模型、推理模型、高分辨率模型和遥感智能体的演进。
早期遥感基础模型主要集中在视觉表征学习。SatMAE、ScaleMAE、RingMo、GFM 等模型利用大规模遥感图像学习可迁移视觉特征。随后,研究扩展到高光谱、SAR、多模态观测和统一地球观测表征,例如 SpectralGPT、HyperSIGMA、SAR-JEPA、SARMAE、SkySense、TerraFM 等。 这些模型为 RS-MLLMs 提供了视觉编码器和跨模态基础,但它们本身通常仍偏向视觉表征或特定下游任务,并不天然具备开放式自然语言交互能力。
RS-MLLMs 将遥感视觉编码器、跨模态对齐模块和语言模型连接起来,支持图像描述、遥感问答、视觉定位、多轮对话、空间推理和大场景理解。代表性模型包括 RSGPT、GeoChat、SkyEyeGPT、EarthGPT、LHRS-Bot、H2RSVLM、RS-LLaVA、SkySenseGPT、Falcon、GeoLLaVA-8K、EarthMind、Geo-R1、ZoomEarth 等。
图3:MLLM 通用架构:遥感输入经不同模态编码器、投影模块和 LLM 主干处理,输出描述、问答、定位、分割、变化图和检索结果。 论文指出,RS-MLLMs 的发展正在从早期 caption/VQA 模型,转向多传感器、多任务、可靠性、推理强化、高分辨率理解和遥感智能体方向。
遥感智能体是 RS-MLLMs 的自然延伸。传统 RS-MLLM 主要回答问题或生成描述,而遥感智能体会理解用户目标,调用外部工具,整合检测、分割、检索、GIS、变化检测和空间计算结果,再完成最终决策。 这类系统尤其适合真实遥感工作流,因为遥感任务常常不只需要视觉感知,还需要地理数据访问、工具调用、跨图像比较、长程推理和可验证轨迹。论文提到 RS-Agent、GeoLLM-Engine、ThinkGeo、RingMo-Agent、EARTH-AGENT 等工作,说明遥感智能体正在成为新的发展方向。
现有 RS-MLLMs 大多依赖遥感图像描述、问答、定位和多任务指令数据进行 SFT 或参数高效微调。近年方法还引入强化学习、GRPO、推理导向后训练和高分辨率 token 选择机制。论文强调,指令数据的多样性、任务覆盖和评估协议会显著影响模型泛化,过窄的遥感指令微调可能让模型在熟悉格式上表现好,却难以适应开放式任务。
总体来看,RS-MLLMs 已经从单一 caption/VQA 系统演进到多任务、多模态、高分辨率、推理增强和工具增强系统。但它们仍面临三个问题:训练数据覆盖有限,评估协议不统一,与通用 CV-MLLMs 的公平对比不足。因此,必须用更系统的诊断评估来判断“领域专用”到底带来哪些真实优势。
论文将评估分为两类。第一类是任务特定遥感数据集,包括场景分类、视觉问答和视觉定位。第二类是 MLLM 专用遥感基准,包括 LHRS-Bench、FIT-RSRC、XLRS-Bench 等,用于测试更综合的感知、推理和指令跟随能力。 论文特别提醒,现有结果来自论文报告、复现实验和 API 评估等不同来源,模型版本、提示词、输出解析、是否存在训练数据污染都会影响结论。因此,可靠评估必须明确模型版本、发布时间、benchmark 发布日期、prompt 和输出处理规则。
在场景分类上,近期通用 CV-MLLMs 表现很强。GPT-4o 整体表现最佳,Qwen3-VL 和 GLM-4.6V-Flash 等开源通用模型也表现出强迁移能力。部分 RS-MLLMs 在特定遥感数据集上表现较好,但也存在过拟合固定指令模板、泛化不足的问题。 在视觉问答上,RS-MLLMs 在高分辨率遥感问答和遥感知识相关问题上仍有优势,但通用 CV-MLLMs 进步很快。论文指出,一些性能差距来自高分辨率细节、空间关系和领域知识需求,而不是“遥感模型”标签本身。 在视觉定位上,RS 专用模型通常更有竞争力,因为任务需要精确 grounding、细粒度目标识别和地理空间定位。但即便如此,现有模型仍会在小目标、密集目标、关系表达和复杂查询上出现明显错误。
在 LHRS-Bench 上,GPT-4o 取得最佳平均准确率,GLM-4.6V-Flash、Qwen3-VL、Qwen2-VL 等通用开源模型也表现突出,明显超过早期通用模型。这说明现代 CV-MLLMs 对遥感场景具有很强迁移能力。 在 FIT-RSRC 上,最强结果同样来自近期通用 CV-MLLMs。Qwen3-VL 平均准确率最高,GLM-4.6V-Flash 紧随其后,二者超过 GPT-4o 和评估中的 RS-MLLMs。这表明细粒度关系理解更依赖强视觉感知、组合推理和指令跟随,而不只是遥感领域微调。 在 XLRS-Bench 上,RS-oriented 模型仍保持竞争力,尤其是超高分辨率遥感图像理解。ScaleEarth、GeoEyes、GeoLLaVA-8K 等模型在高分辨率、区域语义和遥感知识整合方面表现较强,说明领域适配仍然重要。
论文通过复杂案例展示当前 MLLMs 的薄弱环节。例如根据阴影判断太阳方向,看似对人类较直观,但 Qwen3-VL 和 Geo-R1 都给出错误方向;在机场跑道附近飞机计数任务中,也有多种 SOTA 模型回答错误。这说明模型仍缺少稳定的几何推理、方向理解、计数能力和细粒度空间关系判断。
图4:复杂 RSISU 推理案例:模型需要结合阴影、建筑朝向和太阳板等线索判断太阳方向,但当前强模型仍可能给出错误结论。 视觉定位案例进一步说明,即便模型能给出看似合理的框,也可能定位到错误对象。DIOR-RSVG 上的对比显示,不同 MLLMs 在同一查询下输出差异明显,表明细粒度定位和关系约束仍是难点。
图5:代表性 MLLMs 在 DIOR-RSVG 数据集上的视觉定位表现,不同颜色对应不同查询。
论文总结认为,当前 RS-MLLMs 的优势主要是局部的,而不是全域的。它们在某些领域特定任务上有明显价值,尤其是遥感视觉定位、高分辨率问答和特定遥感知识任务;但通用 CV-MLLMs 在多个基准上已经达到或超过专用模型。 这意味着未来 RS-MLLM 不应只追求“更遥感化”的窄指令微调,而应利用更强通用多模态模型作为 backbone 或 teacher,并把遥感适配集中在通用模型薄弱的环节:空间推理、传感器感知、地理知识、精确定位和多源高分辨率输入处理。
可靠评估是 RS-MLLM 发展的前提。论文指出,当前评估往往混合文献报告、复现实验、API 测试和迁移学习结果,且 benchmark 污染风险不同。未来研究应报告模型版本、发布时间、训练数据重叠、prompt、输出解析和评估设置,区分严格零样本、无适配推理、benchmark-aware 评估与迁移学习结果。
RS-MLLMs 并不总能超越通用 CV-MLLMs,一个重要原因是许多模型的指令微调过窄。模型可能在固定格式上表现很好,却无法处理新表达、新问题类型或新任务组合。未来应构建覆盖传感器、分辨率、地理区域、目标类别、问题格式和推理模式的多样化遥感指令数据。
空间推理仍是主要瓶颈。阴影方向、左右关系、目标计数、方向理解、距离估计和精确 grounding 都要求模型具备几何和物理推理能力。未来模型需要加入几何感知监督、空间关系验证、区域级定位能力和可靠的复杂场景解释能力。
图6:目标级验证可改善遥感视觉定位,通过引入相关对象证据修正引用表达,使定位更准确。
论文强调,昂贵的领域专用数据收集和微调并不是唯一道路。prompt engineering、in-context learning、推理导向提示和工具辅助推理仍有很大空间。例如加入 one-shot 示例可将 EuroSAT 分类准确率从 56.7% 提升到 72.4%。这说明在投入大规模领域微调前,应系统评估任务感知和模型感知的训练无关策略。
真实遥感应用常涉及真彩色光学图、假彩色合成图、SAR、红外、多光谱、高光谱、多视角和多时相观测。现有 RS-MLLMs 仍主要依赖单图 RGB 输入,对多源遥感数据开发不足。未来模型需要支持传感器感知编码、多图像比较、时序变化推理、主动区域选择和分层高分辨率理解。
图7:当前 MLLMs 在多模态、多视角和多时相 RSISU 任务上的代表性失败案例。
高分辨率遥感输入和大规模指令微调带来很高计算成本。未来应关注轻量架构、视觉 token 压缩、参数高效微调和训练无关适配。同时,RS agents 可以把 MLLMs 与目标检测、分割、检索、GIS 软件和知识库结合起来,让输出更可追踪、更可靠。工具选择、长程推理、轨迹验证、多智能体协作和领域工作流仍是重要研究方向。
论文最后给出四个核心结论。第一,RS-MLLMs 的优势是局部而非普遍的。它们在特定任务和熟悉评估格式中表现较好,但尚未建立通用遥感图像理解能力。 第二,通用基础能力正在越来越强地影响遥感 benchmark 表现。近期通用 CV-MLLMs 在多个遥感基准上具有竞争力甚至优势,说明强视觉感知、指令跟随和组合推理有时比窄领域微调更关键。 第三,评估协议已经成为瓶颈。如果没有严格控制模型版本、数据污染、prompt 和输出解析,很容易高估领域适配收益。 第四,未来前沿在传感器感知和可验证遥感智能。多源、多图像、多时相和超高分辨率理解,以及工具使用、外部知识和 agent-based verification,都会是让模型更可靠的关键。
这篇综述最有价值的地方,是把“遥感专用模型是否一定更好”这个问题转化为可诊断的经验比较。它的答案不是否定 RS-MLLM,而是提醒研究者:领域特异性本身不足以构建通用、实用的遥感智能。 更合理的路线,是以强通用多模态模型为基础,把遥感适配用于补足它们的短板,包括空间推理、传感器理解、地理知识、精确定位、超高分辨率处理和可靠工具调用。未来的 RS-MLLMs 不应只是遥感数据上的多模态聊天模型,而应成为能感知、推理、定位、调用工具并可验证的遥感智能系统。