Geo-Information Science · Scene Graph Enhanced Captioning

RSSG2Caption:场景图知识增强的多模态遥感影像描述生成方法

RSSG2Caption: A Multimodal Remote Sensing Image Description Generation Method Enhanced with Scene Graph Knowledge
任琰 蒋秉川 钱海忠 徐道柱 地球信息科学学报 2026, 28(9): 2634–2648 DOI 10.12082/dqxxkx.2026.250567
Abstract · 摘要 【目的】 遥感影像描述生成作为高层次的语义理解任务,是实现复杂地理空间从场景感知到场景认知的重要途径。当前方法未能充分捕捉影像整体结构和地物关系特征,导致生成的描述语义碎片化、空间关系模糊,模型难以充分理解影像的空间场景结构,无法实现对影像空间语义的精准描述。为此,提出了一种场景图知识增强的多模态遥感影像描述生成方法RSSG2Caption。为了增强模型对遥感影像细节捕捉和空间关系描述的能力,构建包含场景图知识的遥感影像描述数据集RSSGCD。 【方法】 首先,利用CLIP模型对遥感影像和描述文本进行编码,实现影像特征与文本语义特征的对齐;其次,将遥感影像对应的场景图作为知识嵌入,使模型能够充分考虑地物空间关系;然后,基于向量投影与注意力机制,实现视觉细节、语义文本与结构化知识的协同;最后,采用“记忆增强编码器”强化多模态特征的深层关联,通过“网状解码器”实现结构化文本的生成,避免语义描述生成逻辑混乱。 【结果】 基于构建的遥感影像描述数据集RSSGCD,对RSSG2Caption进行训练与对比实验,并通过消融实验证明了RSSG2Caption各模块的有效性。RSSG2Caption在BLEU1-4指标上分别达到80.26%、69.81%、47.35%和37.42%,在ROUGE-L、METEOR和CIDEr指标上分别达到52.37%、33.50%和56.74%,与表现较好的MG-Transformer方法相比各项指标分别提升了4.87%、16.28%、12.09%、14.49%、11.81%、12.05%和20.29%。选取城市、郊区和海陆交汇3种场景进行案例分析,RSSG2Caption能够更准确地捕捉遥感影像中的地物空间关系,生成语义丰富、准确的空间关系描述语句。 【结论】 本方法有效提升了遥感影像描述生成的准确性和丰富性,可为军事侦察、灾害监测等应用提供关键技术支撑。
遥感影像描述 遥感场景图 地理场景认知 知识增强 多模态特征融合 网状记忆Transformer 空间关系描述
Scroll · 向下滚动
Section 01 · Background & Challenges

从「目标识别」到「地物—关系」整体认知

遥感影像解译正从单一像素层面朝着对象与场景层面递进,解译能力也正实现从智能化理解到智能化认知的转变。遥感影像语义描述要求计算机为一张高分辨率影像自动生成包含目标及其相互关系的自然语言描述,属于高层次语义理解任务。当前主流方法可归纳为传统模板驱动与早期深度学习结合、基于视觉—语言大模型、场景图知识增强三类,但整体仍未能摆脱语义碎片化与空间关系模糊的困境。

CHALLENGE 01

描述的灵活性与泛化性不足

传统模板方法依赖人工设计固定语句模板,通过匹配检测到的地物目标填充模板生成描述,句式僵化、表达维度受限,无法适配地物分布多变的复杂遥感场景。以 CNN+LSTM、CNN+GNN+LSTM、CNN+GAT+LSTM 为代表的改进型深度学习方法虽突破了模板束缚,但受训练样本有限所限,普遍存在泛化能力弱、可拓展性差、灵活性不足等问题。

CHALLENGE 02

空间关系与领域知识融入不足

基于视觉—语言大模型的方法(如 GeoChat、RS-LLaVA、EarthGPT、SkyEyeGPT、LHRS-Bot、RS-CapRet)语义描述较为灵活,但由于缺乏地理知识嵌入,模型难以识别遥感地物特有的空间分布规律,对深层空间知识描述不足。场景图方法虽聚焦关系建模,但场景图生成精度受限于复杂地物的识别能力,知识与语言生成模块的融合机制尚不完善。

CHALLENGE 03

细节捕捉与语义连贯性失衡

CLIP 等多模态模型对遥感图像特征仅能捕捉「视觉相似性」,无法判断地物之间的空间关系;文本特征的质量完全依赖参考文本,一旦参考文本遗漏关键地物或关系,便导致描述「漏检」或语义不完整。现有方法因细节特征丢失导致描述粗糙,难以实现细节完整、关系准确的文本描述。

3 587标准化高分辨率遥感影像
512 像素 × 512 像素
17 935语义描述语句
每张影像 5 条描述
8.6 万场景图地物标签
城市 / 郊区 / 海陆交汇
15 万场景图关系标签
另有 24.6 万属性标签

Section 02 · Framework & Architecture

RSSG2Caption:四段式知识增强生成链路

技术路线包含 RSSGCD 数据集构建与 RSSG2Caption 模型构建两个部分。模型先基于 CLIP 图像与文本编码器提取视觉—文本特征并对齐,再利用知识增强编码器将场景图作为知识嵌入,通过向量投影与注意力机制融合多模态特征,最后采用网状记忆 Transformer 架构生成语义描述,从而把「地物目标识别」升级为「地物—关系」的整体认知。

01

图像—文本编码器:跨模态特征对齐

将 512 像素 × 512 像素遥感影像输入 CLIP 图像编码器,采用 ViT-B/32 架构、16 像素 × 16 像素 patch 划分,将影像转化为 1 024 个 patch 序列,经 12 层 Transformer 提取特征并均值池化,得到 768 维图像特征向量;文本侧使用 CLIP 分词器转换为最大长度 77 的 Token 序列,同样经 12 层 Transformer 与正弦位置编码、多头注意力输出 768 维文本特征向量。为适配遥感场景,冻结前 8 层 Transformer 参数,微调后 4 层与池化层,采用对比损失函数最大化「图像—正确文本」相似度。

CLIP ViT-B/321 024 patch768 维特征对比损失微调
02

场景图知识增强编码器:三元组知识嵌入

将遥感影像对应的场景图以三元组形式 T={hi, ri, ti} 表示:头实体为主要地物,关系实体分为空间关系与属性关系,尾实体为存在空间关系的地物或属性值。通过 Tokenizer 与词向量获取每个三元组嵌入,再经多个 Transformer 层得到 512 维知识嵌入向量。场景图为图像特征提供语义关系标签、为文本特征提供结构化知识补充、为多模态融合提供逻辑校验,确保描述的合理性与准确性。

三元组嵌入WordEmbTransformer 编码512 维知识向量
03

多模态特征融合:向量投影—注意力机制

设计 3 个线性投影层,将 768 维的图像特征与文本特征均投影至 512 维,与场景图特征维度统一,实现多模态特征的维度对齐。随后以影像投影特征作为查询 Q、文本投影特征作为键 K、场景图投影特征作为值 V,通过缩放点积注意力与 softmax 计算注意力权重,经多头注意力动态分配三类特征权重,输出 512 维融合特征 F,避免单一维度特征导致的语义模糊或信息缺失。

线性投影 768→512Q/K/V 注意力多头注意力融合特征 F
04

网状记忆 Transformer:结构化文本生成

在 MG-Transformer 基础上采用 M2 Transformer(Meshed-Memory Transformer)编码器—解码器。记忆增强编码器引入外部记忆单元(Memory Bank),基于地物像素坐标与场景图关系权重进行「空间+语义」混合位置编码,配合残差连接、层归一化与 GELU 激活的前馈网络捕捉长期依赖;网状解码器以双路径注意力与门控机制协同,实现文本内部连贯性约束与多模态特征语义约束,经全连接与 Softmax 输出 Token 概率并逐词拼接成描述语句。

M2 TransformerMemory Bank双路径注意力门控融合Softmax 解码
SUPPLEMENT A · 数据集

RSSGCD:「影像—场景图—描述」数据集

从大幅面遥感影像中筛选有价值斑块并统一裁剪为 512 像素 × 512 像素,保留原始经纬度信息,最终整理得到 3 587 张影像(沿海城市广州 2 249 张、平原城市郑州 1 338 张)。地物划分为水系、居民点及设施、交通、地形、植被与土壤 5 大类、48 个小类。场景图标注包含颜色、形状、区域等定性属性与面积、宽度等定量属性,关系涵盖被包含、环绕、相邻、平行、穿过等 9 类拓扑关系与 8 个方向关系。语义描述由多模态大模型经提示词工程生成,每张影像 5 条,共 17 935 条。

SUPPLEMENT B · 实验设置

数据划分与超参数配置

数据集按 8:1:1 划分,80% 训练、10% 验证、10% 测试;所有向量维度统一为 512 维,多头注意力头数 h 取 8,位置编码最大序列长度 128,最大输出序列长度 25。硬件采用配备 5 张 NVIDIA A100(80G)GPU 的服务器;训练 epoch 为 50,批量大小 50,束搜索 beam search 取 5,优化器为 Adam,每个注意力与 FFN 层后权重衰减 0.1,FFN 隐藏维度 2 048。评价指标为 BLEU、METEOR、ROUGE-L 与 CIDEr。


Section 03 · Experimental Results

对比实验、消融实验与场景案例

在 RSSGCD 数据集上,将 RSSG2Caption 与 CNN+LSTM、CNN+GNN+LSTM、CNN+GAT+LSTM 以及 MG-Transformer 进行对比,并以 BLEU、METEOR、ROUGE-L、CIDEr 四项指标评估;在此基础上通过消融实验验证 RSSG 模块与 M2 Transformer 模块的独立贡献与协同效果,并选取城市、郊区、海陆交汇三类场景做定性分析。

80.26%BLEU-1
较 MG-Transformer 提升 4.87%
37.42%BLEU-4
较 MG-Transformer 提升 14.49%
56.74%CIDEr
较 MG-Transformer 提升 20.29%
52.37%ROUGE-L
较 MG-Transformer 提升 11.81%
方法 BLEU-1 BLEU-2 BLEU-3 BLEU-4 ROUGE-L METEOR CIDEr
CNN+LSTM 60.73 42.96 27.69 18.29 37.96 18.29 8.08
CNN+GNN+LSTM 58.84 41.14 26.38 17.31 38.51 18.40 9.53
CNN+GAT+LSTM 60.43 40.11 25.58 16.59 38.54 18.80 9.12
MG-Transformer 75.39 53.53 35.26 22.93 40.56 21.45 36.45
RSSG2Caption(本文) 80.26 69.81 47.35 37.42 52.37 33.50 56.74
FINDING 01 · 短语级语义

BLEU-2 提升幅度最大

RSSG2Caption 在 BLEU-2 上相对 CNN+LSTM、CNN+GNN+LSTM、CNN+GAT+LSTM 与 MG-Transformer 分别提升 26.85%、28.67%、29.70% 和 16.28%,说明场景图知识嵌入增强了模型对影像空间关系的认知,更擅长捕捉双词短语级别的语义关联。

FINDING 02 · 消融验证

两模块协同而非简单叠加

Baseline+RSSG 使 BLEU-1 由 48.46% 升至 63.35%,Baseline+M2 Transformer 使其升至 75.39%,二者同时加入后达 80.26%。完整模型较 Baseline 在七项指标上分别提升 31.80%、39.24%、28.65%、25.55%、20.13%、19.34% 和 48.56%,RSSG 优化语义关联、M2 Transformer 生成高质量序列,二者缺一不可。

FINDING 03 · 粒度稳定性

长短语匹配更平稳

随 n-gram 长度增加,RSSG2Caption 的 BLEU 折线呈「缓慢下降」且始终高于其他模型;MG-Transformer 在 BLEU-1、BLEU-2 上接近但在 BLEU-3、BLEU-4 上下降较快;传统 CNN 方法整体得分较低且在 BLEU-4 呈现断崖式下降,缺乏长短语语义关联的有效建模能力。

RSSG2Caption 方法能够覆盖所有核心地物与特征,同时补充必要细节,空间关联精准且细节丰富,在语义连贯性方面贴合原始描述且场景感强,整体综合性能最优。

— 核心发现 · 城市 / 郊区 / 海陆交汇三类场景定性评价

Section 04 · Conclusion & Prospect

方法有效性、应用价值与未来议程

本文通过 CLIP 跨模态对齐、场景图结构化约束、自适应特征融合与网状记忆 Transformer 文本生成,构建了场景图知识增强的遥感影像语义描述模型框架,将地物拓扑、方位关系及属性等知识转化为结构化向量,并通过注意力机制与动态融合策略确保知识精准嵌入描述生成的全过程。

CONTRIBUTION 01

对比实验:全指标最优

RSSG2Caption 在 BLEU1-4 上分别达到 80.26%、69.81%、47.35% 和 37.42%,在 ROUGE-L、METEOR 和 CIDEr 上分别达到 52.37%、33.50% 和 56.74%;相较表现较好的 MG-Transformer 分别提升 4.87%、16.28%、12.09%、14.49%、11.81%、12.05% 和 20.29%,对不同粒度的语义匹配均保持优异性能。

CONTRIBUTION 02

消融实验:模块正向协同

消融实验表明 RSSG 模块与 M2 Transformer 模块的加入均产生正向影响,二者协同取得最优效果,较 Baseline 在七项指标上分别提升 31.80%、39.24%、28.65%、25.55%、20.13%、19.34% 和 48.56%,验证了场景图知识增强与网状记忆解码各自的独立贡献。

CONTRIBUTION 03

典型案例:三维度定性领先

从地物完整性、关系准确性与语义连贯性三个维度评价:传统 CNN 方法能识别大尺度地物但小尺度设施存在遗漏,改进 CNN 方法尤其是加入 GNN 后有所提升,MG-Transformer 细节强化能力强但有少量冗余细节,RSSG2Caption 则全面覆盖核心地物与特征,空间关联精准、语义连贯且场景贴合度高。

APPLICATION VALUE

应用价值

本方法有效提升了遥感影像描述生成的准确性、丰富性与连贯性,生成的描述更贴近人类自然语言,可为军事侦察、灾害监测等应用提供关键技术支撑;依托「遥感影像—场景图—描述语句」的组织形式,也可服务于地理场景认知、空间关系检索与遥感数据智能化解译等下游任务。

LIMITATIONS & FUTURE

局限与未来

方法精度在一定程度上受遥感场景图构建效果与数据集规模影响,且未在不同数据集上开展广泛的适应性测试;模型本质仍采用 Transformer 架构,尚未与多模态大模型结合进行描述生成探索。未来将研究场景图自动构建方法,通过微调模型实现无需人工标注的场景图生成;并结合场景图结构化知识与多模态大模型,构建「遥感影像—场景图—描述文本」微调数据集,探索知识增强对大模型遥感语义描述与理解能力的提升。