从「目标识别」到「地物—关系」整体认知
遥感影像解译正从单一像素层面朝着对象与场景层面递进,解译能力也正实现从智能化理解到智能化认知的转变。遥感影像语义描述要求计算机为一张高分辨率影像自动生成包含目标及其相互关系的自然语言描述,属于高层次语义理解任务。当前主流方法可归纳为传统模板驱动与早期深度学习结合、基于视觉—语言大模型、场景图知识增强三类,但整体仍未能摆脱语义碎片化与空间关系模糊的困境。
描述的灵活性与泛化性不足
传统模板方法依赖人工设计固定语句模板,通过匹配检测到的地物目标填充模板生成描述,句式僵化、表达维度受限,无法适配地物分布多变的复杂遥感场景。以 CNN+LSTM、CNN+GNN+LSTM、CNN+GAT+LSTM 为代表的改进型深度学习方法虽突破了模板束缚,但受训练样本有限所限,普遍存在泛化能力弱、可拓展性差、灵活性不足等问题。
空间关系与领域知识融入不足
基于视觉—语言大模型的方法(如 GeoChat、RS-LLaVA、EarthGPT、SkyEyeGPT、LHRS-Bot、RS-CapRet)语义描述较为灵活,但由于缺乏地理知识嵌入,模型难以识别遥感地物特有的空间分布规律,对深层空间知识描述不足。场景图方法虽聚焦关系建模,但场景图生成精度受限于复杂地物的识别能力,知识与语言生成模块的融合机制尚不完善。
细节捕捉与语义连贯性失衡
CLIP 等多模态模型对遥感图像特征仅能捕捉「视觉相似性」,无法判断地物之间的空间关系;文本特征的质量完全依赖参考文本,一旦参考文本遗漏关键地物或关系,便导致描述「漏检」或语义不完整。现有方法因细节特征丢失导致描述粗糙,难以实现细节完整、关系准确的文本描述。
512 像素 × 512 像素
每张影像 5 条描述
城市 / 郊区 / 海陆交汇
另有 24.6 万属性标签
RSSG2Caption:四段式知识增强生成链路
技术路线包含 RSSGCD 数据集构建与 RSSG2Caption 模型构建两个部分。模型先基于 CLIP 图像与文本编码器提取视觉—文本特征并对齐,再利用知识增强编码器将场景图作为知识嵌入,通过向量投影与注意力机制融合多模态特征,最后采用网状记忆 Transformer 架构生成语义描述,从而把「地物目标识别」升级为「地物—关系」的整体认知。
图像—文本编码器:跨模态特征对齐
将 512 像素 × 512 像素遥感影像输入 CLIP 图像编码器,采用 ViT-B/32 架构、16 像素 × 16 像素 patch 划分,将影像转化为 1 024 个 patch 序列,经 12 层 Transformer 提取特征并均值池化,得到 768 维图像特征向量;文本侧使用 CLIP 分词器转换为最大长度 77 的 Token 序列,同样经 12 层 Transformer 与正弦位置编码、多头注意力输出 768 维文本特征向量。为适配遥感场景,冻结前 8 层 Transformer 参数,微调后 4 层与池化层,采用对比损失函数最大化「图像—正确文本」相似度。
场景图知识增强编码器:三元组知识嵌入
将遥感影像对应的场景图以三元组形式 T={hi, ri, ti} 表示:头实体为主要地物,关系实体分为空间关系与属性关系,尾实体为存在空间关系的地物或属性值。通过 Tokenizer 与词向量获取每个三元组嵌入,再经多个 Transformer 层得到 512 维知识嵌入向量。场景图为图像特征提供语义关系标签、为文本特征提供结构化知识补充、为多模态融合提供逻辑校验,确保描述的合理性与准确性。
多模态特征融合:向量投影—注意力机制
设计 3 个线性投影层,将 768 维的图像特征与文本特征均投影至 512 维,与场景图特征维度统一,实现多模态特征的维度对齐。随后以影像投影特征作为查询 Q、文本投影特征作为键 K、场景图投影特征作为值 V,通过缩放点积注意力与 softmax 计算注意力权重,经多头注意力动态分配三类特征权重,输出 512 维融合特征 F,避免单一维度特征导致的语义模糊或信息缺失。
网状记忆 Transformer:结构化文本生成
在 MG-Transformer 基础上采用 M2 Transformer(Meshed-Memory Transformer)编码器—解码器。记忆增强编码器引入外部记忆单元(Memory Bank),基于地物像素坐标与场景图关系权重进行「空间+语义」混合位置编码,配合残差连接、层归一化与 GELU 激活的前馈网络捕捉长期依赖;网状解码器以双路径注意力与门控机制协同,实现文本内部连贯性约束与多模态特征语义约束,经全连接与 Softmax 输出 Token 概率并逐词拼接成描述语句。
RSSGCD:「影像—场景图—描述」数据集
从大幅面遥感影像中筛选有价值斑块并统一裁剪为 512 像素 × 512 像素,保留原始经纬度信息,最终整理得到 3 587 张影像(沿海城市广州 2 249 张、平原城市郑州 1 338 张)。地物划分为水系、居民点及设施、交通、地形、植被与土壤 5 大类、48 个小类。场景图标注包含颜色、形状、区域等定性属性与面积、宽度等定量属性,关系涵盖被包含、环绕、相邻、平行、穿过等 9 类拓扑关系与 8 个方向关系。语义描述由多模态大模型经提示词工程生成,每张影像 5 条,共 17 935 条。
数据划分与超参数配置
数据集按 8:1:1 划分,80% 训练、10% 验证、10% 测试;所有向量维度统一为 512 维,多头注意力头数 h 取 8,位置编码最大序列长度 128,最大输出序列长度 25。硬件采用配备 5 张 NVIDIA A100(80G)GPU 的服务器;训练 epoch 为 50,批量大小 50,束搜索 beam search 取 5,优化器为 Adam,每个注意力与 FFN 层后权重衰减 0.1,FFN 隐藏维度 2 048。评价指标为 BLEU、METEOR、ROUGE-L 与 CIDEr。
对比实验、消融实验与场景案例
在 RSSGCD 数据集上,将 RSSG2Caption 与 CNN+LSTM、CNN+GNN+LSTM、CNN+GAT+LSTM 以及 MG-Transformer 进行对比,并以 BLEU、METEOR、ROUGE-L、CIDEr 四项指标评估;在此基础上通过消融实验验证 RSSG 模块与 M2 Transformer 模块的独立贡献与协同效果,并选取城市、郊区、海陆交汇三类场景做定性分析。
较 MG-Transformer 提升 4.87%
较 MG-Transformer 提升 14.49%
较 MG-Transformer 提升 20.29%
较 MG-Transformer 提升 11.81%
| 方法 | BLEU-1 | BLEU-2 | BLEU-3 | BLEU-4 | ROUGE-L | METEOR | CIDEr |
|---|---|---|---|---|---|---|---|
| CNN+LSTM | 60.73 | 42.96 | 27.69 | 18.29 | 37.96 | 18.29 | 8.08 |
| CNN+GNN+LSTM | 58.84 | 41.14 | 26.38 | 17.31 | 38.51 | 18.40 | 9.53 |
| CNN+GAT+LSTM | 60.43 | 40.11 | 25.58 | 16.59 | 38.54 | 18.80 | 9.12 |
| MG-Transformer | 75.39 | 53.53 | 35.26 | 22.93 | 40.56 | 21.45 | 36.45 |
| RSSG2Caption(本文) | 80.26 | 69.81 | 47.35 | 37.42 | 52.37 | 33.50 | 56.74 |
BLEU-2 提升幅度最大
RSSG2Caption 在 BLEU-2 上相对 CNN+LSTM、CNN+GNN+LSTM、CNN+GAT+LSTM 与 MG-Transformer 分别提升 26.85%、28.67%、29.70% 和 16.28%,说明场景图知识嵌入增强了模型对影像空间关系的认知,更擅长捕捉双词短语级别的语义关联。
两模块协同而非简单叠加
Baseline+RSSG 使 BLEU-1 由 48.46% 升至 63.35%,Baseline+M2 Transformer 使其升至 75.39%,二者同时加入后达 80.26%。完整模型较 Baseline 在七项指标上分别提升 31.80%、39.24%、28.65%、25.55%、20.13%、19.34% 和 48.56%,RSSG 优化语义关联、M2 Transformer 生成高质量序列,二者缺一不可。
长短语匹配更平稳
随 n-gram 长度增加,RSSG2Caption 的 BLEU 折线呈「缓慢下降」且始终高于其他模型;MG-Transformer 在 BLEU-1、BLEU-2 上接近但在 BLEU-3、BLEU-4 上下降较快;传统 CNN 方法整体得分较低且在 BLEU-4 呈现断崖式下降,缺乏长短语语义关联的有效建模能力。
RSSG2Caption 方法能够覆盖所有核心地物与特征,同时补充必要细节,空间关联精准且细节丰富,在语义连贯性方面贴合原始描述且场景感强,整体综合性能最优。
方法有效性、应用价值与未来议程
本文通过 CLIP 跨模态对齐、场景图结构化约束、自适应特征融合与网状记忆 Transformer 文本生成,构建了场景图知识增强的遥感影像语义描述模型框架,将地物拓扑、方位关系及属性等知识转化为结构化向量,并通过注意力机制与动态融合策略确保知识精准嵌入描述生成的全过程。
对比实验:全指标最优
RSSG2Caption 在 BLEU1-4 上分别达到 80.26%、69.81%、47.35% 和 37.42%,在 ROUGE-L、METEOR 和 CIDEr 上分别达到 52.37%、33.50% 和 56.74%;相较表现较好的 MG-Transformer 分别提升 4.87%、16.28%、12.09%、14.49%、11.81%、12.05% 和 20.29%,对不同粒度的语义匹配均保持优异性能。
消融实验:模块正向协同
消融实验表明 RSSG 模块与 M2 Transformer 模块的加入均产生正向影响,二者协同取得最优效果,较 Baseline 在七项指标上分别提升 31.80%、39.24%、28.65%、25.55%、20.13%、19.34% 和 48.56%,验证了场景图知识增强与网状记忆解码各自的独立贡献。
典型案例:三维度定性领先
从地物完整性、关系准确性与语义连贯性三个维度评价:传统 CNN 方法能识别大尺度地物但小尺度设施存在遗漏,改进 CNN 方法尤其是加入 GNN 后有所提升,MG-Transformer 细节强化能力强但有少量冗余细节,RSSG2Caption 则全面覆盖核心地物与特征,空间关联精准、语义连贯且场景贴合度高。
应用价值
本方法有效提升了遥感影像描述生成的准确性、丰富性与连贯性,生成的描述更贴近人类自然语言,可为军事侦察、灾害监测等应用提供关键技术支撑;依托「遥感影像—场景图—描述语句」的组织形式,也可服务于地理场景认知、空间关系检索与遥感数据智能化解译等下游任务。
局限与未来
方法精度在一定程度上受遥感场景图构建效果与数据集规模影响,且未在不同数据集上开展广泛的适应性测试;模型本质仍采用 Transformer 架构,尚未与多模态大模型结合进行描述生成探索。未来将研究场景图自动构建方法,通过微调模型实现无需人工标注的场景图生成;并结合场景图结构化知识与多模态大模型,构建「遥感影像—场景图—描述文本」微调数据集,探索知识增强对大模型遥感语义描述与理解能力的提升。