基于开放词汇语义分割的
大范围城市绿地无监督提取

丁婕玉、郑康、杜清运、等 地球信息科学学报 · 2026 · 28(7): 1958-1973 研究区:湖北省武汉市 OVSS / CLIP / Sentinel-2 / 零标注

本文面向大范围城市绿地提取中人工标注成本高、深度模型跨城市泛化不足和传统植被指数抗干扰能力有限等问题,提出一种基于开放词汇语义分割的无监督城市绿地提取框架。该框架将植被近红外光谱先验融入提示词设计,利用 CLIP 跨模态大模型实现语义粗分割,再以 OVSS 粗掩膜作为参考,基于约登指数自适应确定 NDVI 最优阈值,完成边界细化与像素级提取。实验在武汉 Sentinel-2 影像上验证,结果表明该方法在零人工像素级标注条件下取得较高精度,并优于多种植被指数法和公开土地覆盖产品。

城市绿地 开放词汇语义分割 CLIP 无监督提取 植被指数 约登指数
↓ 向下滚动阅读

01 · 研究背景与问题

城市绿地制图需要摆脱对大规模人工标注的依赖

城市绿地是缓解热岛效应、降低内涝风险、减少噪声污染、促进生物多样性和提升居民福祉的重要生态基础设施。传统人工调查效率低,植被指数法易受阴影、水体和屋顶干扰,深度学习方法又高度依赖像素级标注样本,因此亟需一种零标注、可迁移、可扩展的城市绿地提取技术。

传统方法成本高

人工调查与目视解译主观性强、更新周期长,难以满足快速城市生态监测和大范围绿地制图需求。

指数阈值泛化弱

NDVI、EVI、SAVI 等植被指数对植被敏感,但自动阈值容易受水体、阴影、裸地和特殊屋顶颜色干扰。

深度模型依赖标注

CNN 与 Transformer 分类精度较高,但需要大量像素级训练样本,跨城市、跨季节和跨传感器迁移能力有限。

0
像素级训练标注
10 m
Sentinel-2 分辨率
500
人工验证样本点
84.79%
武汉城镇化率

02 · 方法框架

用 CLIP 做语义定位,用 NDVI + 约登指数做边界细化

论文提出的无监督框架包含四个核心阶段:提示词设计、视觉与文本编码、跨模态相似度计算和基于约登指数的 NDVI 阈值细化。整体思路是先利用开放词汇模型找到“哪里像绿地”,再用植被指数完成“像素级边界修正”。

P1
提示词设计:融合语义描述与光谱先验

研究采用标准假彩色合成影像,将近红外、红、绿波段输入模型,并设计包含绿地场景语义和假彩色光谱表现的提示词。正向提示词描述 dense urban green space、park areas、bright red patches 等,负向提示词描述 gray urban areas、non-red regions、water bodies 等。

Prompt Design False Color NIR Prior Positive / Negative Prompts
C2
CLIP 双编码器:视觉—文本共享语义空间

视觉编码器采用 Vision Transformer,将图像块转化为视觉嵌入;文本编码器将自然语言提示词转化为文本嵌入。二者被映射到统一跨模态语义空间,为开放词汇语义匹配提供基础。

CLIP ViT Text Transformer Cross-modal Embedding
S3
相似度计算:生成城市绿地粗掩膜

通过计算图像块视觉特征与文本提示词特征之间的余弦相似度,识别与绿地语义最匹配的区域。该阶段输出的 OVSS 粗掩膜具有较强语义定位能力,但边界仍较粗,需要进一步细化。

Cosine Similarity OVSS Mask Coarse Segmentation Semantic Localization
R4
约登指数驱动的 NDVI 自适应阈值细化

以 OVSS 粗掩膜作为参考,分别统计绿地与非绿地区域 NDVI 分布,并通过约登指数自动确定最优阈值。该阈值最大化真正率与假正率之差,从而在漏检和误检之间取得平衡,生成最终精细化绿地结果。

NDVI Youden Index Adaptive Threshold Pixel-level Refinement

研究区与数据

  • 研究区为湖北省武汉市。
  • 武汉水网密布、城市景观复杂、绿地斑块破碎。
  • 使用 Sentinel-2 L2A 地表反射率产品。
  • 通过 Google Earth Engine 获取 2024 年 6—8 月夏季无云合成影像。

验证样本设计

  • 随机选取 500 个样本点进行人工目视解译。
  • 样本覆盖城市建成区、城乡交错带和农村自然带。
  • 对比方法包括 6 种植被指数和 4 种公开土地覆盖产品。
  • 评价指标包括 Precision、Recall、F1-score 和 OA。

03 · 实验结果与对比

零标注条件下,框架取得 90.15% 的 F1 分数

实验表明,OVSS 粗掩膜与 NDVI 自适应阈值细化的组合,在无任何人工像素级标注的情况下获得较高精度。该方法在 F1 分数、总体精度和召回率方面均优于多数传统指数法和公开土地覆盖产品。

85.21%
Precision
95.67%
Recall
90.15%
F1-score
88.40%
总体精度 OA
对比对象 主要结果 差异与解释
6 种植被指数 + Otsu 本文框架优于 NDVI、EVI、SAVI、GNDVI、VARI、NDRE 等指数法。 相较最优植被指数 SAVI,F1 分数提升 1.48%,OA 提升 2.2%。
公开土地覆盖产品 对比 ESA Worldcover、Dynamic World、ESRI LC、GLC_FCS10。 本文框架在召回率、F1 分数和 OA 三项指标上均位居第一。
HSV 色彩空间分割 HSV 精确率较高,但召回率仅 67.87%。 HSV 依赖人工颜色阈值,严重漏检;本文框架召回率达到 95.67%。

抗干扰能力

  • 传统植被指数易受建筑阴影、水体和特殊颜色屋顶影响。
  • 跨模态语义理解可区分“绿地语义”与“单纯光谱相似”。
  • 假彩色影像引入近红外信息,有助于增强植被区域响应。
  • 约登指数阈值细化进一步减少误分与漏分。

细节表现

  • 公开数据集普遍存在边界模糊和小尺度斑块丢失问题。
  • 本文框架在城市建成区小型绿地识别中表现更好。
  • 在绿地边缘保真度和破碎斑块识别方面具有优势。
  • 适用于复杂城市景观下的大范围快速制图。
核心发现:开放词汇语义分割解决的是“知道哪些区域像绿地”,NDVI 与约登指数解决的是“把绿地边界切准”。语义掩膜与光谱阈值的组合,使零标注城市绿地提取兼具泛化性与像素级精度。

04 · 结论与应用启示

OVSS 为城市生态遥感提供了零标注、可迁移的新范式

本文验证了“无监督 OVSS 掩膜驱动植被自适应提取”的有效性。相比传统监督深度学习,该框架不需要像素级标注;相比传统指数阈值法,它通过跨模态语义理解提高了复杂城市环境下的鲁棒性。

零标注提取

无需人工像素级训练样本,即可完成大范围城市绿地高精度制图,降低了数据制备成本。

跨模态融合

将近红外光谱先验融入 CLIP 提示词和假彩色影像输入,实现语义知识与遥感光谱信息的结合。

自适应阈值

利用约登指数自动确定 NDVI 阈值,避免人工经验阈值不稳定,提高不同城市景观下的适应性。

应用价值

  • 支撑城市绿地资源快速普查与动态监测。
  • 服务城市热岛缓解、内涝风险评估和生态空间规划。
  • 适合扩展到跨城市、跨区域绿地制图任务。
  • 可与 GEE 等云平台结合,提升大范围业务化制图效率。

局限与未来方向

  • 极高反照率建筑区域仍可能造成少量初始掩膜误分类。
  • Sentinel-2 10 m 分辨率对极细碎混合像元识别仍有限。
  • 未来可融合更高分辨率遥感影像和多时相数据。
  • 可进一步探索面向多类城市生态要素的开放词汇提取框架。