本文面向大范围城市绿地提取中人工标注成本高、深度模型跨城市泛化不足和传统植被指数抗干扰能力有限等问题,提出一种基于开放词汇语义分割的无监督城市绿地提取框架。该框架将植被近红外光谱先验融入提示词设计,利用 CLIP 跨模态大模型实现语义粗分割,再以 OVSS 粗掩膜作为参考,基于约登指数自适应确定 NDVI 最优阈值,完成边界细化与像素级提取。实验在武汉 Sentinel-2 影像上验证,结果表明该方法在零人工像素级标注条件下取得较高精度,并优于多种植被指数法和公开土地覆盖产品。
城市绿地是缓解热岛效应、降低内涝风险、减少噪声污染、促进生物多样性和提升居民福祉的重要生态基础设施。传统人工调查效率低,植被指数法易受阴影、水体和屋顶干扰,深度学习方法又高度依赖像素级标注样本,因此亟需一种零标注、可迁移、可扩展的城市绿地提取技术。
人工调查与目视解译主观性强、更新周期长,难以满足快速城市生态监测和大范围绿地制图需求。
NDVI、EVI、SAVI 等植被指数对植被敏感,但自动阈值容易受水体、阴影、裸地和特殊屋顶颜色干扰。
CNN 与 Transformer 分类精度较高,但需要大量像素级训练样本,跨城市、跨季节和跨传感器迁移能力有限。
论文提出的无监督框架包含四个核心阶段:提示词设计、视觉与文本编码、跨模态相似度计算和基于约登指数的 NDVI 阈值细化。整体思路是先利用开放词汇模型找到“哪里像绿地”,再用植被指数完成“像素级边界修正”。
研究采用标准假彩色合成影像,将近红外、红、绿波段输入模型,并设计包含绿地场景语义和假彩色光谱表现的提示词。正向提示词描述 dense urban green space、park areas、bright red patches 等,负向提示词描述 gray urban areas、non-red regions、water bodies 等。
视觉编码器采用 Vision Transformer,将图像块转化为视觉嵌入;文本编码器将自然语言提示词转化为文本嵌入。二者被映射到统一跨模态语义空间,为开放词汇语义匹配提供基础。
通过计算图像块视觉特征与文本提示词特征之间的余弦相似度,识别与绿地语义最匹配的区域。该阶段输出的 OVSS 粗掩膜具有较强语义定位能力,但边界仍较粗,需要进一步细化。
以 OVSS 粗掩膜作为参考,分别统计绿地与非绿地区域 NDVI 分布,并通过约登指数自动确定最优阈值。该阈值最大化真正率与假正率之差,从而在漏检和误检之间取得平衡,生成最终精细化绿地结果。
实验表明,OVSS 粗掩膜与 NDVI 自适应阈值细化的组合,在无任何人工像素级标注的情况下获得较高精度。该方法在 F1 分数、总体精度和召回率方面均优于多数传统指数法和公开土地覆盖产品。
| 对比对象 | 主要结果 | 差异与解释 |
|---|---|---|
| 6 种植被指数 + Otsu | 本文框架优于 NDVI、EVI、SAVI、GNDVI、VARI、NDRE 等指数法。 | 相较最优植被指数 SAVI,F1 分数提升 1.48%,OA 提升 2.2%。 |
| 公开土地覆盖产品 | 对比 ESA Worldcover、Dynamic World、ESRI LC、GLC_FCS10。 | 本文框架在召回率、F1 分数和 OA 三项指标上均位居第一。 |
| HSV 色彩空间分割 | HSV 精确率较高,但召回率仅 67.87%。 | HSV 依赖人工颜色阈值,严重漏检;本文框架召回率达到 95.67%。 |
本文验证了“无监督 OVSS 掩膜驱动植被自适应提取”的有效性。相比传统监督深度学习,该框架不需要像素级标注;相比传统指数阈值法,它通过跨模态语义理解提高了复杂城市环境下的鲁棒性。
无需人工像素级训练样本,即可完成大范围城市绿地高精度制图,降低了数据制备成本。
将近红外光谱先验融入 CLIP 提示词和假彩色影像输入,实现语义知识与遥感光谱信息的结合。
利用约登指数自动确定 NDVI 阈值,避免人工经验阈值不稳定,提高不同城市景观下的适应性。