Geo-Information Science · Boundary-Aware Segmentation

基于视觉基础模型的边缘感知语义分割网络

BASS-Net: Boundary-Aware Semantic Segmentation Network for Remote Sensing Imagery with Visual Foundation Models
邹毓杰 金飞 芮杰 王淑香 林雨准 姜建芳 刘潇 程传祥 王新平 地球信息科学学报 2026, 28(9): 2744–2762 DOI 10.12082/dqxxkx.2026.260129
Abstract · 摘要 【目的】 针对现有方法在深层语义特征与浅层边缘特征协同融合方面的不足,以及由此导致的地物边界模糊、分类精度受限等挑战,本文提出了一种基于视觉基础模型的边缘感知语义分割网络BASS-Net。 【方法】 BASS-Net是融合传统边缘先验知识与视觉基础模型特征的双分支学习框架:首先采用SAM2的特征提取器作为骨干网络,有效捕获地物的多尺度特征;然后设计多尺度特征连接解码器,通过多层感知机模块和特征融合模块实现深层和浅层特征的自适应融合,增强语义细节恢复能力;最后引入边缘辅助分支,在训练阶段结合Sobel算子与多尺度特征融合机制,引导模型优化边缘区域的分割效果。 【结果】 在ISPRS Vaihingen与ISPRS Potsdam数据集上对比了用于遥感影像分类的多种方法,包括A2FPN、ABCNet、BANet、CMTFNet、MANet、UNetFormer、DOCNet、LoGCAN++、SACANet、PEEN、MSEONet。实验结果表明,BASS-Net总体分类精度分别达到了93.26%和92.14%,相较于次优方法分别提高1.98%和0.36%, mIoU 分别达到85.58%和87.59%,相较于次优方法分别提高3.39%和0.82%。特别地,在边缘交并比上分别实现了51.01%和48.28%的精度表现,相较于次优方法分别提升1.92%和0.40%。说明BASS-Net能够同时兼顾全局语义一致性与局部边缘细节刻画,整体综合性能优于现有主流语义分割方法。 【结论】 客观数据证实,BASS-Net在保证全局语义一致性的同时,能够有效解决复杂场景下的边缘粘连与破碎问题。
影像分类 语义分割 视觉基础模型 边缘提取 双任务 多尺度特征融合 土地利用分类 遥感影像
Scroll · 向下滚动
Section 01 · Background & Challenges

高分辨率影像解译:边界为何总是模糊

遥感传感器与平台技术的飞速发展显著降低了高分辨率遥感影像的获取成本,影像数据呈爆炸式增长,如何从海量数据中准确分类出不同地物已成为地球观测任务的核心。然而高分辨率遥感影像背景极其复杂,在光谱维度上存在同物异谱与异物同谱导致的光谱混淆,在空间结构维度上地物尺度变化剧烈且拓扑关系错综复杂,二者共同制约着网络对地物边界的精确刻画。

CHALLENGE 01

光谱混淆与尺度剧变

同一场景中不同地物尺度变化剧烈,同一地物内部又存在显著的光谱异质性。同物异谱与异物同谱造成严重的光谱混淆,建筑物与不透水面等类别在光谱上高度相似;而树木阴影大面积覆盖低矮植被时,局部光谱特征丧失,模型极易发生类间侵蚀与粘连,最终表现为建筑物边缘呈锯齿状或与周边背景连成一片。

CHALLENGE 02

深浅层特征融合不充分

卷积操作固有的局部感受野使 CNN 在长距离依赖建模上受限;标准 Transformer 的自注意力计算复杂度随图像尺寸呈二次方增长,难以承受高分辨率影像。现有多尺度融合研究过于侧重编码阶段,在解码阶段对深浅层特征的融合缺乏足够关注,恢复浅层边缘特征时仍依赖简单的拼接或相加,缺少自适应的特征筛选机制。

CHALLENGE 03

边缘先验缺失与域差异

视觉基础模型多在自然场景上预训练,直接迁移至遥感解译面临严峻的域差异挑战。同时,深层连续下采样导致高频边缘信息丢失、边界平滑化;现有多任务方法过度依赖网络自动学习边缘语义,忽略了 Sobel、Canny 等传统算子蕴含的精确梯度物理先验,面对同谱异物时边界不够锐利甚至断裂,单一尺度的边缘融合也限制了对不同大小地物的精细化重构。

2 个ISPRS 基准数据集
Vaihingen / Potsdam
6 类土地覆盖类别
不透水面 建筑物 低矮植被 树木 汽车 背景
11 种主流对比方法
无辅助 / 语义辅助 / 边缘辅助
33 / 38影像数量(幅)
Vaihingen 33 · Potsdam 38

Section 02 · Framework & Architecture

BASS-Net:编码器—解码器—边缘分支三段协同

BASS-Net 以遥感正射影像为输入,整体流程为「Hiera 编码器 → 多尺度特征连接解码器 MFCD → 地物分类掩膜」;训练阶段另由边缘辅助分支接收 MFCD 的中间特征,输出边缘分割图并独立计算损失,形成额外的梯度回传通道。网络通过冻结预训练权重加适配器微调的策略迁移视觉基础模型,用 MFCD 强化深浅层特征自适应融合,并以融合 Sobel 梯度先验的边缘分支增强对地物边界的感知与定位。

01

Hiera 特征编码器:冻结权重 + 适配器微调

采用 SAM2 框架中预训练的 Hiera 编码器作为骨干。其分阶段下采样的金字塔结构天然适配遥感地物的多尺度特性,跨窗口注意力机制在保证全局感受野的同时大幅降低计算复杂度。编码器四阶段逐级将特征图空间尺寸减半、通道数翻倍,形成特征金字塔。为缓解通用基础模型迁移到遥感场景的域差异,训练阶段全量冻结 Hiera 预训练权重,仅在每个阶段输出后嵌入轻量级可学习适配器(批归一化—ReLU—1×1 卷积瓶颈结构),将各阶段动态通道数强制对齐并统一映射为固定维度。

SAM2Hiera冻结预训练权重Adapter 微调跨窗口注意力
02

多尺度特征连接解码器 MFCD

解码器由 3 个多层感知机块(MB)、2 个权重处理模块(WP)与 1 个特征融合模块(FF)构成。最深层语义特征 F4 直接输入 MB 进行上下文处理;中间层特征 F2、F3 先经 WP 模块以可学习注意力权重动态评估其与深层特征的语义跨度,权重经 ReLU 保证非负并归一化至 [0,1] 区间后分配跳跃连接强度,再送入各自对应的 MB。各层级优化后的特征流最终汇聚于 FF 模块,先相加融合 D1 与 F1,再经通道与空间双路径注意力增强,最后通过卷积分类头与双线性插值恢复至输入分辨率。

MBWPFF可学习融合权重双路径注意力
03

边缘辅助分支:EDB 与 Sobel 梯度先验

边缘解码块(EDB)以通道拼接方式融合主解码器的深层语义特征与边缘分支的几何细节特征,包含 3 个并行卷积分支,核心的转置卷积分支负责步长还原与空间增强,避免简单逐像素相加造成的信息稀释。边缘模块(EM)弃用不可微的 Canny 算子与对噪声敏感的 Laplacian 算子,改用集成高斯平滑的 Sobel 一阶梯度算子,分别计算水平与垂直方向梯度响应,经 L2 范数聚合为统一边缘响应强度图,Sigmoid 激活抑制虚假噪声边缘后与原始特征逐像素相加,再引入高效通道注意力并经卷积、激活与上采样输出边缘预测图。该分支训练阶段独立监督,测试阶段可直接舍弃。

Sobel 算子梯度物理先验EDBEM端到端可微
04

联合损失与双任务协同优化

总体损失由主分割损失与边缘一致性损失加权构成:主分割损失采用交叉熵,逐像素度量预测概率与真实标签的差异;边缘一致性损失定义为 1 减去边缘度量 BF1,BF1 由边缘精确率与召回率调和平均得到,最小化该损失可促使模型更关注地物边缘。平衡系数 λ 由超参数实验确定,取值为 0.1,使模型在学习深层语义信息的同时不对浅层边缘细节产生过度抑制。

交叉熵损失BF1 边缘度量λ = 0.1双任务协同
SUPPLEMENT A · 数据集

ISPRS Vaihingen 与 Potsdam

Vaihingen 由 33 幅大小不一的正射影像组成,含近红外、红、绿 3 个波段,空间分辨率 9 cm,涵盖不透水面、建筑物、低矮植被、树木、汽车与背景 6 类,训练集 12 幅、测试集 4 幅。Potsdam 含 38 个 6 000×6 000 像素影像块,地面分辨率 5 cm,提供红、绿、蓝、近红外 4 个多光谱波段及 DSM 与 NDSM,实验仅采用红、绿、蓝 3 个波段,土地覆盖类别与 Vaihingen 一致,训练集 28 幅、测试集 10 幅。

SUPPLEMENT B · 实验设置

训练配置与效率测试环境

统一配置为 Intel(R) Xeon(R) Gold 5220 CPU @ 2.20 GHz 与 Nvidia Tesla V100-PCIE-32 GB,基于 Python 与 PyTorch 实现,采用 SGD 优化器,学习率 0.01、动量 0.9、衰减系数 0.000 5,批量大小 4,训练 50 个 epoch,并采用随机水平翻转与垂直翻转进行数据增强。复杂度测试时输入窗口化为 512×512 像素、批次 4,在单张 Tesla V100 上统计参数量、浮点运算数与推理帧率。


Section 03 · Experimental Results

两数据集精度、消融与效率验证

本文在 ISPRS Vaihingen 与 Potsdam 两个数据集上与 11 种方法对比,并从平均 F1 分数、总体分类精度、边缘交并比与平均交并比 4 个指标综合评价;同时通过核心组件消融、解码器模块对照、超参数实验、编码器对比与边缘热力图可视化,系统检验各模块的贡献。

85.58%Vaihingen 平均交并比
较次优方法提升 3.39%
87.59%Potsdam 平均交并比
较次优方法提升 0.82%
51.01%Vaihingen 边缘交并比
较次优方法提升 1.92%
93.26%Vaihingen 总体分类精度
较次优方法提升 1.98%
方法 不透水面 建筑物 低矮植被 树木 汽车 MeanF1 OA Boundary IoU mIoU
BANet 85.64 90.92 72.97 88.48 62.33 80.07 85.75 41.38 68.06
A2FPN 91.52 95.55 77.33 89.63 83.59 87.53 89.94 45.60 78.38
DOCNet 90.83 95.55 78.02 89.10 86.02 87.90 89.68 45.03 78.89
CMTFNet 90.22 93.99 77.75 90.37 87.78 88.02 89.41 47.07 79.02
PEEN 90.93 93.43 79.12 91.97 82.76 88.04 92.74 48.52 79.69
SACANet 91.30 94.91 78.86 90.27 90.02 89.07 90.15 47.61 80.70
MSEONet 91.88 94.69 77.56 90.40 86.33 88.14 90.47 48.49 81.25
MANet 92.41 96.10 79.26 90.63 88.85 89.45 90.99 47.69 81.37
LoGCAN++ 91.56 95.52 80.98 91.55 88.00 89.52 91.02 48.27 81.38
ABCNet 92.86 96.66 80.39 90.47 89.14 89.90 91.35 47.04 82.08
UNetFormer 92.40 96.48 80.44 90.87 89.70 89.98 91.28 49.09 82.19
本文方法 94.60 97.85 84.12 92.23 91.42 92.04 93.26 51.01 85.58
方法 Params / M FLOPs / G FPS / (f/s)
PEEN 9.42 10.15 86.40
UNetFormer 11.68 11.74 79.50
BANet 12.73 13.06 52.81
ABCNet 13.39 15.63 73.19
A2FPN 22.82 41.83 120.77
LoGCAN++ 25.19 37.30 14.70
CMTFNet 30.07 33.07 32.20
SACANet 30.21 56.55 10.24
MANet 35.86 77.76 43.04
DOCNet 39.12 197.21 12.57
MSEONet 52.80 43.66 42.17
本文方法 216.31 222.12 12.92
FINDING 01 · 编码器

基础模型骨干带来层级增益

以 ResNet18 编码器与标准 Unet 解码器为基准,替换 Hiera 编码器后 mIoU 由 75.39% 提升至 78.59%,汽车等小目标与低矮植被等纹理复杂地物表现突出。跨编码器对比中,Hiera 在 Vaihingen 上 mIoU 达 85.58%,分别领先 ResNet101 与 VGG16 3.53% 和 5.58%;对低矮植被类别的相对增益最高达 6.76%,建筑物 F1 分数达 97.85%。

FINDING 02 · 解码器

自适应融合优于通用注意力

引入 MFCD 后 mIoU 提高 8.81%;在已有边缘分支的情况下加入 MFCD 仍带来 0.81% 的稳健增益。模块对照显示,将 WP 替换为 SE-Net 后 mIoU 下降至 84.12%,将 FF 替换为 CBAM 后低矮植被类别精度明显受限,验证了针对遥感尺度剧变与边缘敏感特性定制 WP 与 FF 模块的必要性。

FINDING 03 · 边缘分支

梯度先验与权重配比最优

在主分支基础上加入 Sobel 物理先验后,mIoU 提升 0.67%,建筑物与汽车等边缘敏感类别的 F1 分数均达到最优。超参数实验在 0.1 至 1.0 六组权重中比较,λ 为 0.1 时模型取得最优性能,MeanF1、OA 与 mIoU 分别达到 92.04%、93.26% 与 85.58%;权重处于 0.3 至 1.0 区间时各项指标偏低且波动平缓,过大的边缘权重会干扰主体语义特征学习。

客观数据证实,BASS-Net 在保证全局语义一致性的同时,能够有效解决复杂场景下的边缘粘连与破碎问题。

— 核心发现 · 基于视觉基础模型的边缘感知语义分割网络

Section 04 · Conclusion & Prospect

精度优势、应用价值与三条优化路径

针对高分辨率遥感影像语义分割中深浅层特征融合不充分、易引发地物边界粘连、轮廓模糊与结构信息丢失等问题,本文结合特征融合与边缘先验思想提出 BASS-Net,在 ISPRS Vaihingen 与 Potsdam 两个数据集上完成了对比、消融、参数与可视化四组验证。

CONTRIBUTION 01

提出双分支边缘感知框架

依托轻量级适配器实现通用视觉特征向遥感任务迁移,通过 MFCD 完成深浅层特征自适应融合,并引入融合 Sobel 梯度先验的边缘辅助分支,兼顾全局语义一致性与局部边界精细度。边缘分支在训练阶段独立监督,测试阶段可直接舍弃,不增加额外推理计算量。

CONTRIBUTION 02

复杂场景地物分割质量提升

两大数据集上平均交并比分别达 85.58% 与 87.59%,总体分类精度与边缘交并比同样领先;建筑物类别 F1 分数分别达 97.85% 与 97.05%,有效修复轮廓缺陷。针对树木、低矮植被等视觉特征高度相似的地物,Vaihingen 数据集低矮植被 F1 分数达 84.12%,较次优方法提升 3.14 个百分点,缓解了光谱混淆问题。

CONTRIBUTION 03

模块化消融与参数验证

阶梯式消融表明:引入 Hiera 编码器后 mIoU 由 75.39% 提升至 78.59%,增设 MFCD 后进一步提升 8.81%,融合边缘分支后最终达到 85.58%;六组权重对照实验证实边缘损失权重设为 0.1 为最优配置,各模块可协同发挥作用。

APPLICATION VALUE

应用价值

高分辨率遥感影像的精准地物分类在城市规划、环境监测与灾害评估等领域发挥着不可替代的作用。BASS-Net 在土地利用分类任务上展现出优越性,能够同时兼顾全局语义一致性与局部边缘细节刻画,在复杂高分辨率遥感场景中具备更强的综合分割能力与泛化性能,适用于建筑物轮廓提取、道路与车辆等细小目标识别以及阴影干扰下的植被精细分类等离线解译任务。

LIMITATIONS & FUTURE

局限与未来

受限于基础模型体量,BASS-Net 参数量为 216.31 M、浮点运算量达 222.12 G,推理帧率 12.92 FPS,计算与存储开销偏高,仅能满足遥感离线解译场景,在实时性要求高或硬件资源受限时存在明显局限,且分割效果存在一定场景不确定性。后续将从 3 个方面优化:融合光学与 LiDAR 高程等多模态遥感数据;探索提示学习驱动的弱监督、零样本迁移方法以降低标注依赖;利用模型蒸馏与结构化剪枝对编码器与边缘分支进行轻量化改造。