Geo-Information Science · Building Group Pattern Recognition

全连接图耦合自注意力机制的建筑群空间模式识别方法

A Building Group Spatial Pattern Recognition Method Based on Fully Connected Graphs Coupled with a Self-Attention Mechanism
王灵 李精忠 闫浩文 王小龙 刘振跃 柴润泽 余斌 地球信息科学学报 2026, 28(9): 2775–2794 DOI 10.12082/dqxxkx.2026.260259
Abstract · 摘要 【目的】针对现有建筑群空间模式识别方法难以同时刻画局部邻近关系与整体空间结构依赖的问题,提出一种基于全连接图与Transformer自注意力机制的建筑群空间模式识别方法。【方法】首先,基于建筑物矢量数据进行空间约束聚类,形成建筑群组;其次,以建筑物为节点、建筑物对为候选关系构建全连接图,并综合建筑物尺度、方向、形态复杂度和群组结构特征构建节点表示;最后,引入Transformer自注意力机制学习建筑物对关系权重,实现建筑群局部关系与整体结构的联合建模。【结果】以成都市建筑物数据为实验对象,在直线型、格网型和不规则型3类模式识别任务中进行验证。结果表明,本文方法在测试集上的整体识别准确率达到94.78%,准确率、精确率、召回率、F1分数和Kappa分别为0.948、0.948、0.948、0.948和0.922;相比Random Forest、GAT和GCN,本文方法的整体准确率分别提高16.10%、6.40%和8.60%,宏平均F1分数分别提高16.90%、6.50%和9.00%。特征消融、图结构对比和跨地域实验进一步验证了精选特征组合、全连接候选关系空间和少量目标域样本微调的有效性。【结论】本文方法能够在候选关系空间中自适应筛选关键建筑物对,增强建筑群局部邻近关系与整体拓扑结构的联合表达能力,为复杂城市形态场景下的建筑群空间模式识别提供方法支撑。
建筑群模式识别 Transformer 全连接图 自注意力机制 图表示学习 矢量建筑物 地图综合
Scroll · 向下滚动
Section 01 · Background & Challenges

局部邻近与整体结构:难以兼得的空间表达

建筑群空间模式是建筑物在空间分布、排列方向与结构组织等方面形成的规律性形态,是城市空间形态表达、地图综合和自动制图的重要基础。已有研究通常将其概括为直线型、格网型和不规则型等典型类别。然而,现有识别方法在刻画局部邻近关系的同时,往往难以表达群组层面的整体结构依赖,这构成了本文试图解决的核心矛盾。

CHALLENGE 01

几何规则方法:阈值与普适性困境

几何方法通过判断群组内相邻建筑物的几何相似性并依据特定模式规则识别,如模板匹配、中心或边缘对齐探测等。但该方法基于拓扑关系制定规则,而地理空间模式形态并非理想化,常需针对具体问题手动调整参数,存在参数阈值难确定、规则与参数尺度普适性差的问题。

CHALLENGE 02

传统机器学习:关系建模缺位

支持向量机、随机森林等分类器可依据样本自动生成分类规则,无需人工设定经验参数且不受特定尺度限制。但其局限性在于样本数据要求高、特征因子选择困难、模型泛化能力不足,且缺乏对建筑群内部建筑物对关系与远距离结构依赖的显式建模。

CHALLENGE 03

图卷积方法:局部聚合的局限

矢量数据栅格化预处理易弱化空间对象的几何结构、位置形态规则及语义组织特征。图卷积神经网络可直接处理不规则图数据并用于建筑群模式识别,但受预设邻接关系影响较大,侧重于局部邻域信息聚合,在处理建筑群全局结构与远距离结构依赖时仍存在局限。

11 478单体建筑数量
成都市 OSM 实验数据
1 336聚类得到的建筑群组
用于模式识别样本单元
3 类典型空间模式
直线型 · 格网型 · 不规则型
16 类候选特征
经消融精选为 11 类输入

Section 02 · Framework & Architecture

几何建模—特征表示—模式识别三段式框架

本文优先选取分布较广、结构特征较典型的直线型、格网型和不规则型三类建筑群空间模式作为研究对象,构建了由几何结构建模、特征表示、模式识别组成的技术框架。首先基于建筑物矢量数据通过空间约束聚类实现建筑群组划分,并以建筑物为节点构建全连接图,为后续关系建模提供统一的候选交互空间;其次从几何、方向、形状与密度四个维度提取多尺度特征,构建节点特征矩阵;最后引入Transformer自注意力机制对全连接图中的节点关系进行自适应学习,并在图级表示层完成模式判别与分类。

01

建筑群组划分与全连接图构建

依据城市形态学理论,以道路与河流作为结构边界将研究区划分为若干空间单元,降低聚类异质性;在每个空间单元内采用HDBSCAN方法对建筑物质心聚类,实现建筑群组自适应识别与噪声剔除。随后以建筑物为节点,将同一建筑群内两两建筑物的潜在关系作为候选边构建无向全连接图:含 n 个建筑物的群组在不考虑自环时包含 n(n-1)/2 条候选边。全连接图中的边仅表示候选空间关系,不代表真实空间邻接强度,其作用是使任意建筑物对均可参与关系学习,从而避免依赖K近邻、距离阈值或Delaunay三角网等预定义稀疏邻接结构带来的偏差。

HDBSCAN空间约束聚类道路河流分割无向全连接图
02

多尺度节点特征构建

以视觉认知理论和格式塔组织原则为基础,使用Bertin视觉变量从几何、方向、形状与密度 4 个维度共 16 类候选特征进行量化表达。节点级特征包括面积、周长、质心坐标、平均半径、SBRO、主朝向、WSWO、紧凑度、分形维数、伸长率、凹度和重叠度;群组级特征包括正交性、长轴方向、对齐度和群组密度。模型输入时将群组级结构特征复制到同一建筑群内各建筑物节点并与节点级特征拼接,形成增强节点表示,所有连续特征经归一化后参与训练与推理。

Bertin视觉变量节点级特征群组级结构特征主成分分析
03

全连接关系自注意力学习

将原始节点特征映射到统一空间,同时对质心坐标进行位置编码,二者相加得到节点初始表示。在每一层Transformer编码器中,对全连接图执行多头自注意力计算,由查询、键、值矩阵得到 n×n 的注意力权重矩阵,在统一候选关系空间内评估任意建筑物对之间的潜在空间关联——既为距离较近且形态相似的建筑物分配较高权重,也能捕捉相距较远但共同构成整体排列结构的建筑物关系。每层引入残差连接、层归一化与前馈网络保证训练稳定性。

Transformer编码器多头自注意力位置编码GELULayerNorm
04

图级注意力聚合与模式判别

引入可学习查询向量计算各节点重要性得分,经Softmax归一化为注意力权重后加权求和得到建筑群图级嵌入表示。与全局平均池化不同,该策略能够突出关键结构节点:直线型中沿主方向连续排列的建筑物贡献较高,格网型中位于正交骨架或局部交汇结构附近的建筑物更具判别力,不规则型中形态复杂、方向离散的建筑物区分作用更强。最后将图级表示输入全连接分类层,经Softmax输出模式类别概率,并以交叉熵损失端到端训练。

注意力图级聚合Softmax分类交叉熵损失
SUPPLEMENT A · 数据集

成都市 OSM 建筑物数据

成都市建筑群在建筑数量、建筑尺度、空间密度、主方向一致性以及道路分割条件等方面差异明显,样本既包含沿道路连续排列的线性建筑群,也包含具有平行或正交组织特征的规则建筑群,以及方向和间距较离散的不规则建筑群。数据包含 11 478 个单体建筑,经聚类得到 1 336 个建筑群;由 3 名地理信息专业研究生人工判读并交叉复核标注,最终得到 437 组直线型、440 组格网型、459 组不规则型,按 6:2:2 分层抽样划分为训练集、验证集和测试集。

SUPPLEMENT B · 实验设置

模型参数与硬件环境

实验基于 PyTorch 框架实现,硬件环境为 i7-14700HX 中央处理器与 RTX 4060 图形处理器。11 类属性特征经特征投影层映射为 96 维表示,节点质心坐标经线性映射与激活函数得到 96 维位置嵌入,二者融合形成 192 维节点表示。Transformer 编码器层数设为 4,每层 8 个注意力头,采用图级注意力聚合获得建筑群整体表示。敏感性分析最终确定丢弃率 0.1、隐藏层维度 150、学习率 0.001、编码层数 4、权重衰减系数 0.000 5、批量大小 16。


Section 03 · Experiment & Results

识别精度、图结构与泛化能力的三重验证

实验从识别精度、参数敏感性、模型对比、空间关系图结构对比、模型复杂度与推理效率、特征贡献、跨地域泛化和注意力解释等方面展开。3 类建筑群模式均取得较高识别效果,其中格网型召回率最高(0.966),不规则型精确率与 F1 分数分别为 0.967 和 0.956,直线型 F1 分数为 0.948;误分类主要集中在直线型与格网型之间,说明二者在局部排列规整性和方向一致性方面具有一定相似性。

94.78%测试集整体识别准确率
成都市同地域测试
0.948宏平均 F1 分数
宏平均精确率 0.949
0.922Kappa 系数
分类一致性指标
2.38–2.45 ms单样本平均推理时间
不同规模建筑群区间
模型 准确率 (A) 精确率 (P) 召回率 (R) F1 分数 Kappa
Transformer(本文) 0.948 0.948 0.948 0.948 0.922
GAT 0.884 0.883 0.883 0.883 0.826
GCN 0.862 0.855 0.861 0.858 0.793
Random Forest 0.787 0.774 0.784 0.779 0.681
空间关系图结构 精确率 (P) 召回率 (R) F1 分数
全连接图(本文) 0.949 0.948 0.948
Delaunay 三角网邻接图 0.881 0.880 0.881
KNN-5 邻接图 0.842 0.843 0.843
距离阈值邻接图 0.825 0.825 0.825
FINDING 01 · 模型对比

全面优于三类对比模型

本文方法在基本精度、平衡精度、宏平均 F1、加权 F1、MCC 和 Kappa 等指标上均高于对比模型。整体准确率较 Random Forest、GCN、GAT 分别提高 16.10%、8.60% 和 6.40%,宏平均 F1 分数分别提高 16.90%、9.00% 和 6.50%。RF 依赖人工特征难以表达空间关系,GCN 受预设邻接结构限制,GAT 虽以注意力区分邻接节点重要性但仍依赖固定邻接边。

FINDING 02 · 图结构对比

全连接候选关系空间最优

在相同节点特征、编码器结构与训练参数下仅改变候选边集合,全连接图取得最优结果,较对比方法中的最优模型 Delaunay 三角网分别提高 6.80%、6.80% 和 6.70%。KNN-5 与距离阈值邻接图受局部邻接范围限制,易在直线型与格网型之间误分;Delaunay 三角网能刻画局部拓扑,却仍难表达远距离结构依赖。

FINDING 03 · 泛化与效率

小样本微调显著缓解地域差异

跨地域测试中模型在武汉市、上海市测试集准确率分别为 0.861 2 和 0.841 2;按类别抽取 20% 目标域样本微调后分别提升至 0.899 2 和 0.883 6,宏平均 F1 分数提升至 0.899 0 和 0.883 5。效率方面,较大规模建筑群平均候选边数达 1 460.00 条,但单样本平均推理时间仍保持在 2.38~2.45 ms 区间。

本文所提方法并非平均利用全连接图中的所有建筑对关系,而是能够根据不同空间模式自适应突出关键节点与关键建筑对关系。Transformer 自注意力机制可在全连接候选关系空间中筛选具有判别意义的结构信息,降低无效连接干扰,增强对建筑群局部邻近关系与整体拓扑结构的联合表达能力。

— 核心发现 · 注意力可视化与消融分析结论

Section 04 · Conclusion & Prospect

联合表达能力的验证与未来议程

本文面向建筑群空间模式识别中局部邻近关系与整体结构依赖难以统一表达的问题,提出全连接图耦合 Transformer 自注意力机制的识别方法,并以成都市建筑物数据为主要实验对象,结合模型对比、图结构对比、特征消融、跨地域泛化和注意力可视化等实验对方法有效性进行验证。

CONTRIBUTION 01

整体精度与类别均衡性

在成都市测试集上取得 94.78% 的整体准确率,宏平均精确率、召回率和 F1 分数分别为 0.949、0.948 和 0.948,3 类建筑群模式均获得较高识别效果,说明全连接候选关系空间与自注意力机制相结合能够有效表达局部排列关系和整体空间组织结构。

CONTRIBUTION 02

结构与特征的双重增益

空间关系图结构对比中,全连接图较最优对比模型 Delaunay 三角网分别提高 6.80%、6.80% 和 6.70%;特征消融实验表明,精选 11 类特征组合的宏平均 F1 分数较全部 16 类候选特征、仅节点级特征和仅群组级特征分别提高 0.128、0.088 和 0.076。

CONTRIBUTION 03

可解释性与计算可行性

注意力遮蔽与可视化表明,高注意力建筑物对和高贡献节点与模式判别具有较强关联,能够解释 3 类建筑群的关键结构关系。复杂度分析表明,尽管候选边数量随节点规模快速增长,单样本推理时间整体仍保持在 2.38~2.45 ms 范围内。

APPLICATION VALUE

应用价值

准确识别建筑群空间模式有助于理解城市空间组织特征,并为建筑群抽象、结构保持和空间关系表达提供依据,可支撑城市空间形态表达、地图综合与自动制图等任务。方法以矢量建筑物数据直接建模,无需栅格化预处理,在武汉市与上海市的跨地域测试中保持一定识别能力,少量目标城市样本微调后 F1 分数分别提升至 0.899 0 和 0.883 5,具备跨地域迁移应用潜力。

LIMITATIONS & FUTURE

局限与未来

研究对象主要为直线型、格网型和不规则型三类典型模式,对环形、弧线型、口字型、星型和混合型等复杂模式仍需扩展样本并完善多类别或层级分类体系;跨地域实验目前仅选取武汉市和上海市作为目标城市,未来可引入更多不同地域、密度与规划结构的城市样本。考虑到注意力计算复杂度随节点数量呈二次增长,后续可结合候选边预筛选、稀疏注意力、层次化建筑群划分和结构先验约束等策略提升推理效率。