三类既有方法的共同短板:全局结构信息刻画不足
居民地群是城市空间形态中的重要空间单元,在自然地理环境与人类聚居活动共同作用下形成不同的几何规模、形态结构与方向组织,并表现为可区分的居民地群模式,与土地利用规划、公共服务配置和空间决策密切相关。现有识别方法可归纳为规则判别、特征分析和数据驱动三类,但在特征表达上多侧重单一形态指标或局部空间关系,在关系建模上又受邻域范围、图邻接关系或有限空间窗口的限制,对远距离居民地单元之间的潜在关联以及群体整体空间格局的表达能力仍较有限。
规则判别:依赖经验与阈值设定
规则判别方法通常依赖人工设定的结构参数、形态规则或判别阈值,对居民地群的空间形态和组织特征进行分类,如网格型、曲线型和不规则型等。这类方法具有较强的直观性和可解释性,能够反映居民地群的基本形态差异,但对研究者经验和阈值设定依赖较强,在面对形态复杂、区域差异明显的居民地群时,适应性明显不足。
特征分析:指标分散、层级组织不足
特征分析方法主要从形态结构、空间邻近关系和空间相似关系等方面构建描述指标,能够从多角度揭示居民地群内部结构差异。但已有研究多依赖面积、周长、邻近距离等单一或少量指标,不同特征之间相对分散,对居民地单元自身属性、单元之间空间联系与群体整体格局的协同表达仍不充分;特征表达的改进不应仅停留在指标数量增加上。
数据驱动:局部传播导致远距衰减
数据驱动方法利用主动学习、相关向量机、图卷积神经网络等提升自动化水平,但局部建模通常依赖邻域范围、图邻接关系或有限空间窗口进行信息交互。对于同时存在规模差异、疏密变化和形态复杂性的居民地群,仅依赖局部传播机制或预定义邻接关系,容易出现远距离信息传递衰减、尺度敏感和整体结构表达不足等问题。
几何 / 形态 / 方向三维度
几何形态方向 × 个体关系群体
小中大规模 × 稀疏紧密组织
北京 上海 重庆 图卢兹 德累斯顿
MSGR-Transformer:特征构建、关系建模与模式输出
为区别于标准 Transformer,本文将所提模型简称为 MSGR-Transformer(Multidimensional Structural Features and Global Relationship Transformer)。整体流程分为居民地群结构特征构建、居民地群结构关系建模和居民地群模式分类输出3个阶段:先依据结构特征指标体系完成特征数值计算、标准化处理、维度对齐和特征拼接,形成结构特征序列 X;再经线性嵌入层映射为特征嵌入 E,与位置编码 P 融合为 E+P 输入 Transformer 编码器,得到结构编码表示 H;最后基于 H 提取分类特征,经全连接层与 Softmax 输出居民地群结构模式。模型以 n×12 的结构特征矩阵作为输入,n 为群内居民地数量。
多维结构特征体系构建(12 项指标)
从结构维度与特征层级两方面构建概念框架:特征层级分为个体级(单元自身几何形态与方向属性)、关系级(单元之间相对位置与邻近程度)和群体级(群体空间范围、组织紧凑性与整体方向);结构维度分为几何、形态与方向。据此选取 12 项指标——几何维度包括凸包面积(CArea)、最小外接矩形面积(MERA)、居民地群内间距(DBR);形态维度包括紧密度(IPQ)、居民地群边数(Nsides)、异形度(DOD)、周长面积比(PAR)、面积与最小外接矩形比(AMR)、泰森多边形变异系数(VCV);方向维度包括惯性主轴方向(MAO)、长轴与正北夹角(CAN)、凸包方向(CHD)。
结构特征序列化与合理性检验
面向每个序列位置构建由个体级、关系级和群体级特征共同组成的结构输入向量,群体级指标由整体计算并在同群各位置共享。先对不同量纲、不同取值范围的指标标准化;再以居民地质心横坐标由小到大排序,横坐标接近时按纵坐标二级排序,仍接近或重合时以面积作辅助校正,从而将无序面状对象组织为具有稳定空间索引的特征序列。主成分分析显示前 6 个主成分累计贡献率达 84.865%,第 1—3 主成分贡献率分别为 22.145%、18.823%、15.374%;皮尔逊相关分析显示仅少数含义相近指标相关性较高(CArea 与 MERA 为 0.78,DOD 与 PAR 为 0.64,CAN 与 CHD 为 0.62),跨维度指标多为低相关(MAO 与 CArea、MERA、IPQ 分别为 0.05、0.06、0.03),说明特征集合未形成高度冗余。
嵌入层:高维映射与位置编码
嵌入层将结构特征序列映射到高维表示空间并引入位置信息。通过线性映射把结构输入向量投影至 d_model=128 的高维空间得到嵌入向量,所有嵌入向量叠加构成嵌入矩阵;为保持居民地图斑之间的空间顺序与相对位置关系,引入位置编码并与嵌入向量逐元素相加。由于不同居民地群包含的居民地数量 n 不一致,训练时对序列进行填充以实现批处理对齐,并构建注意力掩码屏蔽填充位置,确保自注意力计算仅发生在真实居民地之间。位置编码按质心坐标排序确定的序列索引生成,使序列位置稳定对应居民地群的结构组织信息。
编码器:自注意力驱动的全局关系建模
编码器用于建模输入特征序列中各位置之间的全局依赖关系。每个居民地空间单元先经线性映射生成查询(Q)、键(K)和值(V)向量,通过计算查询与键的点积相似度并经缩放归一化得到注意力权重矩阵 A,再将权重应用于值向量以融合全局信息(Z=AV),实现不同空间单元间的动态信息交互与结构特征加权聚合。模型能够在不依赖显式邻接关系的情况下自动捕捉居民地斑块间的空间依赖与形态差异;多头自注意力使模型并行关注不同几何、形态与方向特征,前馈神经网络进一步提升非线性表达能力。
模式分类输出
经多层编码器后得到最终输出表示 H∈R^(n×d),其中 n 为序列长度、d 为嵌入维度。从编码器输出序列中取最后一行向量作为居民地群的整体特征 h∈R^d,利用全连接层映射至类别空间得到输出向量 o=hW_o+b_0,再通过 Softmax 函数转化为各类别概率分布,并以最大概率对应的类别作为预测结果。训练阶段采用交叉熵损失函数对预测分布与真实标签进行优化,最终实现对六类规模与疏密组合模式的判定输出。
五城 OSM 居民地与 6 类模式标签
选取北京、上海、重庆、图卢兹和德累斯顿 5 个城市作为实验区:北京、上海居民地分布规整、块体大且密集;重庆受山地影响呈破碎化与带状延展;图卢兹和德累斯顿表现为中小尺度、分散化与自然街区导向形态。样本构建先从 Open Street Map 数据筛选带居民地属性的面状对象,剔除空几何、自相交、重复对象以及面积小于 50 m² 的异常对象;随后用 DBSCAN 聚类进行初始群组划分,邻域距离设为 100 m,最小样本数设为 5。规模类型依据规模指标以自然间断法划分为小、中、大 3 类,疏密类型依据紧密度指标等距划分为稀疏型与紧密型,组合形成 6 类模式标签。
硬件平台、超参数与数据划分
硬件平台运行 Ubuntu 22.04,配备 60 核心 AMD EPYC 9754 处理器与 NVIDIA RTX 4090D 显卡;软件环境基于 PyTorch 2.0,并结合 NumPy、Pandas 和 Scikit-learn 完成数据处理、特征分析、模型评估与可视化。模型主要参数为隐藏维度 128、编码器层数 4、注意力头数 4、前馈网络维度 256;训练采用交叉熵损失与 Adam 优化器,初始学习率 10⁻³、batch size 64、最大训练轮数 500、dropout 0.1、weight decay 10⁻⁴、随机种子固定为 42。全部样本按类别分层随机划分为训练集、验证集与测试集,比例为 70%、15%、15%,对应 4 996、1 071 和 1 067 个居民地群样本。
96.5% 测试精度:对比实验与空间泛化检验
实验以相同的输入特征、数据划分方式和评估标准比较 XGBoost、多层感知机(MLP)、UNet、图注意力网络(GAT)和双向长短期记忆网络(BiLSTM):XGBoost 反映传统机器学习在相同特征输入下的效果,MLP 比较基础神经网络的特征映射能力,UNet 与 GAT 分别对比局部特征提取与图结构关系建模,BiLSTM 作为序列建模基线。参数分析显示隐藏维度由 64 增至 128 时性能明显提升、继续增至 256 提升不明显;注意力头数为 2 时特征关联表达不足、增至 4 时效果最佳、增至 8 后改善有限;学习率 10⁻² 与 10⁻⁴ 均不利于稳定收敛,10⁻³ 时表现最优。
6 类居民地群模式
与测试集 0.965 结果接近
4 996 / 1 071 / 1 067
5 个测试城市逐一轮换
| 模型 | 建模思路 | 准确率对比 | 优势与不足 |
|---|---|---|---|
| XGBoost | 传统机器学习,基于相同结构指标输入进行分类 | 较本文方法低约 7.5% | 能够利用结构指标进行稳定分类;主要依赖统计特征,难以刻画复杂空间关联,相邻类别之间混淆更为明显 |
| MLP | 基础神经网络的浅层非线性特征映射 | 较本文方法低约 8.5% | 能够学习结构特征之间的非线性关系;缺少对空间位置关系和组织关系的建模,部分结构相近样本主类概率偏低 |
| UNet | 局部特征提取 | 较本文方法低约 5.5% | 对局部形态特征具有一定提取能力;更侧重局部特征,整体结构关系表达有限 |
| GAT | 图结构关系建模,依托预定义邻接关系 | 较本文方法低约 3.5% | 能够结合邻接关系表达空间联系;识别效果受预定义图结构影响较大 |
| BiLSTM | 双向序列建模基线 | 较本文方法低约 2.5% | 能够利用序列前后位置依赖信息;对全局关系和跨尺度结构表达不足,复杂模式下类别概率易分散 |
| MSGR-Transformer | 多维结构特征序列 + 自注意力全局关系建模 | 96.5%(最优) | 混淆矩阵对角线分布最集中,准确率、精确率、召回率和 F1 值均表现最好;6 个典型案例均给出正确主类预测且主类概率整体更高 |
验证与测试结果接近,无明显高估
训练损失与验证损失随轮次逐步下降并趋于稳定,说明训练过程具有较好的收敛性。验证集与测试集在准确率、精确率、召回率和 F1 值上的结果整体接近,测试集准确率为 0.965、验证集准确率为 0.957,其余指标变化幅度也较小;说明模型在验证阶段获得的性能并未出现明显高估,测试集结果能够较稳定地反映模型在独立样本上的泛化能力。分层抽样使六类结构模式在 3 个子集中的分布基本保持一致。
t-SNE 显示类内聚集、类间可分
特征空间的 t-SNE 可视化结果表明,6 类模式在二维嵌入空间中总体具有较好的类内聚集性和类间区分性,同类样本相对集中,不同类别之间仅存在少量局部重叠。这说明模型学习到的特征表示能够较好反映不同模式之间的结构差异,也印证了自注意力驱动的全局关系建模在增强判别力方面的作用。
五城分层交叉验证结果稳定
以 5 个城市为分组单元,每轮选取一个城市全部样本作为独立测试集、其余 4 个城市用于训练与验证。结果显示准确率为 0.942 至 0.979,F1 值为 0.884 至 0.976,Kappa 系数为 0.909 至 0.972。其中上海样本的准确率、F1 值和 Kappa 系数均较高,分别为 0.979、0.976 和 0.972;德累斯顿样本的精确率、召回率和 F1 值相对较低,分别为 0.864、0.878 和 0.884,说明城市间类别分布与局部形态差异会带来一定指标波动。
选取北京、上海、重庆、图卢兹和德累斯顿 5 个城市的典型居民地群样本开展实验,所提方法对 6 类居民地群模式的整体分类准确率达 96.5%;相较于 XGBoost、MLP、UNet、GAT 和 BiLSTM,准确率分别提升约 7.5%、8.5%、5.5%、3.5% 和 2.5%。
三项贡献、应用条件与后续研究议程
本文在特征构建方面从几何、形态和方向 3 个结构维度出发,结合个体级、关系级和群体级特征层级,构建包含 12 项指标的居民地群结构特征体系,并通过特征数值计算、标准化处理、维度对齐和特征拼接形成结构特征序列;在结构关系建模方面将 Transformer 编码器作为全局关系建模工具,利用自注意力机制学习群内居民地之间的跨单元关联关系,从而增强对居民地群整体组织结构的表达能力。
多维结构特征体系
12 项指标构成的特征体系能够同时表达居民地单元自身属性、单元之间空间关系和群体整体格局,为模式识别提供较完整的结构信息。主成分与相关性分析表明,所选指标信息并未集中于单一主成分,而是分散在多个主成分中共同表达结构差异,整体上未形成高度冗余的特征集合。
结构特征序列化表达
结构特征序列能够将居民地群由无序空间对象组织为具有稳定索引关系的模型输入,为后续关系建模提供基础。序列化使每个居民地单元成为序列中的一个节点,通过节点特征及节点间联系表达整体空间结构,也使居民地群的结构表达方式与模型的输入形式和关系建模机制相匹配。
自注意力全局关系建模
自注意力驱动的全局关系建模能够增强模型对远距离单元关联和整体组织关系的表达能力,使模型在不同规模与疏密状态的居民地群样本中表现出较好的识别能力。5 城样本上总体分类准确率达到 96.5%,说明多维结构特征与全局关系建模相结合能够有效提升识别性能。
应用价值
居民地群模式不仅反映居民地单元在一定范围内的空间组织特征,也影响城市形态演化,并与土地利用规划、公共服务配置和空间决策密切相关,因此开展模式识别对国土空间规划和城乡建设用地结构优化具有研究意义。本文方法在跨国家、跨形态的 5 个城市样本上均取得较好结果,其 6 类规模与疏密组合模式体系可量化、可复现;分类结果可作为后续细粒度居民地群模式识别的粗分层结果,使后续研究能够在相同规模与疏密背景下进一步识别不同语义结构模式。
局限与未来
方法的应用效果与居民地矢量数据质量、空间覆盖范围和制图比例尺有关;当应用于不同国家、不同比例尺数据或更复杂的城市居民地布局语义识别任务时,现有结构特征体系和分类阈值仍需结合目标区域的数据分布特征做必要调整。当前 6 类模式主要面向规模状态与组织疏密状态差异,尚未扩展至网格状、带状、组团状、分散状等更细粒度布局语义类型。未来将结合不同空间范围和不同比例尺数据开展测试,并在六类模式内部进一步融合道路网络、街区边界、建筑排列关系和功能区结构等信息。