DLFT:基于两阶段的中国传统建筑
图像自动修复网络

齐舒丹、李少丹、姚奇、等 地球信息科学学报 · 2026 · 28(7): 2126-2140 DOI: 10.12082/dqxxkx.2026.250382 DeepLabv3+ / Transformer / FFC / CPL

本文针对中国传统建筑图像在数字化保护与三维重建中常受行人、树木、车辆、阴影等前景物体遮挡的问题,提出一种两阶段自动修复网络 DLFT。该方法首先利用 DeepLabv3+ 自动检测并分割遮挡区域,生成像素级掩膜;随后采用面向传统建筑结构特征的 Transformer 编码器—解码器修复网络,并在瓶颈层引入快速傅里叶卷积 FFC 以增强全局感受野,同时设计复合感知损失 CPL 约束像素精度、纹理风格、视觉真实性和平滑一致性。实验表明,DLFT 在传统建筑立面图像和遥感屋顶图像修复中均优于多种主流方法,并能显著提升下游建筑风格分类任务性能。

传统建筑 图像修复 自动掩膜 Transformer 快速傅里叶卷积 复合感知损失
↓ 向下滚动阅读

01 · 研究背景与问题

遮挡修复是传统村落数字化中的关键前处理环节

中国传统村落建筑具有鲜明的地域流派、复杂纹理和规则化结构布局。互联网立面照片与遥感屋顶影像常包含行人、树木、路灯、车辆和阴影等遮挡物,若不进行修复,会影响建筑风格识别、立面建模、屋顶结构提取和三维重建质量。

人工掩膜依赖强

许多图像修复方法需要人工标注遮挡区域,耗时费力,且掩膜边界质量直接影响修复效果。

通用模型缺乏建筑先验

传统建筑包含檐口、窗体、屋顶、墙面纹理等结构化元素,通用修复模型容易生成不符合建筑逻辑的纹理。

局部卷积难建模全局关系

屋顶空间格局、立面对称结构和长距离纹理延续需要全局感受野,传统卷积难以充分捕捉。

6
覆盖传统建筑流派
1500
分割标注图像
5446
立面修复训练图像
5446
遥感屋顶训练图像

02 · DLFT 两阶段网络架构

先自动找出遮挡,再面向建筑结构进行修复

DLFT 由自动检测分割阶段和图像修复阶段组成。第一阶段解决“修哪里”的问题,第二阶段解决“如何修得合理”的问题。其核心是将遮挡分割、Transformer 全局建模、FFC 频域全局感受野与 CPL 多目标损失统一起来。

D1
DeepLabv3+ 自动遮挡分割

第一阶段采用 DeepLabv3+ 对行人、树木、路灯、车辆等前景遮挡进行像素级分割。编码器通过空洞卷积扩大感受野,ASPP 模块融合多尺度上下文,解码器结合低级细节与高级语义,最终生成遮挡掩膜并输入修复网络。

DeepLabv3+ Atrous Conv ASPP Mask Generation
T2
Transformer 编码器建模长距离依赖

修复网络采用编码器—解码器结构,编码器包含 4 级 Transformer 块和下采样层。LAG 门控线性注意力增强全空间特征交互,FFN 对特征进行非线性转换,使模型能够理解传统建筑立面和屋顶中的长距离结构关系。

Transformer LAG Linear Attention FFN
F3
快速傅里叶卷积 FFC 扩展全局感受野

在编码器最后一级之后嵌入 FFC 模块:局部分支使用普通卷积保持细节,全局分支通过二维实快速傅里叶变换进入频域处理长距离关系,再经逆变换回到空间域。频域全局建模有助于减少修复区域边界伪影和纹理不连续。

FFC Real FFT2d Global Branch Local Branch
U4
解码器与跳跃连接恢复细节

解码器通过最近邻插值和 3×3 卷积逐级上采样,并利用跳跃连接融合编码器低层纹理细节与高层语义信息。谱归一化判别器参与对抗训练,从多尺度特征层面提升生成结果真实感。

Decoder Skip Connection Spectral Norm GAN
C5
复合感知损失 CPL

CPL 综合重建损失、感知损失、风格损失、对抗损失和全变分损失,分别约束像素精确性、高层语义一致性、纹理风格一致性、视觉真实感和边缘平滑性,使修复结果更符合传统建筑的结构与纹理逻辑。

L_rec L_perc L_style L_adv L_tv

DLFT 解决的关键问题

  • 自动生成遮挡掩膜,减少人工交互。
  • 通过 Transformer 捕捉建筑结构长距离依赖。
  • 通过 FFC 引入频域全局感受野。
  • 通过 CPL 同时约束像素、语义、纹理和视觉真实感。

数据集覆盖范围

  • 来源:“中国传统聚落数字博物馆”平台。
  • 流派:晋派、京派、苏派、徽派、闽派、川派。
  • 对象:建筑立面图像与遥感屋顶图像。
  • 测试:真实遮挡测试集与模拟遮挡测试集。

03 · 实验结果与任务验证

DLFT 在立面与遥感屋顶修复中均取得最优表现

论文将 DLFT 与 Hourglass、RFRNet、DWTNet、PRVSNet、CTSDGNet 等主流模型对比,并使用 PSNR、SSIM 以及建筑风格分类任务指标进行评价。结果表明,DLFT 不仅提升传统图像质量指标,也增强了下游模型对檐口、屋顶、窗体等关键特征的识别能力。

35.100 dB
立面 PSNR
0.875
立面 SSIM
34.270 dB
遥感 PSNR
0.886
遥感 SSIM
实验类型 DLFT 表现 主要结论
模拟遮挡:建筑立面 20%—30% 掩膜比例下,PSNR 为 35.100 dB,SSIM 为 0.875。 能够恢复窗户轮廓、房檐走向和墙面纹理,减少颜色不一致与纹理模糊。
模拟遮挡:遥感屋顶 PSNR 为 34.270 dB,SSIM 为 0.886。 能修复“回”字型屋顶等复杂空间布局,边缘过渡自然。
消融实验:加入 FFC 立面 PSNR 提升 2.2%,遥感图像提升 1.8%。 频域全局特征对传统建筑整体结构恢复具有关键作用。
消融实验:加入 CPL PSNR 进一步提升 0.2%—0.5%,SSIM 明显优化。 多维度损失约束使修复结果更符合人类视觉感知。

真实遮挡下的定性优势

  • 立面修复中,窗体、墙面和房檐结构更连续。
  • 遥感修复中,屋顶边界与空间布局更自然。
  • 相比部分模型,DLFT 更少出现色斑、伪影和纹理漂移。
  • 修复区域与未遮挡区域过渡更平滑。

下游建筑风格分类验证

  • 修复后图像提升 MobileNet、VGG、DenseNet 等分类模型性能。
  • 以 MobileNet 为例,立面宏平均精确度从 75.88% 提升至 80.31%。
  • F1-score 从 75.78% 提升至 80.46%。
  • 说明修复增强了模型对檐口、屋顶、窗体等关键特征的识别。
核心发现:DLFT 的价值不只是“让图像看起来完整”,更在于通过自动遮挡检测与结构一致修复,恢复传统建筑的关键形态线索,从而提升风格识别、三维重建和数字化存档等下游任务的可靠性。

04 · 结论与未来方向

从人工修补走向传统建筑图像的自动智能修复

DLFT 通过“自动分割 + 智能修复”的两阶段框架,降低了传统建筑图像数字化处理的人力成本,并增强了模型对复杂结构、规则纹理和多视角数据的适应能力。

自动化程度高

通过 DeepLabv3+ 自动识别遮挡区域,摆脱对人工掩膜的依赖,使传统建筑图像修复流程更加智能化。

全局结构恢复强

Transformer 与 FFC 共同增强长距离语义建模和全局感受野,有助于恢复屋顶格局、立面对称和纹理延续。

支撑下游应用

修复结果能够提升建筑风格分类性能,并为村落规划、旅游开发、三维重建与数字化存档提供更高质量数据。

应用价值

  • 传统村落与历史建筑影像自动清理。
  • 建筑立面图像和遥感屋顶影像数据增强。
  • 辅助三维重建、风格识别与数字博物馆建设。
  • 降低文化遗产图像预处理的人力成本。

局限与展望

  • 大面积、极不规则遮挡下,局部细节仍可能不稳定。
  • 对训练集中未覆盖的特殊建筑风格,泛化效果可能下降。
  • 低分辨率、高噪声图像会影响分割与修复质量。
  • 未来可引入语言大模型增强建筑语义理解与可控修复能力。