本文针对中国传统建筑图像在数字化保护与三维重建中常受行人、树木、车辆、阴影等前景物体遮挡的问题,提出一种两阶段自动修复网络 DLFT。该方法首先利用 DeepLabv3+ 自动检测并分割遮挡区域,生成像素级掩膜;随后采用面向传统建筑结构特征的 Transformer 编码器—解码器修复网络,并在瓶颈层引入快速傅里叶卷积 FFC 以增强全局感受野,同时设计复合感知损失 CPL 约束像素精度、纹理风格、视觉真实性和平滑一致性。实验表明,DLFT 在传统建筑立面图像和遥感屋顶图像修复中均优于多种主流方法,并能显著提升下游建筑风格分类任务性能。
中国传统村落建筑具有鲜明的地域流派、复杂纹理和规则化结构布局。互联网立面照片与遥感屋顶影像常包含行人、树木、路灯、车辆和阴影等遮挡物,若不进行修复,会影响建筑风格识别、立面建模、屋顶结构提取和三维重建质量。
许多图像修复方法需要人工标注遮挡区域,耗时费力,且掩膜边界质量直接影响修复效果。
传统建筑包含檐口、窗体、屋顶、墙面纹理等结构化元素,通用修复模型容易生成不符合建筑逻辑的纹理。
屋顶空间格局、立面对称结构和长距离纹理延续需要全局感受野,传统卷积难以充分捕捉。
DLFT 由自动检测分割阶段和图像修复阶段组成。第一阶段解决“修哪里”的问题,第二阶段解决“如何修得合理”的问题。其核心是将遮挡分割、Transformer 全局建模、FFC 频域全局感受野与 CPL 多目标损失统一起来。
第一阶段采用 DeepLabv3+ 对行人、树木、路灯、车辆等前景遮挡进行像素级分割。编码器通过空洞卷积扩大感受野,ASPP 模块融合多尺度上下文,解码器结合低级细节与高级语义,最终生成遮挡掩膜并输入修复网络。
修复网络采用编码器—解码器结构,编码器包含 4 级 Transformer 块和下采样层。LAG 门控线性注意力增强全空间特征交互,FFN 对特征进行非线性转换,使模型能够理解传统建筑立面和屋顶中的长距离结构关系。
在编码器最后一级之后嵌入 FFC 模块:局部分支使用普通卷积保持细节,全局分支通过二维实快速傅里叶变换进入频域处理长距离关系,再经逆变换回到空间域。频域全局建模有助于减少修复区域边界伪影和纹理不连续。
解码器通过最近邻插值和 3×3 卷积逐级上采样,并利用跳跃连接融合编码器低层纹理细节与高层语义信息。谱归一化判别器参与对抗训练,从多尺度特征层面提升生成结果真实感。
CPL 综合重建损失、感知损失、风格损失、对抗损失和全变分损失,分别约束像素精确性、高层语义一致性、纹理风格一致性、视觉真实感和边缘平滑性,使修复结果更符合传统建筑的结构与纹理逻辑。
论文将 DLFT 与 Hourglass、RFRNet、DWTNet、PRVSNet、CTSDGNet 等主流模型对比,并使用 PSNR、SSIM 以及建筑风格分类任务指标进行评价。结果表明,DLFT 不仅提升传统图像质量指标,也增强了下游模型对檐口、屋顶、窗体等关键特征的识别能力。
| 实验类型 | DLFT 表现 | 主要结论 |
|---|---|---|
| 模拟遮挡:建筑立面 | 20%—30% 掩膜比例下,PSNR 为 35.100 dB,SSIM 为 0.875。 | 能够恢复窗户轮廓、房檐走向和墙面纹理,减少颜色不一致与纹理模糊。 |
| 模拟遮挡:遥感屋顶 | PSNR 为 34.270 dB,SSIM 为 0.886。 | 能修复“回”字型屋顶等复杂空间布局,边缘过渡自然。 |
| 消融实验:加入 FFC | 立面 PSNR 提升 2.2%,遥感图像提升 1.8%。 | 频域全局特征对传统建筑整体结构恢复具有关键作用。 |
| 消融实验:加入 CPL | PSNR 进一步提升 0.2%—0.5%,SSIM 明显优化。 | 多维度损失约束使修复结果更符合人类视觉感知。 |
DLFT 通过“自动分割 + 智能修复”的两阶段框架,降低了传统建筑图像数字化处理的人力成本,并增强了模型对复杂结构、规则纹理和多视角数据的适应能力。
通过 DeepLabv3+ 自动识别遮挡区域,摆脱对人工掩膜的依赖,使传统建筑图像修复流程更加智能化。
Transformer 与 FFC 共同增强长距离语义建模和全局感受野,有助于恢复屋顶格局、立面对称和纹理延续。
修复结果能够提升建筑风格分类性能,并为村落规划、旅游开发、三维重建与数字化存档提供更高质量数据。