从「单点独立预测」到「网络化时空协同预测」
气温短临(0~6 h)变化的准确预测对城市运行、能源调度、交通物流及农业生产具有重要指导意义。传统数值天气预报受限于复杂物理参数与巨大计算开销,在短临场景下存在起转时间长、局部同化能力不足的问题;以 LSTM、GRU 为代表的循环神经网络虽提升了单站点预测精度,却忽略了气象站点数据的时空自相关性。时空图神经网络(STGNN)因此成为处理离散站点时空预测的主流方向,但在面向全国尺度的气象网络时仍存在三方面的突出局限。
长时依赖捕捉能力不足
传统 STGNN 多采用 RNN 类结构处理时间维,存在串行计算效率低、难以捕捉长距离时间依赖的缺陷。在面对全年尺度的气象数据时,模型容易遗忘早期的周期性特征,也难以刻画气温日变化与季节变化叠加下的长周期规律。
空间异质性建模欠缺
现有模型多基于距离阈值构建静态图,节点间的聚合权重往往固定不变。然而我国幅员辽阔,高原与平原、沿海与内陆站点对周边环境的敏感度差异巨大,存在显著的空间异质性,简单的图卷积难以自适应地衡量不同邻居节点的影响力。
时空耦合机制的复杂性
如何设计更高效的机制,在保证模型轻量化的同时实现时间特征与空间特征的深层耦合,仍需进一步探索。既要避免全连接图带来的计算复杂度与远距离噪声,又要在离散站点分布下保留原始信息、不引入虚假相关。
经质量控制后最终入选
2024-01-01 至 2024-12-31
理论总量 3 557 520 条
逐小时观测产品
Enhanced-STGNN:时空分离的增强型架构
本文将全国范围的气温预测定义为图结构上的时空序列预测问题:以站点为节点、以邻接矩阵描述空间拓扑关系,学习由过去 T 个时间步历史观测到未来 H 个时间步气温变化的映射函数。整体架构包含静态先验拓扑构图、空间异质性提取与长时依赖捕捉三个核心模块,并引入残差连接与层归一化加速深层网络收敛。
图结构定义与问题建模
记观测站点集合 V={v1, v2, …, vN},其中 N=405 为站点总数;定义图结构 G=(V, E, A),A∈R^(N×N) 为邻接矩阵。设 t 时刻所有站点的特征矩阵为 N×C(本文中 C=1,即气温)。模型利用过去 T 个时间步的历史观测序列预测未来 H 个时间步的气温变化,本研究中输入窗口 T=12 h,预测步长 H=4 h。
基于 K-近邻的静态先验拓扑构建
气象站点的空间分布具有不规则性,全连接图易导致计算复杂度过高并引入无意义的远距离噪声。本文采用 KNN 为每个节点按欧氏距离选取最近的 K 个节点作为邻居,本研究中设定 K=10,在不破坏空间相对关系的前提下对图结构进行稀疏化,使模型聚焦于局部微气候信息的传递。
多头图注意力机制聚合空间特征
站点间的相互影响强度会随天气系统实时演变而动态变化。本文引入图注意力网络,利用每个时间步的实时节点输入特征动态计算节点 i 与 j 之间的关联强度,并经 Softmax 归一化;进一步采用多头注意力(本文设定 M=4)独立计算并拼接多组注意力系数,同时关注地理距离邻近性与气候模式相似性,充当"数据驱动的空间软阈值滤波器"。
时空分离的扩张因果卷积捕捉长时依赖
针对 RNN 处理长序列时的梯度消失与串行计算低效问题,本文设计时空分离的 Dilated TCN:扩张卷积在卷积核中插入"空洞"扩大感受野,扩张率随层数指数增长(d=1, 2, 4, …),只需较少层数即可覆盖输入序列的全部历史信息;因果卷积则保证预测过程不发生未来信息泄露。
优化目标与训练策略
采用均方误差(MSE)作为损失函数进行端到端训练,并加入 L2 正则化项防止过拟合。训练过程使用 Adam 优化器更新参数,引入早停机制:当验证集误差在连续多个 Epoch 内未下降时自动停止训练并保存最优模型参数,以确保模型在未知数据上的泛化能力。
2024 年全国 405 站逐小时观测
数据来源于中国气象局国家气象信息中心提供的 2024 年 1 月 1 日至 12 月 31 日(共 366 d)中国地面气象站逐小时观测产品,时间分辨率为 1 h。结合数据质量控制码剔除存在大面积长时间故障的台站后,最终选出 405 个国家级地面气象观测站。数据极小值 -44.20 ℃,极大值 47.70 ℃,平均值 13.46 ℃,标准差 12.67 ℃,实际有效数据 3 557 493 条,完整率 99%。
数据预处理与参数配置
对传感器故障造成的偶发缺失采用线性插值填补,长时缺失利用临近时间步填充,最终构建 405×1×8 784 的时空数据矩阵,并采用 Z-Score 标准化。严格按时间正序划分为训练集(1—9 月,70%)、验证集(10—11 月中旬,15%)与测试集(11 月中旬—12 月,15%)。隐藏层维度 64,批次大小 64,初始学习率 0.001,最大训练轮数 50,早停耐心值 10;基于 PyTorch 实现,硬件为 NVIDIA GeForce RTX 3080。
精度、显著性与长时稳定性检验
本文选取历史平均(HA)、长短期记忆网络(LSTM)与经典时空图卷积网络(STGCN)三类代表性基准模型进行对比,所有基准模型与本文模型均保持相同的输入时序长度(T=12 h)与预测步长(H=4 h),并采用一致的数据划分、隐藏层维度(64)及早停训练策略。此外,通过消融实验、统计显著性检验与窗口敏感性分析,系统验证各核心组件的独立贡献。
未来 4 h 滚动预测
全国 405 个站点测试集
覆盖中国主要气候区
误差严格小于 LSTM 的样本占比
| 模型 | 方法特征 | RMSE / ℃ | MAE / ℃ |
|---|---|---|---|
| HA | 纯统计学方法,利用过去 12 h 的对应时序算术平均值作为未来 4 h 的预测结果 | 5.26 | 3.91 |
| LSTM | 仅考虑时间特征,1 层 LSTM 单元与 1 层线性全连接层,输入维度为 1 | 2.24 | 1.48 |
| 经典 STGCN | 考虑空间时间特征,利用静态邻接矩阵进行空间聚合后展平接入全连接层 | 3.15 | 2.45 |
| 本文模型 | 时空深度融合,多头图注意力 + 时空分离扩张卷积 | 2.17 | 1.40 |
精度提升具有统计显著性
提取测试集中全部 2 130 360 个时空预测点位的绝对误差序列,进行配对样本 t 检验与 Wilcoxon 符号秩检验:配对 t 检验统计量 194.25,Wilcoxon Z 统计 -186.32,p 值均严格小于 0.001,95% 置信区间 [0.079 2, 0.080 8] 未跨越 0,模型在 57.4% 的独立测试样本上误差严格小于 LSTM,MAE 下降 0.08 ℃ 并非随机噪声所致。
两个核心组件均不可替代
将时间组件由 Dilated TCN 替换为普通 TCN 后,RMSE 由 2.17 ℃ 上升至 2.45 ℃,说明普通 TCN 感受野有限、无法覆盖长周期规律;将空间组件由多头 GAT 替换为普通 GCN 后,RMSE 增加至 2.68 ℃,表明全国站点空间异质性极强,无差别平滑聚合易引入伪相关噪声。
有效抑制多步误差累积
在 T+1(未来 1 h)极短临预测中,本文模型与 LSTM 的全局误差差异较小(约 0.05 ℃);随着步长延伸至 4 h,LSTM 误差增长显著加快,在 T+4 时刻发散至 3.25 ℃,而本文模型 RMSE 保持在 2.97 ℃ 左右,单步误差累积被压低 0.28 ℃。窗口敏感性分析显示 T=12 在精度与算力间最为高效,H=4 兼顾时效与可靠性。
本文模型能有效提取大范围气象网络中的深层时空规律,在应对气温突变时展现出极强的动态追踪能力,验证了由"单点独立预测"向"网络化时空协同预测"转变的有效性,为广域气象要素的短临业务预报提供了可靠框架。
三项结论、应用价值与未来议程
本文提出一种融合多头图注意力机制与时空分离扩张卷积的增强型预测模型(Enhanced-STGNN),并基于 2024 年全年、覆盖中国主要气候区的 405 个国家级地面气象观测站数据进行了系统性验证与分析,为广域气象要素的时空协同预报提供了新的技术支撑。
时空建模能力显著增强
通过引入 KNN 先验拓扑与多头图注意力机制,模型能够自适应地聚合不同地理位置站点的空间特征,有效解决了单一距离阈值构图无法适配全国复杂地形的问题;时空分离的扩张卷积网络通过指数级扩大感受野,成功捕捉了气温数据中长达一年的非线性时间依赖关系。
预测精度与鲁棒性双提升
模型在各项评价指标上均优于 HA、经典 STGCN 及仅考虑时间依赖的 LSTM,测试集上 RMSE 为 2.17 ℃、MAE 为 1.40 ℃,相较 HA、经典 STGCN 与 LSTM 的 MAE 分别降低 64.2%、42.8% 与 5.4%;同时在前 10 个 Epoch 内损失迅速下降且未出现验证集损失反弹,泛化能力良好。
长时预测误差抑制效果明显
分步长误差分析显示,随着预测时间从 1 h 延伸至 4 h,传统时序模型误差发散较快,而本文模型得益于空间邻域信息的有效引入,能够利用周边站点的变化趋势修正本地预测,在 T+4 h 节点 RMSE 相比 LSTM 降低约 0.28 ℃,展现出更优的业务应用潜力。
应用价值
气温短临(0~6 h)预测对城市运行、能源调度、交通物流及农业生产具有重要的指导意义。在 H=2 与 H=4 时,模型 MAE 均控制在 1.5 ℃ 的合理区间内,完全契合实际气象业务中防灾减灾"黄金短临时段"的需求,为广域气象要素的短临业务预报提供了高精度、高鲁棒性的可靠框架,可支撑由单点独立预测向网络化时空协同预测的业务范式转变。
局限与未来
目前模型主要依赖地面站点的气温观测数据,气象系统典型的多变量耦合特征尚未充分利用;深度学习模型的可解释性仍显不足;寒潮、热浪等极端天气样本稀少时的泛化能力有待检验;基础空间拓扑依赖固定 K 值的近邻算法。未来将从多源多模态数据融合、模型可解释性探索、极端天气下的迁移与小样本学习,以及顾及地理空间规律的自适应动态构图四个方面深化研究。