通用视觉模型支持下的轻量级光学遥感影像云检测模型

基于通用视觉大模型 DINOv3 与知识蒸馏,构建轻量云检测网络 LWCloudNet,在 Jetson 设备上单景高分一号影像推理仅需 1.34 秒,IoU 达 90.29%,为星上在轨智能解译提供高效预处理支撑。
遥感云检测 轻量化模型 知识蒸馏 星上计算

云污染制约遥感应用,轻量高精度检测需求迫切

全球超 50% 光学遥感影像受云干扰,传统特征法与深度模型在星上等低算力设备部署困难,存在参数量大、边缘检测精度不足等痛点。

云污染严重

全球光学遥感影像超过 50% 受云干扰,导致数据利用率低,影响土地利用分类与变化监测。

数据利用率
星上算力受限

现有深度学习模型参数量大、计算资源占用高,难以部署在 Jetson 等资源受限的星上设备。

边缘部署
边缘检测精度不足

薄云区域与云像素边缘检测精度不理想,纯卷积结构全局感知能力弱,易产生漏检与误检。

精度瓶颈
50%+
影像受云干扰
5.3 M
LWCloudNet 参数量
1.34 s
Jetson 单景推理
90.29%
IoU 精度

LWCloudNet:解耦训练-推理的轻量云检测网络

基于 DINOv3 通用视觉教师网络与 iFormer-S 轻量学生网络,通过多尺度知识蒸馏与 CNN-Transformer 混合架构,实现高精度、低延迟云检测。

Step 1
教师网络 DINOv3

采用 DINOv3-ConvNeXt-Large 作为教师,输出 4 尺度特征 (192,384,768,1536 维),提供丰富通用视觉表征。

自监督 · 多尺度
Step 2
学生网络 iFormer-S

轻量混合架构,前两阶段卷积高效提取局部特征,后两阶段移动调制注意力建模长距离依赖,参数量仅 7.46 M。

CNN + Transformer
Step 3
多尺度特征对齐

1×1 卷积将学生特征升维至教师维度,L2 + KL 散度联合蒸馏,4 个尺度分别对齐,提升小目标感知。

特征适配
轻量分割头

采用 1×1 卷积多尺度拼接融合,替代传统 UNet 解码器,参数仅 7.46 M,推理速度提升 31% 以上。

高效解码
联合优化函数

交叉熵 + Dice 分割损失主导 (α=0.7),多尺度蒸馏损失辅助,兼顾像素精度与通用特征迁移。

损失设计

精度与效率双重领先,泛化能力优异

在 GF-2 测试集上 IoU 达 90.29%,相比 STCNet 提升 2.86%;Jetson 推理单景仅 1.34 s,效率提升 17.62%。

90.29%
IoU (本文)
2.86%
↑ 超 STCNet
17.62%
↑ 效率超 FastViT
2.08%
多尺度蒸馏增益
方法准确率召回率F1IoU推理时间 (s)参数量 (M)
MobileNetV30.85910.86340.83210.83340.03115.312
MobileOne0.86210.88200.84810.85200.02988.545
FastViT0.87910.89010.83460.84910.02765.276
GhostNetV30.89040.97010.85190.86810.03287.156
RS-net0.81090.74120.72110.73260.092731.16
Shallow-CDNet0.76230.71260.70450.70860.01230.05
MCDNet0.88320.92350.85190.85450.028913.10
OCM0.89740.94110.86580.86980.028026.99
SCTNet0.90560.95020.87320.87430.02714.24
LWCloudNet0.92100.97290.90120.90290.02607.46
边缘检测更优

在云像素边缘与薄云区域,LWCloudNet 漏检更少,相比 STCNet 的 IoU 提升 2.86%,得益于 CNN-Transformer 混合架构。

移动端高效推理

Jetson Orin NX 上单景 GF-1 PMS 影像推理仅 1.34 s,比 FastViT 效率提升 17.62%,无需剪枝量化。

多尺度蒸馏增益

多尺度知识蒸馏相比引导特征蒸馏 IoU 提升 2.08%,4 尺度对齐有效传递通用视觉知识。

“本文提出的轻量化云检测模型 LWCloudNet 在 GF-2 测试集上 IoU 达 90.29%,在 Jetson 设备上单景推理仅 1.34 秒,有望为卫星在轨智能信息解译提供预处理技术支撑。”

轻量高精度云检测,赋能星上智能解译

LWCloudNet 通过解耦训练-推理范式,融合通用视觉知识,为低算力设备高精度云检测提供理论参考与工程方案。

核心贡献

提出 LWCloudNet,首次将 DINOv3 通用视觉模型与 iFormer 轻量架构结合,实现星上级云检测精度与效率平衡。

方法创新

多尺度知识蒸馏策略,4 尺度特征对齐 + L2/KL 联合损失,蒸馏增益 IoU 达 2.08%,优于传统引导蒸馏。

应用价值

在 GF-1、SV-1、SV-3 等多源数据上泛化 IoU > 0.82,超大影像处理 < 4 min,可直接用于云掩膜生产。

应用价值

为卫星在轨智能解译提供关键预处理支撑,可推广至目标检测、变化检测等任务,降低星上计算负担。

在轨计算
局限与未来

当前模型对极薄卷云与冰雪混合场景仍有提升空间,未来将引入多光谱通道与自适应蒸馏权重。

多光谱 · 自适应