卫星拒止环境下的定位:两道核心瓶颈
在卫星信号拒止(如室内、城市峡谷、丛林及强电磁干扰等)与弱 GNSS 信号条件下,无人平台自主导航、机器人长期环境感知等关键应用的定位能力尤为重要。视觉位置识别(Visual Place Recognition, VPR)亦称视觉地理定位,是计算机视觉与空间信息科学交叉领域的核心课题,其核心任务是融合多源异构影像数据,结合特征提取、匹配与深度学习技术,实现对图像地理位置信息的高效获取。该技术从依赖 SIFT、SURF、HOG、ORB 等手工特征与 VLAD、BoW、Fisher 向量等统计聚合,发展到以 CNN 与 ViT 为主干的深度表征学习阶段;但受人工先验与固定聚类中心制约,方法仍面临两大核心挑战,并在单阶段效率与两阶段精度之间难以兼顾。
模型泛化能力弱
在特定数据集上训练的模型容易过拟合至该场景分布(如建筑风格、光照条件),迁移到新环境后性能明显下降。若直接套用自然图像预训练模型(如 ImageNet),又存在领域差异,难以有效捕捉地理位置识别所需的几何与语义信息。早期手工特征的表征能力同样受限于人工先验,在光照、季节、视角等复杂环境变化下泛化不足。
特征判别性不足
主流聚合方法依赖固定聚类中心对局部特征做硬分配,当场景外观剧烈变化(如跨季节、跨视角)时难以自适应调整,导致特征分布偏移与匹配失效。同时对动态遮挡物(车辆、行人)与低信息量背景缺乏区分,噪声特征平等参与全局描述符构建,稀释了建筑轮廓、道路结构等关键静态地物的贡献,显著降低判别性。
精度与效率难以兼顾
按训练策略划分,单阶段方法依托 CNN 或 ViT 构建端到端映射流程,直接输出全局描述符,效率优势明显;多阶段方法则在全局检索之上追加局部特征匹配与空间验证等环节以提升精度,却同时增加训练时间与内存消耗,需额外维护局部特征库,推理延迟高,实时性与轻量化部署能力受限。
泛化能力弱 · 特征判别性不足
覆盖光照 季节 视角 模态 时空跨度
约 6.7 万个地理位置
手工特征 / CNN单阶段 / 基础模型 / 两阶段
DINO-BQ:DINOv3 骨干 + 查询袋聚合的单阶段框架
DINO-BQ 的核心创新包括两方面:一方面引入 DINOv3 基础模型作为特征提取主干,结合分层微调策略,在保留其通用表征能力的同时适配 VPR 任务以增强泛化性能;另一方面引入一种改进的基于 ViT 的 Bag of Queries(BoQ)全局聚合方法,用于生成判别性更强的全局描述符。整体框架通过端到端训练,系统性整合基于 DINOv3 的特征提取与 BoQ 全局检索聚合技术,在保持单阶段流程简洁、计算高效的同时,获得媲美两阶段方法的判别性能。
DINOv3 自监督基础模型作为特征提取骨干
选用在大规模无标注数据上自监督训练的 DINOv3 作为预训练模型,其具备高度语义抽象与场景泛化能力的通用视觉表征。相较前代 DINOv2,DINOv3 将 Patch 尺寸由 14×14 改为 16×16,以 RoPE 旋转位置编码替代绝对位置编码,更好地建模图像块之间的相对位置关系,并因旋转不变性而对尺度与视角变化具有更强适应性;同时在每次残差连接前引入可学习的对角缩放矩阵(LayerScale,每层含 ls1.gamma 与 ls2.gamma),稳定深层 Transformer 训练过程、确保梯度传播,提升所提取特征的判别性。
分层部分微调策略平衡通用性与任务适应性
冻结 DINOv3 主干的前 k 个 Transformer 层,仅微调后续层及新引入的聚合模块。浅层网络提取的边缘、纹理等低级特征对表观变化较为鲁棒,冻结它们可保留预训练所得的通用视觉先验;微调深层网络则使其更专注于学习与 VPR 相关的高级场景与位置语义。一方面保留的通用特征有助于抑制光照、季节等表观干扰、聚焦场景本质结构;另一方面通用先验的保留降低了模型对训练集特定风格的过拟合,从而提升跨场景适应能力与泛化性。
改进的 Bag of Queries 交叉注意力聚合
针对 NetVLAD 等传统聚合依赖预定义聚类中心硬分配、场景外观剧变时易失效的问题,引入结构简洁的端到端聚合架构 BoQ。骨干输出被视为维度 d 的 N 个局部特征序列,经 Transformer 编码器变换后送入 BoQ 块;每个 BoQ 块含 M 个可学习查询构成的固定集合(即一个 bag),先在查询之间做多头自注意力整合共享信息,再与输入特征做交叉注意力,动态评估每个局部特征的重要性并聚集为输出。该过程在高维隐空间完成特征级无效信息筛选与关键特征聚焦,不涉及物理图像块的几何空间校验。
一步式维度压缩与全局描述符输出
各 BoQ 块输出经拼接形成分层且信息丰富的表示,确保最终描述符组合了网络不同级别聚集的信息;随后使用一或两个连续线性投影降低维度,并进行 L2 归一化将全局描述符引入单位超球体,优化相似性搜索。相较原 BoQ,本文在架构层面摒弃多层 BoQBlock 堆叠、取消动态头数调整、简化编码器与 BoQ 块的循环嵌套链路、移除冗余残差连接与多层投影;输出层以直接线性投影加 LayerNorm 替代复杂维度计算,在单步压缩中稳定特征分布;并突破仅支持 CNN 特征的局限,实现 CNN 与 ViT 双模态兼容。
训练与评估数据集
训练阶段使用基于 Google Street View Time Machine 构建的 GSV-Cities 数据集(2022 年,8 万张查询 / 12 万张参考,224×224 像素),涵盖全球 40 个主要城市、约 6.7 万个地理位置,包含多视角、光照、季节及天气条件的街景图像。评估阶段选取 6 个权威公开基准:Tokyo 24/7(2015,315 / 75 984 张,极端光照)、AmsterTime(2022,1 231 / 1 231 张,跨世纪跨模态)、Pittsburgh 250K(2015,1 000 / 23 000 张,视角变化与结构相似性)、MSLS(2020,多气候长期鲁棒性)、St Lucia(2018,1 464 / 1 509 张,季节更替)与 SPEDtest(2018,607 / 607 张,320×240 像素,动态遮挡与低质量帧),共同构建覆盖光照、季节、视角、模态与时空跨度的多维评估体系。
实现细节与评价指标
在 PyTorch 下实现并于单张 NVIDIA RTX 4090D GPU 上微调:骨干为 DINOv3 ViT-B/16,输入图像缩放为 224 像素×224 像素,仅微调最后 5 个 Transformer 层、冻结前 7 层;AdamW 优化器,初始学习率 6e-5,权重衰减 9.5e-9,采用 CosineAnnealingLR 衰减策略。聚合模块关键参数:输出维度 2 048、投影维度 768、查询数 16、BoQ 层数 2。损失函数为 MultiSimilarityLoss,配合 MultiSimilarityMiner 难例挖掘;数据增强包括随机水平翻转、颜色抖动、随机裁剪与旋转。每批含 48 个位置、每位置 4 张图像,验证集为 Pittsburgh 250K,Recall@5 连续 5 个 epoch 未提升时自动早停。评价指标采用 Recall@K(K=1, 5, 10),即前 K 个检索结果中包含正确匹配的查询比例。
六大基准检索精度与效率实测
所有对比方法均采用原文献发表的完整端到端模型、最优骨干网络、官方预训练权重及标准实验配置,严格遵循 VPR 领域通用的统一评估协议,对比的是各方法的综合检索性能而非单一模块拆分性能;表中缺失结果均为对应原文献未公开、未报告相关数据集指标,并非未复现所致,所有引用数据的实验设置、数据集划分与评估规则均与原文完全一致。定量与定性结果显示,DINO-BQ 在多数测试方案中表现显著优于其他方法。
R@5 99.4% / R@10 99.7%
季节更替场景 R@5 100.0%
与 DINOv2 SALAD 持平
2 048 维标准特征维度
| 方法 | 维度 | Pitts250k R@1/% | Tokyo 24/7 R@1/% | AmsterTime R@1/% | MSLS R@1/% | St Lucia R@1/% | SPEDtest R@1/% |
|---|---|---|---|---|---|---|---|
| NetVLAD | 327 868 | 90.5 | 60.6 | 16.3 | 82.6 | 64.6 | 78.7 |
| CosPlace | 2 048 | 92.3 | 81.9 | 47.7 | 82.8 | 99.1 | 80.1 |
| Conv-AP | 4 096 | 92.4 | 81.0 | 28.4 | 69.2 | 99.2 | 79.2 |
| MixVPR | 4 096 | 94.2 | 85.1 | 40.2 | 88.0 | 99.2 | 85.2 |
| EigenPlaces | 2 048 | 94.1 | 93.0 | 48.9 | 89.1 | 99.6 | 69.9 |
| CricaVPR | 4 096 | 95.6 | 93.0 | 64.7 | 90.0 | — | 91.3 |
| Salad | 8 448 | 95.1 | 94.6 | — | 92.2 | 99.2 | 92.1 |
| SciceVPR | 4 096 | 93.4 | 97.1 | 63.0 | 90.7 | — | — |
| Patch-NetVLAD(两阶段) | 4 096 | 88.7 | 85.1 | — | 79.5 | — | — |
| TransVPR(两阶段) | 256 | 89.0 | 79.0 | — | 86.8 | — | 85.7 |
| SelaVPR(两阶段) | 1 024 | 95.7 | 94.0 | 55.2 | 90.8 | — | 88.6 |
| DINO-BQ(本文) | 2 048 | 96.2 | 92.3 | 58.6 | 86.4 | 99.9 | 91.1 |
跨光照、跨时空与跨气候的适应性
面对昼夜极端光照变化的 Tokyo 24/7,DINO-BQ 的 R@1 达 92.3%,表明所学特征具有良好的光照不变性;在涉及历史与现代影像跨模态匹配的 AmsterTime 上取得具有竞争力的 58.6%,证明其跨时空泛化能力;在覆盖全球多样地理与气候的 MSLS 与反映长期季节变化的 St Lucia 上,R@1 分别为 86.4% 与 99.9%,保持稳健优异表现。这些结果共同表明,基于 DINOv3 的分层微调策略有效提升了模型对未知场景与复杂环境变化的适应能力。
结构重复与动态遮挡场景的区分力
在城市场景结构重复性高、视角变化剧烈的 Pittsburgh 250k 上,DINO-BQ 的 R@1 达 96.2%,优于 EigenPlaces(94.1%)与 MixVPR(94.2%)等先进方法;在包含大量动态遮挡与低质量帧的 SPEDtest 监控数据集上 R@1 为 91.1%。消融实验进一步印证:仅用 DINOv3 原生 cls_token 时 R@1 仅 85.7%,加入 BoQ 聚合后 R@1 提升 10.5%,说明 BoQ 能通过交叉注意力自适应聚焦关键局部特征、抑制干扰,构建高判别性全局描述符。
参数寻优与计算开销平衡
效率方面,2 048 维标准特征维度下单图存储仅 8.0 KB、特征提取延迟低至 2.4 ms、匹配重排耗时为 0,而 NetVLAD 需 17.0 ms 与 128.0 KB、Patch-NetVLAD-p 延迟高达 1 336.0 ms。消融结果显示:完全冻结模型 8 个 epoch 即收敛但 R@1 仅 94.7%,微调最后 5 块精度最优(R@1 96.2%、R@5 99.4%、R@10 99.7%),微调 6 块反而回落至 96.1%;查询数 Q=16 最优(适配 196 个 patch 比例),BoQ 块数 L=2 最优,输出维度 2 048 维最优。
DINO-BQ 作为一个单阶段全局检索方法,在 Pittsburgh 250k 等数据集上的检索精度优于 TransVPR、Patch-NetVLAD 等需要复杂重排序的两阶段方法,在计算与内存效率上具备天然优势,实现了精度与效率的良好平衡。
三项成果、部署价值与未来议程
为提升视觉位置识别的精度与效率,解决模型泛化能力弱与复杂环境下特征判别性不足两大核心挑战,本文提出新型视觉位置识别框架 DINO-BQ:率先将自监督基础视觉模型 DINOv3 引入 VPR 任务作为特征提取主干,结合分层部分微调策略增强对未知场景的适应能力;同时引入改进的基于多头注意力的查询袋聚合模块,通过可学习全局查询与交叉注意力构建判别性更强的全局描述符;整体采用端到端的单阶段全局检索框架,实现了精度与效率的良好平衡。
基于 DINOv3 的自适应特征提取框架
率先将 DINOv3 引入 VPR 任务并设计分层部分微调策略,在保留通用视觉表征的同时高效适配 VPR,有效提升了模型对光照、季节与视角变化的鲁棒性及泛化能力。
改进的 BoQ 特征聚合技术
以可学习全局查询和交叉注意力筛选关键特征、构建高判别性全局描述符,有效缓解了复杂环境下特征判别性不足的问题,并实现 CNN 与 ViT 双模态兼容、在单步压缩中稳定特征分布。
系统实验验证方法有效性
Tokyo 24/7(R@1 92.3%)、AmsterTime(58.6%)、MSLS(86.4%)、St Lucia(99.9%)验证强鲁棒性;Pittsburgh 250k(96.2%)与 SPEDtest(91.1%)证明场景区分能力。Pitts250k 上 R@1 较 EigenPlaces、MixVPR 分别提升 2.1%、2.0%,并以单阶段架构超越 Patch-NetVLAD 等两阶段方法。
应用价值
VPR 与视觉定位、图像检索、SLAM 等技术密切相关,在无人机自主导航、自动驾驶高精度定位、网络空间地理围栏构建、增强现实场景融合等领域具有重要应用价值。DINO-BQ 推理延迟仅 2.4 ms、单图特征存储仅 8 KB,推理显存占用可控,在统一评测标准下实现了检索精度与计算开销的最优平衡,具备更强的工程实际部署价值,为高精度实时视觉位置检索与识别提供了一种表现更优的高效解决方案。
局限与未来
不同数据集间的精度差异(R@1 从 58.6% 到 99.9%)反映了若干制约因素:跨时态场景匹配(AmsterTime)因外观发生根本性断裂而精度最低,说明现有特征对外观结构不变性的捕捉仍依赖视觉延续性;低分辨率与高遮挡图像(SPEDtest)削弱有效地标信息;多气候大规模场景(MSLS)受训练与测试分布差距制约。主要局限在于对跨时代外观突变及极端天气的适应性有待加强,训练显存需求较高(12 288 MB)不利于移动端直接部署,且目前仅在室外街景场景完成验证。未来将从多模态融合、模型轻量化及遥感场景迁移 3 个方向持续推进。