Geo-Information Science · Visual Place Recognition

查询袋视觉位置识别技术DINO-BQ

A New DINO-BQ Visual Place Recognition Technology
张暖 王涛 张艳 郑一杨 李镏文 刘熠晨 地球信息科学学报 2026, 28(9): 2898–2912 DOI 10.12082/dqxxkx.2026.260222
Abstract · 摘要 【背景】视觉位置识别(VPR)是一种基于视觉特征信息的地理位置识别技术,核心任务是利用多源异构影像数据实现未知图像的候选地点检索与视觉位置识别,目前其面临的主要困难是如何解决VPR深度学习模型泛化能力弱,易过拟合至训练场景分布,导致新环境中性能下降,以及复杂环境下光照、季节及视角等因素导致的特征判别性不足的问题。【方法】针对研究难点,本文提出了一种新的视觉位置识别技术DINO-BQ。DINO-BQ技术率先将视觉模型DINOv3引入VPR任务领域作为特征提取主干,并对DINOv3模型进行改进,通过高效微调,在保留其通用视觉表征能力的同时增强了DINOv3模型对于复杂场景的强鲁棒性特征表示能力,有效提升了VPR深度学习模型的泛化能力;其次,该技术引入了一种改进的特征聚合技术BoQ,利用一组可学习的全局查询向量,通过交叉注意力机制探测骨干网络提取的局部特征,进而将注意力输出直接展平、投影并进行一步式维度压缩,最终构建出判别性强的全局描述符,解决了复杂环境下特征判别不足的问题。此外DINO-BQ技术作为一种单阶段全局检索方法,采用了端到端的一体化的特征学习与匹配决策机制,既保持了单阶段深度学习模型流程简化、效率较高的优势,又通过BoQ模块全局查询与局部特征的交叉注意力加权,在特征层面实现无效信息筛选与关键特征聚焦,在单阶段框架内获得媲美两阶段方法的判别性能。【结论】在 Pitts250k 数据集上,Recall@1 达 96.2%,优于 EigenPlaces、MixVPR 等主流方法,精度优于 Patch-NetVLAD 等两阶段方法。极端光照数据集 Tokyo 24/7、跨时空 AmsterTime、季节变化 St Lucia、动态遮挡 SPEDtest 的 R@1 分别为 92.3%、58.6%、99.9%、91.1%,多气候 MSLS 数据集 R@1 达 86.4%,具备极强环境鲁棒性;推理单图延迟仅 2.4 ms,2048 维特征存储仅 8KB,计算效率与 SALAD 类先进单阶段模型持平。本文的研究成果为高精度实时视觉位置检索与识别提供了一种表现更优的高效解决方案。
视觉位置识别 地理定位 街景图像 视觉特征 DINOv3 图像检索 查询袋聚合
Scroll · 向下滚动
Section 01 · Background & Challenges

卫星拒止环境下的定位:两道核心瓶颈

在卫星信号拒止(如室内、城市峡谷、丛林及强电磁干扰等)与弱 GNSS 信号条件下,无人平台自主导航、机器人长期环境感知等关键应用的定位能力尤为重要。视觉位置识别(Visual Place Recognition, VPR)亦称视觉地理定位,是计算机视觉与空间信息科学交叉领域的核心课题,其核心任务是融合多源异构影像数据,结合特征提取、匹配与深度学习技术,实现对图像地理位置信息的高效获取。该技术从依赖 SIFT、SURF、HOG、ORB 等手工特征与 VLAD、BoW、Fisher 向量等统计聚合,发展到以 CNN 与 ViT 为主干的深度表征学习阶段;但受人工先验与固定聚类中心制约,方法仍面临两大核心挑战,并在单阶段效率与两阶段精度之间难以兼顾。

CHALLENGE 01

模型泛化能力弱

在特定数据集上训练的模型容易过拟合至该场景分布(如建筑风格、光照条件),迁移到新环境后性能明显下降。若直接套用自然图像预训练模型(如 ImageNet),又存在领域差异,难以有效捕捉地理位置识别所需的几何与语义信息。早期手工特征的表征能力同样受限于人工先验,在光照、季节、视角等复杂环境变化下泛化不足。

CHALLENGE 02

特征判别性不足

主流聚合方法依赖固定聚类中心对局部特征做硬分配,当场景外观剧烈变化(如跨季节、跨视角)时难以自适应调整,导致特征分布偏移与匹配失效。同时对动态遮挡物(车辆、行人)与低信息量背景缺乏区分,噪声特征平等参与全局描述符构建,稀释了建筑轮廓、道路结构等关键静态地物的贡献,显著降低判别性。

CHALLENGE 03

精度与效率难以兼顾

按训练策略划分,单阶段方法依托 CNN 或 ViT 构建端到端映射流程,直接输出全局描述符,效率优势明显;多阶段方法则在全局检索之上追加局部特征匹配与空间验证等环节以提升精度,却同时增加训练时间与内存消耗,需额外维护局部特征库,推理延迟高,实时性与轻量化部署能力受限。

2 项核心挑战
泛化能力弱 · 特征判别性不足
6 个权威公开评估基准
覆盖光照 季节 视角 模态 时空跨度
40 城GSV-Cities 训练集覆盖
约 6.7 万个地理位置
4 类现有技术路线
手工特征 / CNN单阶段 / 基础模型 / 两阶段

Section 02 · Framework & Architecture

DINO-BQ:DINOv3 骨干 + 查询袋聚合的单阶段框架

DINO-BQ 的核心创新包括两方面:一方面引入 DINOv3 基础模型作为特征提取主干,结合分层微调策略,在保留其通用表征能力的同时适配 VPR 任务以增强泛化性能;另一方面引入一种改进的基于 ViT 的 Bag of Queries(BoQ)全局聚合方法,用于生成判别性更强的全局描述符。整体框架通过端到端训练,系统性整合基于 DINOv3 的特征提取与 BoQ 全局检索聚合技术,在保持单阶段流程简洁、计算高效的同时,获得媲美两阶段方法的判别性能。

01

DINOv3 自监督基础模型作为特征提取骨干

选用在大规模无标注数据上自监督训练的 DINOv3 作为预训练模型,其具备高度语义抽象与场景泛化能力的通用视觉表征。相较前代 DINOv2,DINOv3 将 Patch 尺寸由 14×14 改为 16×16,以 RoPE 旋转位置编码替代绝对位置编码,更好地建模图像块之间的相对位置关系,并因旋转不变性而对尺度与视角变化具有更强适应性;同时在每次残差连接前引入可学习的对角缩放矩阵(LayerScale,每层含 ls1.gamma 与 ls2.gamma),稳定深层 Transformer 训练过程、确保梯度传播,提升所提取特征的判别性。

DINOv3 ViT-B/16RoPELayerScalecls_token + 4 storage_tokens12 层 / 768 维
02

分层部分微调策略平衡通用性与任务适应性

冻结 DINOv3 主干的前 k 个 Transformer 层,仅微调后续层及新引入的聚合模块。浅层网络提取的边缘、纹理等低级特征对表观变化较为鲁棒,冻结它们可保留预训练所得的通用视觉先验;微调深层网络则使其更专注于学习与 VPR 相关的高级场景与位置语义。一方面保留的通用特征有助于抑制光照、季节等表观干扰、聚焦场景本质结构;另一方面通用先验的保留降低了模型对训练集特定风格的过拟合,从而提升跨场景适应能力与泛化性。

冻结前 7 层微调后 5 层抑制过拟合通用先验保留
03

改进的 Bag of Queries 交叉注意力聚合

针对 NetVLAD 等传统聚合依赖预定义聚类中心硬分配、场景外观剧变时易失效的问题,引入结构简洁的端到端聚合架构 BoQ。骨干输出被视为维度 d 的 N 个局部特征序列,经 Transformer 编码器变换后送入 BoQ 块;每个 BoQ 块含 M 个可学习查询构成的固定集合(即一个 bag),先在查询之间做多头自注意力整合共享信息,再与输入特征做交叉注意力,动态评估每个局部特征的重要性并聚集为输出。该过程在高维隐空间完成特征级无效信息筛选与关键特征聚焦,不涉及物理图像块的几何空间校验。

多头注意力 MHA可学习全局查询自注意力 + 交叉注意力固定 8 头动态干扰抑制
04

一步式维度压缩与全局描述符输出

各 BoQ 块输出经拼接形成分层且信息丰富的表示,确保最终描述符组合了网络不同级别聚集的信息;随后使用一或两个连续线性投影降低维度,并进行 L2 归一化将全局描述符引入单位超球体,优化相似性搜索。相较原 BoQ,本文在架构层面摒弃多层 BoQBlock 堆叠、取消动态头数调整、简化编码器与 BoQ 块的循环嵌套链路、移除冗余残差连接与多层投影;输出层以直接线性投影加 LayerNorm 替代复杂维度计算,在单步压缩中稳定特征分布;并突破仅支持 CNN 特征的局限,实现 CNN 与 ViT 双模态兼容。

Concat 拼接线性投影降维LayerNormL2 归一化2 048 维描述符
SUPPLEMENT A · 数据集

训练与评估数据集

训练阶段使用基于 Google Street View Time Machine 构建的 GSV-Cities 数据集(2022 年,8 万张查询 / 12 万张参考,224×224 像素),涵盖全球 40 个主要城市、约 6.7 万个地理位置,包含多视角、光照、季节及天气条件的街景图像。评估阶段选取 6 个权威公开基准:Tokyo 24/7(2015,315 / 75 984 张,极端光照)、AmsterTime(2022,1 231 / 1 231 张,跨世纪跨模态)、Pittsburgh 250K(2015,1 000 / 23 000 张,视角变化与结构相似性)、MSLS(2020,多气候长期鲁棒性)、St Lucia(2018,1 464 / 1 509 张,季节更替)与 SPEDtest(2018,607 / 607 张,320×240 像素,动态遮挡与低质量帧),共同构建覆盖光照、季节、视角、模态与时空跨度的多维评估体系。

SUPPLEMENT B · 实验设置

实现细节与评价指标

在 PyTorch 下实现并于单张 NVIDIA RTX 4090D GPU 上微调:骨干为 DINOv3 ViT-B/16,输入图像缩放为 224 像素×224 像素,仅微调最后 5 个 Transformer 层、冻结前 7 层;AdamW 优化器,初始学习率 6e-5,权重衰减 9.5e-9,采用 CosineAnnealingLR 衰减策略。聚合模块关键参数:输出维度 2 048、投影维度 768、查询数 16、BoQ 层数 2。损失函数为 MultiSimilarityLoss,配合 MultiSimilarityMiner 难例挖掘;数据增强包括随机水平翻转、颜色抖动、随机裁剪与旋转。每批含 48 个位置、每位置 4 张图像,验证集为 Pittsburgh 250K,Recall@5 连续 5 个 epoch 未提升时自动早停。评价指标采用 Recall@K(K=1, 5, 10),即前 K 个检索结果中包含正确匹配的查询比例。


Section 03 · Experimental Results

六大基准检索精度与效率实测

所有对比方法均采用原文献发表的完整端到端模型、最优骨干网络、官方预训练权重及标准实验配置,严格遵循 VPR 领域通用的统一评估协议,对比的是各方法的综合检索性能而非单一模块拆分性能;表中缺失结果均为对应原文献未公开、未报告相关数据集指标,并非未复现所致,所有引用数据的实验设置、数据集划分与评估规则均与原文完全一致。定量与定性结果显示,DINO-BQ 在多数测试方案中表现显著优于其他方法。

96.2%Pitts250k R@1
R@5 99.4% / R@10 99.7%
99.9%St Lucia R@1
季节更替场景 R@5 100.0%
2.4 ms单图特征提取延迟
与 DINOv2 SALAD 持平
8.0 KB单图特征存储
2 048 维标准特征维度
方法 维度 Pitts250k R@1/% Tokyo 24/7 R@1/% AmsterTime R@1/% MSLS R@1/% St Lucia R@1/% SPEDtest R@1/%
NetVLAD327 86890.560.616.382.664.678.7
CosPlace2 04892.381.947.782.899.180.1
Conv-AP4 09692.481.028.469.299.279.2
MixVPR4 09694.285.140.288.099.285.2
EigenPlaces2 04894.193.048.989.199.669.9
CricaVPR4 09695.693.064.790.091.3
Salad8 44895.194.692.299.292.1
SciceVPR4 09693.497.163.090.7
Patch-NetVLAD(两阶段)4 09688.785.179.5
TransVPR(两阶段)25689.079.086.885.7
SelaVPR(两阶段)1 02495.794.055.290.888.6
DINO-BQ(本文)2 04896.292.358.686.499.991.1
FINDING 01 · 泛化能力

跨光照、跨时空与跨气候的适应性

面对昼夜极端光照变化的 Tokyo 24/7,DINO-BQ 的 R@1 达 92.3%,表明所学特征具有良好的光照不变性;在涉及历史与现代影像跨模态匹配的 AmsterTime 上取得具有竞争力的 58.6%,证明其跨时空泛化能力;在覆盖全球多样地理与气候的 MSLS 与反映长期季节变化的 St Lucia 上,R@1 分别为 86.4% 与 99.9%,保持稳健优异表现。这些结果共同表明,基于 DINOv3 的分层微调策略有效提升了模型对未知场景与复杂环境变化的适应能力。

FINDING 02 · 特征判别性

结构重复与动态遮挡场景的区分力

在城市场景结构重复性高、视角变化剧烈的 Pittsburgh 250k 上,DINO-BQ 的 R@1 达 96.2%,优于 EigenPlaces(94.1%)与 MixVPR(94.2%)等先进方法;在包含大量动态遮挡与低质量帧的 SPEDtest 监控数据集上 R@1 为 91.1%。消融实验进一步印证:仅用 DINOv3 原生 cls_token 时 R@1 仅 85.7%,加入 BoQ 聚合后 R@1 提升 10.5%,说明 BoQ 能通过交叉注意力自适应聚焦关键局部特征、抑制干扰,构建高判别性全局描述符。

FINDING 03 · 效率与消融

参数寻优与计算开销平衡

效率方面,2 048 维标准特征维度下单图存储仅 8.0 KB、特征提取延迟低至 2.4 ms、匹配重排耗时为 0,而 NetVLAD 需 17.0 ms 与 128.0 KB、Patch-NetVLAD-p 延迟高达 1 336.0 ms。消融结果显示:完全冻结模型 8 个 epoch 即收敛但 R@1 仅 94.7%,微调最后 5 块精度最优(R@1 96.2%、R@5 99.4%、R@10 99.7%),微调 6 块反而回落至 96.1%;查询数 Q=16 最优(适配 196 个 patch 比例),BoQ 块数 L=2 最优,输出维度 2 048 维最优。

DINO-BQ 作为一个单阶段全局检索方法,在 Pittsburgh 250k 等数据集上的检索精度优于 TransVPR、Patch-NetVLAD 等需要复杂重排序的两阶段方法,在计算与内存效率上具备天然优势,实现了精度与效率的良好平衡。

— 核心发现 · 查询袋视觉位置识别技术 DINO-BQ

Section 04 · Conclusion & Prospect

三项成果、部署价值与未来议程

为提升视觉位置识别的精度与效率,解决模型泛化能力弱与复杂环境下特征判别性不足两大核心挑战,本文提出新型视觉位置识别框架 DINO-BQ:率先将自监督基础视觉模型 DINOv3 引入 VPR 任务作为特征提取主干,结合分层部分微调策略增强对未知场景的适应能力;同时引入改进的基于多头注意力的查询袋聚合模块,通过可学习全局查询与交叉注意力构建判别性更强的全局描述符;整体采用端到端的单阶段全局检索框架,实现了精度与效率的良好平衡。

CONTRIBUTION 01

基于 DINOv3 的自适应特征提取框架

率先将 DINOv3 引入 VPR 任务并设计分层部分微调策略,在保留通用视觉表征的同时高效适配 VPR,有效提升了模型对光照、季节与视角变化的鲁棒性及泛化能力。

CONTRIBUTION 02

改进的 BoQ 特征聚合技术

以可学习全局查询和交叉注意力筛选关键特征、构建高判别性全局描述符,有效缓解了复杂环境下特征判别性不足的问题,并实现 CNN 与 ViT 双模态兼容、在单步压缩中稳定特征分布。

CONTRIBUTION 03

系统实验验证方法有效性

Tokyo 24/7(R@1 92.3%)、AmsterTime(58.6%)、MSLS(86.4%)、St Lucia(99.9%)验证强鲁棒性;Pittsburgh 250k(96.2%)与 SPEDtest(91.1%)证明场景区分能力。Pitts250k 上 R@1 较 EigenPlaces、MixVPR 分别提升 2.1%、2.0%,并以单阶段架构超越 Patch-NetVLAD 等两阶段方法。

APPLICATION VALUE

应用价值

VPR 与视觉定位、图像检索、SLAM 等技术密切相关,在无人机自主导航、自动驾驶高精度定位、网络空间地理围栏构建、增强现实场景融合等领域具有重要应用价值。DINO-BQ 推理延迟仅 2.4 ms、单图特征存储仅 8 KB,推理显存占用可控,在统一评测标准下实现了检索精度与计算开销的最优平衡,具备更强的工程实际部署价值,为高精度实时视觉位置检索与识别提供了一种表现更优的高效解决方案。

LIMITATIONS & FUTURE

局限与未来

不同数据集间的精度差异(R@1 从 58.6% 到 99.9%)反映了若干制约因素:跨时态场景匹配(AmsterTime)因外观发生根本性断裂而精度最低,说明现有特征对外观结构不变性的捕捉仍依赖视觉延续性;低分辨率与高遮挡图像(SPEDtest)削弱有效地标信息;多气候大规模场景(MSLS)受训练与测试分布差距制约。主要局限在于对跨时代外观突变及极端天气的适应性有待加强,训练显存需求较高(12 288 MB)不利于移动端直接部署,且目前仅在室外街景场景完成验证。未来将从多模态融合、模型轻量化及遥感场景迁移 3 个方向持续推进。