编辑精选

北京信息科技大学联合清华大学、北京化工大学 | 面向光照挑战场景的鲁棒视觉惯性导航方法

  • 2026-08-21

编者按:在每期期刊中,编委从所有论文中精选出少量高质量论文作为“编辑精选”(Editor's Highlights)。本期的“编辑精选”是A Robust Visual-Inertial Navigation Method for Illumination-Challenging Scenes,由北京信息科技大学屈健康、清华大学吕旭、孟子阳、古鹏飞与北京化工大学王君共同撰写。该研究面向黑暗与光照剧烈变化环境中的机器人定位问题,提出了一种融合低光图像增强与亮度一致性推断的鲁棒视觉惯性导航方法。


引用信息:Jiankang Qu, Xu Lyu, Ziyang Meng, Pengfei Gu and Jun Wang. (2026). A Robust Visual-Inertial Navigation Method for Illumination-Challenging Scenes. Unmanned Systems, 14(2), 379–390.

DOI号:10.1142/S2301385026500068


研究背景

视觉惯性里程计在机器人定位与导航领域已展现出巨大的应用价值。然而,现有的视觉惯性里程计算法往往假设运行在理想的光照环境下,没有考虑极端光照,如黑暗场景、光暗变化场景对算法的影响,导致在该场景下机器人定位与导航的精度会大幅下降。为此,本文提出了一种鲁棒的视觉惯性导航方法。首先,我们构建了一个高效的低光图像增强模型,该模型结合了深度曲线估计网络与轻量级卷积神经网络,旨在增加黑暗场景下相机的有用可视信息;其次,本文还提出了一种基于卡尔曼滤波的亮度一致性推断方法,以应对图像序列中可能存在的的光暗变化。我们利用来自 UrbanNav 和 M2DRG 数据集的多组序列对所提出的算法进行了测试;此外,我们还针对该算法开展了真实世界实验。两个实验结果一致表明,本文所提出的算法在性能上优于当前最优的视觉惯性定位算法。在光照条件最为昏暗的数据序列中,与基准算法 VINS-Mono 相比,本文算法的有效跟踪时长从22.0% 提升至 68.2%,定位精度也从 0.489 米提升至 0.258 米。


实验方法

图1展示了本文提出的视觉惯性导航方法。首先,相机捕获一帧暗光图像,随后该图像经由本文提出的低光图像增强模型进行处理,以恢复纹理信息并去除噪声。接着,执行本文提出的亮度一致性推理算法,该算法利用卡尔曼滤波器来消除图像间剧烈的亮度突变,以确保所有经处理图像之间的亮度保持一致。最后,将经过处理的高质量图像序列输入至位姿估计器中,以获取定位结果。

图1 提出的算法的完整流程图应

1)图像增强网络:

深度曲线估计(Deep Curve Estimation)已被证明能有效提升图像质量。本文采用 DCE-Net网络模型从暗图像中恢复纹理信息。该模型仅包含六个隐藏层和一个输出层,轻量级且易于部署。在前六个卷积层中,每个卷积层由 32 个大小为 3×3、步长为 1 的卷积核组成,并应用 ReLU 激活函数。最后一个卷积层由24 个大小为 3×3、步长为 1 的卷积核组成,并应用 Tanh 激活函数,每次迭代为三个通道生成三个曲线参数图,通过八次迭代生成 24 个曲线参数图。DCE-Net网络模型使用包含 2422 张非配对亮/暗图像和配对亮/暗图像的训练数据集进行训练,这些图像来自 SICE 数据集。为了获得输入图像与其最佳拟合曲线参数之间的映射关系,采用了四种损失函数:空间一致性损失、曝光控制损失、颜色恒常性损失和光照平滑度损失。

2)图像去噪网络:

在低光照条件下拍摄的图像可能包含各种类型的噪声,如散粒噪声等。在纹理恢复过程中,虽然暗光图像中有效纹理信息得以提高,但噪声也被放大,这使得后续特征点的匹配变得困难。为了解决这个问题,我们利用 FFD-Net对图像增强网络输出的增强图像进行去噪,该模型不仅拥有优异的图像去噪能力,同时具有极快的响应速度,非常适合实时的图像去噪任务。FFD -Net 网络模型使用真实值图像/噪声图像对训练,模型包含12 层网络,每一层都由三种不同类型的操作组成:卷积(Conv)、修正线性单元 (ReLU) 和批量归一化 (BN)。具体来说,第一层卷积层采用“Conv+ReLU”,中间层采用“Conv+BN+ReLU”,最后一层卷积层采用“Conv”。

3)图像亮度一致性估计模块:

图像亮度的一致性对图像特征的精确匹配和跟踪至关重要。尽管经过上述低光照图像增强模型的处理,然而,在光照条件挑战场景下,仍无法保证每幅图像都具有一致的亮度。因此,我们开发了一种亮度一致性推断方法来维持图像间的全局亮度一致性。根据Retinex理论,图像的亮度可以通过分解图像获得。我们首先将处理过的增强图像分解为反射分量图和亮度分量图,亮度分量图的均值被看作图像的亮度观测;然后对于亮度的预测值,使用固定窗口内的历史图像亮度观测值训练一阶线性回归函数,并由该线性函数给出当前图像的亮度预测值;最后,使用卡尔曼滤波算法对观测图像的亮度进行处理,平滑图像序列中亮度突变。


实验验证

本文的所有实验均在一台计算机上完成,该计算机搭载 Ubuntu 18.04 操作系统,采用第九代 Intel i7 CPU 作为计算单元,并配备了一块消费级显卡GeForce RTX 3050。测试的数据集包括来自 UrbanNav 和M2DGR数据集的 15 条暗光序列,以及在真实光照挑战下采集的2条数据序列。

共对比的视觉算法包括: VINS-Mono、 OpenVINS、R2VIO、 DarkSLAM、 VINS-Mono-RUAS、 VINS-Mono-ZD、 SP_SLAM 和 AirVO。其中,VINS-Mono-RUAS和 VINS-Mono-ZD为参考DarkSLAM方案修改的算法,AirVO原版本为双目版本,参考SP_SLAM进行了相应修改。

定位精度实我们采用绝对位姿误差(APE)指标中的均方根误差(RMSE)来评估该算法的定位精度。RMSE指标反映了算法估计位置与真实位置之间的平均误差;该指标数值越小,表明定位精度越高。值得注意的是,随着运行时间的增加,RMSE数值通常会逐渐增大。因此,在本文中,我们仅对比各方案中能够稳定运行的数据片段所对应的RMSE数值。

鲁棒性实验:算法鲁棒性不仅与定位精度相关,还与算法执行时间密切相关,尤其是在光照条件复杂的场景中。我们使用正确率(CR)来评估所提出算法的鲁棒性。CR 指标表示当绝对平移误差 (ATE) 值和绝对方向误差 (AOE) 值不超过指定阈值时,SLAM 算法的执行时间所占的比例。

真实世界实验:我们在一个 5m × 6m 的暗室中进行了真实世界实验。首先,我们利用 Realsense D435i 相机采集了图像数据和 IMU 数据。随后,我们采用了 RTS 2000 光学定位运动捕捉相机系统来提供真值。最后,我们采集了两组具有光照挑战性的序列数据,并利用 RMSE 和 CR 这两项指标对所有参与对比的算法性能进行了评估。结果如表1所示。

表1 真实世界实验结果

结果表明:相比于比较的优秀算法,本文提出的视觉惯性里程计可以在光照挑战场景下稳定运行,有效改善了视觉惯性里程计在极端光照挑战场景下的定位精度和鲁棒性。


结论

本文提出了一种鲁棒的视觉惯性导航方法,该方法能够在极具光照挑战的场景(如弱光和光照变化环境)下鲁棒运行。首先,我们利用深度曲线估计网络和轻量级卷积神经网络,构建了一个高效的弱光图像增强模型。该模型有助于恢复光照挑战场景中低质量图像的纹理信息。其次,我们提出了一种基于卡尔曼滤波算法的亮度一致性推理方法,该方法平滑了图像序列中的亮度突变,提高了特征点的跟踪正确率。我们在公开数据集及实际场景中,从多个维度将所提出的方法与其他最先进的方法进行了对比。实验结果表明,在图像尺寸为 640×480 的 RGB 数据集上,本文算法能够以 15 帧/秒(fps)的速率实现实时运行。在光照条件最为昏暗的数据序列中,与基准算法 VINS-Mono 相比,本文算法的有效跟踪时长从22.0% 提升至 68.2%,定位精度也从 0.489 米提升至 0.258 米。