室内目标级三维语义地标的不确定性融合方法
Uncertainty-Aware Fusion Method for Indoor Object-Level 3D Semantic Landmarks
DOI: 10.12677/mos.2026.159135, PDF,    科研立项经费支持
作者: 童 鑫, 司海飞*:金陵科技学院智能科学与控制工程学院,江苏 南京
关键词: 目标级语义建图不确定性建模数据关联相关观测降权ROS 2Object-Level Semantic Mapping Uncertainty Modeling Data Association Correlated Observation Discounting ROS 2
摘要: 针对室内目标级语义建图中的深度污染、同类实例关联歧义和连续帧误差相关问题,本文提出一种不确定性融合方法。方法以可见表面统计代表点描述地标,利用收缩感兴趣区域内的中位数和中位绝对偏差估计深度,并由距离、深度离散度和有效深度比例构建各向异性观测协方差;在类别一致约束下执行一对一门控关联,对时空邻近观测降权。固定锚点ROS 2节点级实验包含60次主实验、15次门限敏感性实验和45次补充消融实验,每次接收240帧并评价预热后的220帧。补充消融表明,鲁棒深度估计在15组配对实验中稳定降低深度RMSE、MAE和P95;各向异性协方差在部分位置与关联指标的样本均值上呈有限改善,但NEES和95.45%覆盖率仍明显偏离理论目标。30个严格配对中,相关降权使平均NEES全部下降、95.45%覆盖率全部提高,位置RMSE在29个配对中下降,但中扰动(moderate)和强扰动(difficult)下仍存在过度自信。Mahalanobis相对Euclidean在18个配对中降低地标级错误合并比例,同时在25个配对中降低F1,并在全部配对中增加ID switch和建图节点单帧更新耗时。结果支持将相关降权视为抑制信息重复计数的工程近似;统计门限还需与协方差尺度及地标生命周期联合设计。结论限于当前合成观测的节点级受控条件。
Abstract: Indoor object-level semantic mapping is affected by depth contamination, ambiguous associations among same-class instances, and correlated errors across consecutive frames. This paper proposes an uncertainty-aware fusion method. Landmarks are represented by visible-surface statistical representative points. Depth is estimated using the median and median absolute deviation within a contracted region of interest, and an anisotropic observation covariance is constructed from range, depth dispersion, and valid-depth ratio. One-to-one gated association is performed under class-consistency constraints, while observations close in time and viewpoint are downweighted. The fixed-anchor ROS 2 node-level experiments included 60 main runs, 15 gate-sensitivity runs, and 45 supplementary ablation runs. Each run received 240 frames, with 220 frames evaluated after warm-up. Supplementary ablations showed that robust depth estimation consistently reduced depth RMSE, MAE, and P95 across 15 paired experiments. Anisotropic covariance yielded limited improvements in the sample means of some position and association metrics, whereas NEES and 95.45% coverage remained clearly inconsistent with their theoretical targets. Across 30 strictly paired comparisons, correlation discounting reduced mean NEES and increased 95.45% coverage in every pair, and reduced position RMSE in 29 pairs; however, overconfidence remained under moderate and difficult disturbances. Relative to Euclidean association, Mahalanobis association reduced the landmark-level false-merge proportion in 18 pairs, but reduced F1 in 25 pairs and increased ID switches and per-frame mapper update time in all pairs. The results support correlation discounting as an engineering approximation for suppressing repeated counting of information; statistical gating still needs to be jointly designed with covariance scale and landmark lifecycle. The conclusions are limited to the present node-level controlled setting with synthetic observations.
文章引用:童鑫, 司海飞. 室内目标级三维语义地标的不确定性融合方法[J]. 建模与仿真, 2026, 15(9): 75-88. https://doi.org/10.12677/mos.2026.159135

1. 引言

室内移动机器人在巡检、仓储和服务作业中需同时表达环境几何、物体类别、实例位置及其可信程度。深度学习与视觉SLAM已由前端特征和位姿估计扩展至语义建图与不确定性估计[1],多源融合则将多传感器、几何和语义信息统一纳入定位与地图表达[2]。动态目标会破坏传统视觉SLAM的静态假设[3];针对室内RGB-D场景,自适应语义分割[4]以及深度筛选和空间关联[5]可抑制其影响并更新地图点。Kimera以3D动态场景图组织度量、语义、对象及空间关系[6],长期家庭服务研究也以物体空间特征、语义和置信度维护实例级环境信息[7]。然而,稳定获得二维检测区域的三维代表位置、维持同类实例身份并量化其可信程度,仍需专门的目标级三维地标建模。

RGB-D的颜色和深度互补,多模态融合可改善室内语义分割和目标区域表征[8]。Hydra实现了3D场景图的在线构建与优化[9];同类实例的持续维护依赖帧间关联,3D多目标跟踪表明检测与关联紧密耦合[10]。将语义先验和关联不确定度引入视觉SLAM可提升复杂动态环境中点与地图点关联的鲁棒性[11],ConceptGraphs通过多视图关联构建开放词汇3D场景图[12]。相关综述指出地图构建、状态估计和多源融合应协同考虑[13]。本文关注连续观测相关性对目标级地标后验一致性的影响:过严的Mahalanobis门限会拒绝正确观测并触发新地标,而将连续帧视为独立信息会造成协方差过快收缩。

本文以可见表面统计代表点限定目标级地标的位置语义,构建由鲁棒深度估计、质量自适应各向异性协方差、类别一致一对一关联和相关观测降权组成的处理链。方法不假定有限视角下的代表点等于物体物理中心,也不将当前经验协方差模型视为传感器与位姿误差的联合传播模型。

本文给出可见表面统计代表点的操作性定义、基于检测区域深度质量的观测协方差模型,以及结合类别门控、帧内线性指派和连续观测信息降权的地标更新方法。实验采用ROS 2 Humble节点级受控环境,主实验为60次、门限敏感性实验为15次,并补充45次模块消融实验;结论限于固定锚点与合成观测条件。除汇总统计外,本文还报告来自真实导出记录的代表性空间可视化,用于解释关联与融合现象。

2. 问题描述与总体框架

室内目标级语义建图需要把不同时刻的二维检测、深度测量和相机位姿转换为可持续维护的三维地标。检测区域可能包含无效深度、背景和遮挡,连续帧又常共享视点与误差状态。本文据此将处理链分为观测建模、候选关联和递推融合,并以统一状态连接三个环节。

整体流程见图1:检测区域、深度和给定相机位姿首先形成带协方差的三维语义观测;随后通过类别一致门控、距离计算与一对一指派完成目标–地标关联;对匹配观测执行递推融合,对未匹配观测初始化新地标,最终得到持续更新的目标级三维语义地标。

Figure 1. Overall process of uncertainty-aware fusion for object-level 3D semantic landmarks

1. 面向目标级三维语义地标的不确定性融合总体流程

状态、代表点与视角依赖

为同时支持三维定位、统计门控和相关性判断,将第次目标观测定义为

O i ={ z i , R i , π i , q i , c i , t i }, (1)

式(1)中, z i R i 是地图坐标系下的三维代表位置和观测协方差; π i 为类别概率; q i 汇总深度质量; c i t i 分别为相机光心和时间戳。 q i 只描述质量,不替代位置协方差。

j 个持久地标维护几何、语义、观测次数及最近关联的时空信息:

j ={ μ j , Σ j , p j , n j , c j last , t j last }, c j =arg max k p j,k , (2)

式(2)中, μ j Σ j 为地标位置的后验均值与协方差, p j 为类别概率, n j 为累计观测次数; c j last t j last 用于相关性判断,类别 c j p j 的最大项派生。

检测框中心像素与ROI深度统计得到当前视点下的可见表面代表点。不同视角可能对应不同表面,故跨视角观测写为

z i =h( c i , j )+ ε i . (3)

式(3)中, h( c i , j ) 表示视点和目标几何共同决定的可见表面统计位置, ε i 为剩余测量误差。本文不显式求解 h( · ) μ j 因而只表示观测历史下的统计汇总,不是物体质心、包围盒中心或模型原点的无偏估计。

3. 深度估计与三维观测不确定性

为降低检测框边缘污染,本文先收缩ROI,再执行有效值筛选和MAD离群过滤;代表深度经针孔模型反投影后用于构造三维协方差。

3.1. 鲁棒深度估计与反投影

检测框四边按比例0.2收缩。区域内有限、严格大于0且不超过10.0 m的深度构成 D i ,随后按式(4)~(7)估计代表深度:

m i =median( D i ), (4)

MAD i = median d D i | d m i |, (5)

D i ={ d D i :| d m i | τ MAD max( 1.4826 MAD i , 10 6 m ) }, (6)

d ^ i =median( D i ), τ MAD =3.5. (7)

式(4)~(5)给出中位数 m i 与中位绝对偏差 MAD i ;式(6)以 1.4826 MAD i 近似高斯鲁棒尺度,用 τ MAD =3.5 过滤离群值,并以 10 6 m 防止零尺度退化;式(7)对过滤集合再取中位数得到 d ^ i

过滤后样本数与收缩ROI像素数之比为 r i 。当 r i 较低时,后续模型增大观测协方差;初始或过滤后集合为空时拒绝该观测。

以原检测框中心 ( u i , v i ) 为代表像素,针孔模型给出相机坐标点,并由相机到地图的刚体变换得到位置观测:

p i c =[ ( u i c x ) d ^ i / f x ( v i c y ) d ^ i / f y d ^ i ], z i = C mc p i c + t mc . (8)

式(8)中, f x , f y , c x , c y 为相机内参, p i c 为相机坐标点, C mc t mc 为相机到地图的旋转与平移。本模型尚未联合传播像素定位、内参和位姿协方差。

3.2. 质量自适应协方差

统计门控与递推融合还需要与深度质量相匹配的观测协方差。本文将距离、ROI深度离散度和有效样本比例映射为经验轴向标准差:

σ d,i = ( a+b d ^ i 2 ) 2 + ( 1.4826 MAD i ) 2 max( r i , r min ) ,a=0.01m,b=0.003 m 1 , r min =0.05. (9)

式(9)中, a+b d ^ i 2 为距离相关误差项, 1.4826 MAD i 为鲁棒离散尺度,分母中的有效样本比例项用于调整有效深度不足的影响。受控实验取 a=0.01m b=0.003 m 1 r min =0.05 。各项先统一为长度量再合成,故 σ d,i 的量纲为长度。该式是质量到协方差尺度的经验映射,不是特定相机的完整物理噪声模型。

以式(9)的轴向标准差为基准,用固定横向比例构造相机坐标系各向异性协方差,再旋转至地图坐标系:

R i c =diag( k x 2 σ d,i 2 , k y 2 σ d,i 2 , σ d,i 2 ), R i = C mc R i c C mc T , (10)

式(10)中, k x =0.55 k y =0.65 为无量纲横向比例; R i c R i 分别是相机与地图坐标系下的协方差。相机系三轴暂按不相关处理,三轴方差及旋转后特征值采用 2.5× 10 5 m 2 下限。

一致性评价针对融合后的地标状态,而非单帧观测。对已确认地标 j 在预热后第 k 个评价帧,以生成器定义的固定语义锚点 x j ref 为参照,定义

e j,k = μ j,k x j ref , NEES j,k = e j,k T Σ j,k 1 e j,k . (11)

式(11)中, e j,k μ j,k Σ j,k 分别为位置误差、融合后均值和后验协方差。评价先排除前20帧,只保留活动且累计观测不少于5次的确认地标,并按类别一致、距离不超过0.75 m的一对一匹配形成地标–帧样本。每次运行的平均NEES和95.45%覆盖率分别在全部有限样本上求均值和满足 I[ NEES j,k χ 3 2 ( 0.9545 ) ] 的比例,再对主实验和门限敏感性实验同一实验单元的5次运行,以及补充消融实验同一实验单元的15次运行,分别报告均值与样本标准差; χ 3 2 ( 0.9545 )=8.0249 ,三维高斯模型下单样本期望为3。未确认地标、未匹配地标和虚警不产生NEES样本。

4. 类别一致关联与相关观测融合

4.1. 一对一关联

对类别一致的观测–地标候选,创新协方差同时包含地标后验不确定性和当前观测不确定性。当前实现忽略二者的交叉协方差,因此

S ij = Σ j + R i . (12)

利用创新协方差归一化位置残差,得到平方Mahalanobis距离

d ij 2 = ( z i μ j ) T S ij 1 ( z i μ j ). (13)

式(13)在创新协方差定义的统计尺度下度量残差。候选条件为 d ij 2 τ m ,受控实验默认 τ m =11.345 ;Euclidean对照为 z i μ j 2 0.45m 。这些门限不外推为其他相机、帧率或场景的最优值。

类别不一致或门限外元素赋无效代价,线性指派(linear sum assignment)求解帧内一对一匹配。未匹配观测初始化新地标,故严格门控可能通过“拒绝–新建”路径增加重复建图;评价同时报告地标级错误合并比例、目标级重复建图比例和ID switch。

4.2. 相关观测的信息降权

连续RGB-D帧常共享视点、可见表面和误差状态。若按独立观测完整累加,其均值变化可能有限而协方差持续收缩。本文据时间间隔和相机光心位移设置几何信息权重:

γ i ={ γ c , 0 t i t j last < τ t and c i c j last 2 < τ c 1, otherwise , τ t =0.15s, τ c =0.08m. (14)

0 t i t j last < τ t =0.15s c i c j last 2 < τ c =0.08m 时取 γ i = γ c ;视点不可用或任一条件不满足时均取 γ i =1 。相关降权模式(correlated)采用 γ c =0.175 ,独立融合模式(independent)恒取1。该规则是相关性的工程近似,不等价于显式跨帧协方差估计。

对已关联观测,记更新前的先验为 ( μ j , Σ j ) ,更新后的后验为 ( μ j + , Σ j + ) ,新观测为 ( z i , R i ) 。信息形式更新将新观测的信息矩阵和信息向量同时乘以 γ i

Σ j + = [ ( Σ j ) 1 + γ i R i 1 ] 1 , (15)

μ j + = Σ j + [ ( Σ j ) 1 μ j + γ i R i 1 z i ]. (16)

式(15)~(16)对观测信息矩阵与信息向量使用相同权重。 γ i =1 时退化为独立高斯融合; 0< γ i <1 等价于将观测协方差放大为 R i / γ i ,从而减缓后验协方差收缩。

权重仅作用于几何信息;类别概率仍按检测置信度和累计次数更新。固定 γ c 不能保证所有扰动条件下达到理论一致性,也不能替代完整相关噪声滤波。

4.3. 初始化与生命周期

未匹配观测以 n j =1 初始化,累计5次观测后确认并发布;活动地标连续20 s未更新则失效。当前实现没有重激活和重复地标合并,因此严格门控拒绝正确观测后,新旧地标可能长期并存。该机制为解释地图碎片化提供实现依据,但不是独立因果验证。

5. 实验设计

5.1. 实验平台、节点链路与有效性审计

实验环境为Ubuntu 22.04、ROS 2 Humble和Python 3.10。合成观测节点发布类别、三维位置、协方差、相机光心及评估标识;建图节点执行类别一致门控、线性指派和信息形式融合;评估节点记录逐帧关联、位置误差、统计一致性及建图节点单帧更新耗时。场景包含6个静态目标和3个类别,每个类别设置两个空间相近实例以形成同类关联歧义。评估参照为生成器定义的固定语义锚点,不等于物体质心。

主实验60/60次、门限实验15/15次和补充消融实验45/45次均完成;各次实验均接收240/240帧,预热20帧后评价220帧。配置、逐帧指标、关联记录和汇总文件完整,核心指标为有限值且同帧关联满足一对一约束。确认前尚未定义的逐帧指标不计入评价。

5.2. 主实验设计与评价指标

主实验采用低扰动(clean)、中扰动(moderate)和强扰动(difficult) 3个复合扰动档位、2种关联方法、2种融合方式和5个配对随机种子的全因子设计,共60次运行。三档配置均直接取自观测生成程序:漏检概率分别为0.03、0.10和0.20;虚警数服从逐帧Poisson分布。位置误差不是固定标准差白噪声,而是先由有效深度比例和MAD生成式(9)~(10)的报告协方差,再以噪声尺度调整实际协方差,并按一阶自回归过程引入时间相关。离群点在随机方向附加0.16~0.42 m位移;误分类时从其余两类等概率选择。虚警位置在 [ 1.5,1.9 ]×[ 1.2,1.7 ]×[ 0.45,1.55 ], m 3 内均匀生成,协方差为 diag( 0.10 2 , 0.10 2 , 0.14 2 ) m 2 。因此档位差异只能解释为组合扰动效应。

同一档位和随机种子下的四种方法组合严格配对。门限敏感性实验固定中扰动、Mahalanobis和相关降权,在7.815、11.345和16.000三个平方门限下各运行5个配对种子;其种子与主实验中扰动组不同,仅用于比较门限变化的相对趋势。

主实验设计、扰动配置及评价指标汇总见表1

Table 1. Design and evaluation metrics of the ROS 2 node-level controlled experiments

1. ROS 2节点级受控实验设计与评价指标

项目

设置

主实验矩阵

3个扰动档位 × 2种关联 × 2种融合 × 5个配对种子 = 60次

关联方法

Euclidean; Mahalanobis (默认平方门限 τ m =11.345 )

融合方式

independent; correlated ( γ c =0.175 )

门限实验( τ m )

7.815、11.345、16.000,各5次,共15次

帧数

每次240帧;预热20帧;评价220帧

clean扰动

漏检/误分类/离群概率:0.03/0.01/0.01;虚警 lambda=0.015 r=0.93±0.035 ;MAD基值/标准差:0.004/0.0015m;噪声尺度/AR系数:0.90/0.88

moderate扰动

漏检/误分类/离群概率:0.10/0.04/0.045;虚警 lambda=0.045 r=0.78±0.08 ;MAD基值/标准差:0.010/0.0035m;噪声尺度/AR系数:1.20/0.90

difficult扰动

漏检/误分类/离群概率:0.20/0.09/0.09;虚警 lambda=0.09 r=0.62±0.12 ;MAD基值/标准差:0.018/0.006m;噪声尺度/AR系数:1.60/0.92

正文报告指标

位置RMSE;平均NEES;95.45%覆盖率; F 1 ;地标级错误合并比例; 目标级重复建图比例;ID switch;建图节点单帧更新耗时

注: r 从相应正态分布采样后截断至 [ 0.05,1 ] ;MAD均值还含 0.001 d 2 m距离项并截断为非负。虚警lambda为每帧Poisson均值。

评价节点每帧仅保留活动且已确认地标,按类别一致、与固定锚点距离不超过0.75 m的线性指派得到TP;其余已确认地标为FP,未匹配的6个真值目标为FN。逐帧 F 1 = 2PR/ ( P+R ) ,运行级 F 1 为预热后220帧的算术平均。位置RMSE汇总同期全部有效匹配的三维欧氏误差后计算;未确认地标不进入逐帧TP、FP或误差样本,未匹配真值计入FN。

地标级错误合并比例(landmark-level false-merge proportion)是发生跨真实对象合并的地标ID数,占所有接收过真实对象观测的地标ID数的比例。目标级重复建图比例(object-level duplicate-mapping proportion)是被映射为两个及以上地标ID的真实对象数,占全部6个真实对象的比例。ID switch按每个真实对象的关联事件序列累计相邻地标ID变化次数。三项身份指标均由完整运行期内的真实对象关联记录计算,包括预热期和地标未确认阶段;虚警观测不参与统计。

注:建图节点单帧更新耗时(per-frame mapper update time)从观测回调进入内部处理开始,至输出消息组装和发布前结束;包含观测转换、失效检查、代价矩阵构造、线性指派、融合及新地标初始化,平均值使用预热后的220帧。该指标不包含检测、RGB-D处理、TF、SLAM、DDS传输、消息发布、日志、磁盘分析或绘图。

5.3. 补充消融实验设计

补充消融固定中扰动(moderate)、Mahalanobis关联和correlated融合,其余门限与生命周期参数保持不变,并使用15个相同配对随机种子(20261717~20261731)。鲁棒深度消融仅比较同一收缩ROI内有效深度的直接均值与本文median + MAD (阈值3.5)筛选后中位数;协方差消融仅比较迹匹配各向同性模型(方差取各向异性协方差迹的1/3)与式(10)的各向异性模型。每组均运行240帧并评价预热后的220帧,以隔离两个模块的独立贡献。

5.4. 代表性运行可视化设置

可视化仅用于补充汇总统计对空间布局和后验不确定性的解释,不替代跨种子统计。图由真实ROS 2话题级CSV生成,固定为moderate、seed 20261717的四种关联–融合组合;真值锚点为场景生成器定义的语义参考点,不代表物体几何质心。

图2给出代表性运行的受控合成场景。六个静态语义目标分属三个类别,每类包含两个空间相近实例;相机光心沿预设视点轨迹采样。

Figure 2. Controlled synthetic scene with six semantic anchors and the camera viewpoint trajectory

2. 受控合成场景、六个语义锚点与相机视点轨迹

6. 结果与分析

6.1. 数据关联结果

严格配对结果显示,Mahalanobis相对Euclidean的F1在25/30个配对中降低、5/30不变;地标级错误合并比例在18/30个配对中降低、10/30不变、2/30增加,平均差值为−0.0349。ID switch和建图节点单帧更新耗时在全部30个配对中增加,平均分别增加163.47次和1.72 ms。当前结果体现地标级错误合并抑制与关联连续性之间的权衡,不能概括为Mahalanobis全面优于Euclidean。

主实验各关联–融合组合的数据关联结果见表2

Table 2. Association results of the main experiment (Mean ± sample SD, n = 5)

2. 主实验关联结果(均值 ± 样本标准差,n = 5)

扰动

关联

融合

F1

地标级错误合并比例

ID switch

单帧更新耗时/ms

clean

E

I

1.000 ± 0.000

0.000 ± 0.000

24.6 ± 9.6

0.88 ± 0.01

clean

E

C

1.000 ± 0.000

0.000 ± 0.000

24.6 ± 9.6

0.91 ± 0.02

clean

M

I

0.997 ± 0.006

0.000 ± 0.000

50.2 ± 13.2

1.57 ± 0.14

clean

M

C

0.961 ± 0.043

0.000 ± 0.000

60.6 ± 18.1

1.63 ± 0.11

moderate

E

I

0.900 ± 0.056

0.040 ± 0.023

101.4 ± 13.9

0.88 ± 0.02

moderate

E

C

0.900 ± 0.056

0.040 ± 0.023

101.4 ± 13.9

0.94 ± 0.03

moderate

M

I

0.652 ± 0.054

0.010 ± 0.006

292.8 ± 25.6

2.80 ± 0.13

moderate

M

C

0.645 ± 0.053

0.010 ± 0.005

305.4 ± 28.2

2.82 ± 0.09

difficult

E

I

0.719 ± 0.019

0.108 ± 0.072

201.6 ± 15.8

0.89 ± 0.03

difficult

E

C

0.716 ± 0.023

0.114 ± 0.058

203.0 ± 19.9

0.93 ± 0.02

difficult

M

I

0.420 ± 0.031

0.038 ± 0.013

466.2 ± 18.5

3.49 ± 0.06

difficult

M

C

0.431 ± 0.027

0.035 ± 0.014

462.2 ± 20.4

3.45 ± 0.07

注:表2表3中,E:Euclidean;M:Mahalanobis;I:independent;C:correlated。

6.2. 位置精度与统计一致性

30个严格配对中,相关降权使位置RMSE在29个配对中降低、1个配对中升高,平均差值为−3.96 mm;平均NEES在30/30个配对中降低,95.45%覆盖率在30/30个配对中提高,平均差值分别为−20.09和0.224。图3给出各档位的均值与样本标准差。中、强扰动下的NEES仍高于3,覆盖率低于0.9545,故只能认为过度自信有所缓解,不能声称完全校准。各组合的位置精度与统计一致性结果见表3

Table 3. Position accuracy and statistical consistency results (Mean ± sample SD, n = 5)

3. 位置精度与统计一致性结果(均值 ± 样本标准差,n = 5)

扰动

关联

融合

位置RMSE/mm

平均NEES

95.45%覆盖率

clean

E

I

19.87 ± 1.75

14.52 ± 2.63

0.424 ± 0.036

clean

E

C

14.60 ± 1.55

4.75 ± 0.62

0.834 ± 0.037

clean

M

I

18.81 ± 1.67

12.96 ± 2.35

0.435 ± 0.047

clean

M

C

14.26 ± 1.68

4.43 ± 0.80

0.860 ± 0.050

moderate

E

I

32.70 ± 2.56

38.57 ± 6.61

0.103 ± 0.043

moderate

E

C

27.84 ± 2.47

18.34 ± 2.50

0.338 ± 0.030

moderate

M

I

29.59 ± 2.52

30.18 ± 4.48

0.113 ± 0.041

moderate

M

C

26.35 ± 1.93

15.10 ± 1.04

0.333 ± 0.107

difficult

E

I

53.94 ± 3.92

85.56 ± 7.41

0.041 ± 0.020

difficult

E

C

49.69 ± 3.53

47.32 ± 3.38

0.067 ± 0.040

difficult

M

I

57.05 ± 11.42

68.21 ± 30.09

0.049 ± 0.053

difficult

M

C

55.47 ± 11.08

39.54 ± 16.20

0.080 ± 0.079

注:三维高斯模型下NEES期望为3,覆盖率目标为0.9545;固定锚点为生成器语义参考,不代表物体中心。

Figure 3. Position accuracy and fusion consistency across different disturbance profiles

3. 不同扰动档位下的位置精度与融合一致性

6.3. Mahalanobis门限敏感性

平方门限由7.815放宽至16.000时,平均F1由0.5542增至0.7839,ID switch由353.2次降至229.6次,地标级错误合并比例由0.0020增至0.0148。三个门限下目标级重复建图比例均为1.0,即6个真实对象均曾对应两个及以上地标ID。门限实验使用另一组五个配对种子,只用于判断相对趋势。

不同平方Mahalanobis门限下的敏感性结果见表4

Table 4. Sensitivity to the squared Mahalanobis gate (Mean ± sample SD, n = 5)

4. Mahalanobis平方门限敏感性(均值 ± 样本标准差,n = 5)

平方门限 τ m

F1

地标级错误合并比例

目标级重复建图比例

ID switch

单帧更新耗时/ms

7.815

0.554 ± 0.011

0.0020 ± 0.0045

1.000 ± 0.000

353.2 ± 24.5

2.96 ± 0.14

11.345

0.686 ± 0.027

0.0104 ± 0.0108

1.000 ± 0.000

294.4 ± 21.7

2.68 ± 0.13

16.000

0.784 ± 0.066

0.0148 ± 0.0143

1.000 ± 0.000

229.6 ± 23.4

2.44 ± 0.12

6.4. 模块消融结果

表5汇总固定moderate、Mahalanobis和correlated设置下的45次补充消融实验。三种配置各使用相同的15组paired seeds,每次接收240帧,并在预热20帧后评价220帧。鲁棒深度消融仅将Mean替换为median + MAD rejection;协方差消融仅将trace-matched isotropic替换为anisotropic,其余参数固定。

Table 5. Paired ablation results from the 240-frame supplementary experiments (Mean ± sample SD, n = 15)

5. 240帧补充实验的配对消融结果(均值 ± 样本标准差,n = 15)

(a) 鲁棒深度估计消融

指标

Baseline

Proposed

Δ (95% CI)

Depth RMSE/mm

12.80 ± 0.34

5.58 ± 0.12

−7.22 [−7.41, −7.03]

Depth MAE/mm

9.81 ± 0.25

4.36 ± 0.10

−5.45 [−5.60, −5.31]

Depth P95/mm

25.91 ± 0.80

11.21 ± 0.28

−14.69 [−15.17, −14.21]

Position RMSE/mm

26.65 ± 4.28

26.30 ± 4.33

−0.34 [−0.80, 0.11]

(b) 协方差模型消融

指标

Baseline

Proposed

Δ (95% CI)

Position RMSE/mm

27.01 ± 3.79

26.30 ± 4.33

−0.71 [−1.76, 0.34]

Association F1

0.6355 ± 0.0336

0.6547 ± 0.0471

+0.0192 [−0.0002, 0.0386]

Mean NEES

15.58 ± 3.70

15.21 ± 2.89

−0.36 [−1.72, 0.99]

95.45% Coverage

32.10% ± 11.75%

32.32% ± 10.37%

+0.22 [−5.63, 6.06] pp

注:结果为15组相同随机种子的配对实验,均采用moderate、Mahalanobis和correlated设置。各向同性模型采用迹匹配形式Σ_iso = trace(Σ_aniso)/3 × I。Δ定义为Proposed-Baseline;对误差指标Δ < 0表示改善,对F1和Coverage则Δ > 0表示改善。括号为基于逐seed配对差的双侧t型95% CI (df = 14),Coverage差值以百分点表示。

相对Mean,鲁棒深度将Depth RMSE从12.80 ± 0.34 mm降至5.58 ± 0.12 mm,Δ = −7.22 mm (95% CI [−7.41, −7.03]);Depth MAE从9.81 ± 0.25 mm降至4.36 ± 0.10 mm,Δ = −5.45 mm (95% CI [−5.60, −5.31]);Depth P95从25.91 ± 0.80 mm降至11.21 ± 0.28 mm,Δ = −14.69 mm (95% CI [−15.17, −14.21])。三项深度误差均为15/15 seed改善。Position RMSE仅由26.65 ± 4.28 mm降至26.30 ± 4.33 mm,Δ = −0.34 mm (95% CI [−0.80, 0.11];10/15改善);该区间跨越0,因此不据此声称稳定的位置精度提升。

相对迹匹配各向同性模型,各向异性协方差的Position RMSE Δ = −0.71 mm (95% CI [−1.76, 0.34];11/15改善)、Association F1 Δ = +0.0192 (95% CI [−0.0002, 0.0386];12/15改善)、mean NEES Δ = −0.36 (95% CI [−1.72, 0.99];8/15改善)和95.45% Coverage Δ = +0.22个百分点(95% CI [−5.63, 6.06];7/15改善)均跨越0。因此,其样本均值在部分位置和关联指标上呈有限改善,而跨seed证据较弱;mean NEES和Coverage仍明显偏离理论目标(约3%和95.45%),不能认为统计一致性已经得到充分校准。

6.5. 代表性空间可视化分析

图4仅展示固定种子下的代表性空间结果,用于辅助解释关联与融合现象,不替代跨种子统计。

图4上部对比Euclidean/Mahalanobis与independent/correlated的最终已确认地标分布,下部进一步比较同一真实对象在独立融合与相关降权模式下的95% XY边缘协方差椭圆面积。面积变化仅反映后验不确定性尺度,需与位置RMSE、NEES和覆盖率联合解释;相关降权在当前实现中的合理性由NEES和覆盖率的配对改善共同支持,不能据此单独声称完全校准。

Figure 4. Representative spatial results for moderate, seed 20261717: final landmark estimates and paired 95% XY marginal covariance ellipse areas

4. 中扰动、seed 20261717下的代表性空间结果:最终地标估计与95% XY边缘协方差椭圆面积配对

7. 讨论

7.1. 相关观测降权的作用与残余过度自信

相关降权使30/30个配对的平均NEES下降、95.45%覆盖率提高,并使位置RMSE在29/30个配对中下降。式(14)降低时空邻近观测的信息贡献,这一实现与信息重复累加受到抑制的解释一致。图4下部的95% XY边缘协方差椭圆面积配对图与这一机制相符,但不构成完整相关噪声模型的验证。位置RMSE的配对方向表明,一致性改善并非仅表现为后验协方差增大,多数配对中的递推均值误差也有所降低。像素定位、相机内参、位姿不确定性、跨帧相关和代表点的视角依赖尚未显式建模,因此强扰动下仍存在高NEES和低覆盖率;相关降权只能视为当前受控条件下的工程近似,不是相关噪声滤波的完整模型。

7.2. 统计门控与生命周期机制的耦合

Mahalanobis在部分配对中降低地标级错误合并比例,同时降低F1,并在全部配对中增加ID switch和建图节点单帧更新耗时。这一现象可由当前门控与地标生命周期逻辑解释:偏严格的门限可能拒绝部分真实匹配,未匹配观测随后初始化新地标;活动地标数量增加又可能扩大后续代价矩阵。门限敏感性实验中,宽松门限提高F1、降低ID switch,同时增加地标级错误合并比例;该趋势与上述权衡解释一致。由于三个门限下目标级重复建图比例均为1.0,现有结果不能排除固定生命周期和缺少重激活、删除及重复合并机制的影响。上述解释与当前实现逻辑一致,但本实验未对门控拒绝、新地标初始化和代价矩阵规模进行独立因果消融。

7.3. 适用边界与局限性

证据来自固定锚点合成观测的ROS 2节点级实验,使用给定相机位姿以隔离评价目标级地标的不确定性建模、关联与融合行为,不包含真实检测器或真实RGB-D数据。代表点对应可见表面而非物体中心;协方差尚未联合传播像素定位、相机内参、位姿及交叉相关误差;门限、相关权重和生命周期规则采用固定设置。低扰动、中扰动与强扰动均为组合扰动档位,其差异不能归因于单一噪声因素。

8. 结论

本文提出了一种面向室内目标级三维语义地标的不确定性融合方法。45次补充消融表明,鲁棒深度估计在15组配对实验中稳定降低Depth RMSE、MAE和P95;最终Position RMSE仅小幅变化,配对95% CI跨越0。各向异性协方差在部分位置和关联指标的样本均值上呈有限改善,但Position RMSE、Association F1、mean NEES和Coverage的配对区间均跨越0,且NEES和Coverage仍明显偏离理论目标。主实验进一步表明,correlated fusion在30/30个配对中降低mean NEES、在30/30个配对中提高95.45% Coverage,并在29/30个配对中降低Position RMSE;Mahalanobis关联体现了错误合并抑制与关联连续性之间的权衡。上述结果表明,所提出方法在当前固定锚点、合成观测和给定位姿的受控目标级语义建图条件下,对深度观测质量、地标递推融合和关联行为具有相应作用。

基金项目

教育部“春晖计划”科研项目“基于深度学习的工业机器人多传感主体融合智能引导机理与关键技术研究”(HZKY20220122)。

NOTES

*通讯作者。

参考文献

[1] 黄泽霞, 邵春莉. 深度学习下的视觉SLAM综述[J]. 机器人, 2023, 45(6): 756-768.
[2] 王金科, 左星星, 赵祥瑞, 吕佳俊, 刘勇. 多源融合SLAM的现状与挑战[J]. 中国图象图形学报, 2022, 27(2): 368-389.
[3] 王柯赛, 姚锡凡, 黄宇, 等. 动态环境下的视觉SLAM研究评述[J]. 机器人, 2021, 43(6): 715-732.
[4] 王梦瑶, 宋薇. 动态场景下基于自适应语义分割的RGB-D SLAM算法[J]. 机器人, 2023, 45(1): 16-27.
[5] 牛珉玉, 黄宜庆. 基于动态耦合与空间数据关联的RGB-D SLAM算法[J]. 机器人, 2022, 44(3): 333-342.
[6] Rosinol, A., Violette, A., Abate, M., Hughes, N., Chang, Y., Shi, J., et al. (2021) Kimera: From SLAM to Spatial Perception with 3D Dynamic Scene Graphs. The International Journal of Robotics Research, 40, 1510-1546.
https://doi.org/10.1177/02783649211056674
[7] 杨峻峰, 田国会, 邵旭阳. 基于在线信息体构建与维护的长期自治家庭服务机器人环境理解方法[J]. 机器人, 2025, 47(2): 269-282.
[8] 张健, 陈烨恒, 朱世强, 等. 一种基于邻域度量关系的RGB-D融合语义分割算法[J]. 机器人, 2023, 45(2): 156-165.
[9] Hughes, N., Chang, Y. and Carlone, L. (2022) Hydra: A Real-Time Spatial Perception System for 3D Scene Graph Construction and Optimization. Proceedings of Robotics: Science and Systems XVIII, New York, 27 June-1 July 2022, 1-13.
https://doi.org/10.15607/rss.2022.xviii.050
[10] 王光明, 宋亮, 沈玥伶, 等. 基于目标检测和场景流估计联合优化的3D多目标跟踪[J]. 机器人, 2024, 46(5): 554-561.
[11] 张玮奇, 王嘉, 张琳, 等. SUI-SLAM: 一种面向室内动态环境的融合语义和不确定度的视觉SLAM方法[J]. 机器人, 2024, 46(6): 732-742.
[12] Gu, Q., Kuwajerwala, A., Morin, S., Jatavallabhula, K.M., Sen, B., Agarwal, A., et al. (2024) ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning. 2024 IEEE International Conference on Robotics and Automation (ICRA), Yokohama, 13-17 May 2024, 5021-5028.
https://doi.org/10.1109/icra57147.2024.10610243
[13] 曾庆化, 罗怡雪, 孙克诚, 李一能, 刘建业. 视觉及其融合惯性的SLAM技术发展综述[J]. 南京航空航天大学学报, 2022, 54(6): 1007-1020.