论文阅读笔记:GPV-Pose: Category-level Object Pose Estimation via Geometry-guided Point-wise Voting
论文:https://arxiv.org/pdf/2203.07918
代码:https://github.com/lolrudy/GPV_Pose
1 背景
能够可靠的估计6D物体姿态,即其3D旋转和平移,是计算机视觉中一个基本问题,因为他在AR&VR、机器人技术和3D理解中实现了广泛的应用。因此最近有大量研究致力于姿态估计领域,产生了甚至在严重遮挡的情况下可以可靠德实时估计姿态的方法。然而,这些方法中的大多数只能处理几个对象,事实上,有时甚至一次只能处理一个实例。此外,在训练或推理中,通常需要高质量的CAD模型,这显然限制了此类方法在实际应用中的使用。为了解决这个问题,类别级姿态估计尝试超越实例级场景,并针对已知类别中以前未见过的对象估计姿态以及对象的尺寸。由于缺乏各自的CAD模型以及不同对象之间存在较大的类内差异,类别级任务本质上更具挑战性。
尽管类别级位姿估计是一个成熟的领域,但由于基于深度学习的新系列工作,它最近开始再次受到越来越多的欢迎。有趣的是,这些工作中的大多数都采用学习或手动设计的规范对象空间来恢复位姿,并且部分地另外利用基于点云的形状先验或位姿一致性项来更好地处理类内形状变化。尽管这些方法在基准测试上取得了显着的改进,但由于它们没有明确地利用姿态和点云之间的几何关系,因此由于提取姿态敏感特征的能力不足,它们的性能仍然远不能令人满意。
本文中提出了 GPV-Pose,一种新颖的类别级姿态估计框架,它利用几何约束来增强对类内对象形状特征的学习。 GPV-Pose 在基于 3D 图卷积 (3DGC) 的编码器之上堆叠了三个单独的分支,用于直接位姿回归、对称感知重建和逐点边界框投票。特别地,文本引入了一种新颖的解耦置信驱动旋转表示,其中旋转矩阵被分解为对象边界框的平面法线。本文证明,估计的置信度能够实现 3D 旋转的封闭形式恢复,并且能够捕获每个类别的几何特征。此外,除了通过对称感知重建来增强特征质量外,作者还提出了一种新颖的几何引导逐点投票范式(GPV),能够稳健地恢复对象的 3D 边界框。如图1所示,利用这三个单独的估计,可以利用两个几何关系流,即点云-姿态(PP)和点云边界框-姿态(PBP)作为几何一致性项,进一步改进类别级形状特征的学习,从而提高整体性能。
总的来说,本文贡献如下:
-
提出了一种新颖的几何引导类别级姿态估计框架 GPV-Pose,它由三个各自的分支组成,用于直接姿态回归、对称感知重建和逐点边界框投票,在 20 FPS 的高帧率下在常见公共基准测试中给出了优异的结果。
-
为了增强类内形状特征的学习,引入了旋转和对象边界框的置信感知预测,并且几何约束的两个并行流PP和PBP自然地转换为几何一致性项。
-
提出了一种新颖的逐点对象边界框投票机制,该机制使用置信加权最小二乘算法聚合所有点的方向、距离和置信度预测。
2 方法
给定RGBD图像,首先使用现成的目标检测器(如MaskRCNN)从深度图中分割感兴趣的对象。然后从反投影3D点云中采样1028个点,并将它们作为输入提供给GPV-Pose网络。由于3DGC对给定点云的移动和缩放不敏感,因此可以采用3DGC作为骨干来提取全局和逐点特征。作者进一步附加三个并行分支,用于直接置信度知姿态预测、对称感知点云重建和逐点边界框投票。利用这些不同的输出,自然可以强制执行多个几何约束,从而获得卓越的性能。图 2 提供了示意性概述。在本文中,使用
{
R
,
t
,
s
}
\{R, t, s\}
{R,t,s} 来表示
{
R
o
t
a
t
i
o
n
,
T
r
a
n
s
l
a
t
i
o
n
,
S
i
z
e
}
\{Rotation, Translation, Size\}
{Rotation,Translation,Size}。

2.1 置信度感知位姿回归
最近的工作表明,以边界框平面法线的形式预测旋转,即相当于考虑旋转矩阵的两列,可以有利于学习,因为它解决了 SO(3) 中的不连续性。因此,在这些工作之后,如图 2 (e) 所示,我们还将旋转预测为 3D 边界框的两个平面法线。然而,由于某些法线自然更容易恢复,因此我们另外估计每个法线的置信值,以努力提高恢复最终 3D 旋转时的鲁棒性。举个例子,想象一下预测笔记本电脑的旋转,因为一个平面法线通常垂直于键盘表面,因此它是比其余平面更容易计算的目标。因此,这种常态应该获得更高的信心,从而稳定旋转恢复。总的来说,我们希望强制更高的置信度伴随着更准确的旋转法线预测。因此,我们定义:

其中 k 1 k_1 k1 是一个常量, r i g t r_i^{gt} rigt 是对应的GT平面法线, ∣ ∣ ⋅ ∣ ∣ 1 ||·||_1 ∣∣⋅∣∣1 是 L 1 L_1 L1 损失。
就是用 e − k 1 ∣ r i − r i g t ∣ 2 e^{-k_1|r_i-r_i^{gt}|^2} e−k1∣ri−rigt∣2 作为置信度,因为 ∣ r i − r i g t ∣ 2 ≥ 0 |r_i-r_i^{gt}|^2≥0 ∣ri−rigt∣2≥0,保证了置信度是属于(0,1]的。并且误差越小, exp(−误差) 越大,置信度越高。
如图4(b),给定预测平面法线
r
y
、
r
x
r_y、r_x
ry、rx 以及置信度
c
y
、
c
x
c_y、c_x
cy、cx,最小化一下代价函数以将平面法线校准为垂直法线
r
y
’
r_{y’}
ry’ 和
r
x
’
r_{x’}
rx’:

其中
θ
\theta
θ 表示
r
x
r_x
rx 和
r
y
r_y
ry 之间的角度。

根据式2,可得:

校准平面法线 r y ′ r'_y ry′ 和 r x ′ r'_x rx′ 可以使用罗德里格斯旋转公式从 KaTeX parse error: Undefined control sequence: \* at position 5: (θ_1\̲*̲, θ_2\*) 计算出来。最终,得到旋转矩阵为 R ′ = [ r ′ x , r ′ y , r ′ x × r ′ y ] R'=[r'x,r'y,r'x×r'y] R′=[r′x,r′y,r′x×r′y]。
换言之,通过监督让 KaTeX parse error: Undefined control sequence: \* at position 5: (θ_1\̲*̲, θ_2\*) 越来越接近0,就是让 θ \theta θ 越来越接近 π 2 \frac{\pi}{2} 2π。代码里是直接使用 L 1 L_1 L1 loss 来监督。
同时:
如果 c y c_y cy 高( r y r_y ry 可信),则 θ 1 ∗ θ_1* θ1∗ 小 → r y r_y ry 调整少。
如果 c x c_x cx 高( r x r_x rx 可信),则 θ 2 ∗ θ_2* θ2∗ 小 → r x r_x rx 调整少。
至于平移 t t t,提供预测的残差平移 KaTeX parse error: Undefined control sequence: \* at position 2: t\̲*̲ 和输入点云 M P M_P MP 的平均值,我们计算 KaTeX parse error: Undefined control sequence: \* at position 6: t = t\̲*̲ + M_P。类似地,给定估计的残差大小 KaTeX parse error: Undefined control sequence: \* at position 2: s\̲*̲ 和预先计算的类别平均大小 C m C_m Cm,我们获得尺度 KaTeX parse error: Undefined control sequence: \* at position 6: s = s\̲*̲ + C_m。
2.2 对称分析
我们利用两种对称性来提取更有效的逐点特征:反射对称和旋转对称。对于反射对称类别(如马克杯、笔记本电脑),我们预测输入点云 P 相对于反射平面对应的点云
P
′
P'
P′ ;而对于旋转对称类别(如易拉罐、碗、瓶子),我们则预测输入点云 P 相对于对称轴对称的点云
P
′
P'
P′,否则,我们直接用
P
’
=
P
P’=P
P’=P 重构
P
P
P。对称感知重建由以下损失项监督:

其中 KaTeX parse error: Undefined control sequence: \* at position 3: ε(\̲*̲) 取决于对称类型。
2.3 边界框的逐点投票
GPV-Pose的另一个主要贡献在于新颖的置信加权逐点投票策略,用于稳健的边界框预测。为此,对于每个观测点
p
j
p_j
pj,我们预测其朝向六个边界框面的方向
n
i
j
n_i^j
nij、距离
d
i
j
d_i^j
dij 和置信度
c
i
j
c_i^j
cij,其中
i
∈
B
i∈B
i∈B 且
B
=
{
y
±
,
x
±
,
z
±
}
B=\{y±,x±,z±\}
B={y±,x±,z±},如图4(a)所示。然后,我们使用所有空间线索的加权平均来计算观察对象的边界框。如图4(a)所示,考虑顶部边界框面
y
+
y+
y+,我们得到
p
j
p_j
pj 的顶面
y
+
y+
y+ 上的对应点
p
j
′
p'_j
pj′ 为:

平面参数被描述为法线 N y + N_{y+} Ny+ 和 y + y+ y+ 的原点到平面距离 D y + D_{y+} Dy+,可以使用加权最小二乘法进行估计,其中点 p j p_j pj 的权重等于其置信度 c j c_j cj。 B B B 中的所有其他面豆遵循相同的计算。
由于可以轻松获得每个预测值
n
i
j
n_i^j
nij 和
d
i
j
d_i^j
dij 的真实投票,因此可以直接通过
L
1
L1
L1 损失对其进行监督。对于置信度
c
i
j
c_i^j
cij ,与式1相似,可以定义损失项为:

其中
k
2
k_2
k2 是一个常数超参数,
f
j
i
(
p
j
)
f_j^i(p_j)
fji(pj) 表示
p
j
p_j
pj 到
B
B
B 中的面
i
i
i 的真实距离。现在再次考虑顶面
y
+
y+
y+,我们相应地得到:

其中 s [ y + ] s_{[y+]} s[y+] 是沿着 y + y+ y+ 方向的尺寸, R g t R_{gt} Rgt 和 t g t t_{gt} tgt 指的是GT旋转和平移。
值得注意的是,置信加权边界框投票的贡献有两个。首先,它在 PBP 流中强制执行几何一致性项。其次,它还增强了对类别内几何特征的学习。一般来说,一个点越接近边界框平面,它就越有信心准确地投票给边界框平面,因为它受类内变化的影响较小。因此,这些几何指导强制学习图 2 中的全局(绿色)和逐点(蓝色)特征,以捕获更具体的类别级别特征。
2.4 点云-位姿几何一致性
虽然大多数类别级方法从均匀采样的点云中预测位姿,但它们没有明确考虑位姿和点云之间的几何关系。相反,他们利用每个位姿参数的单独损失项来隐式学习这种几何关系。另一方面,不难推断,当通过 { R , t } \{R, t\} {R,t} 的逆将点云转换为规范视图并删除所有异常值时,大小 { s } \{s\} {s} 可以简单地计算为沿每个轴最外面的点之间的距离。本文中,将上述转换转化为监督项,以明确执行这些几何关系,从而提高性能。
为此,首先将点云从相机视图转换为预定义的规范视图。与实例级姿态预测中使用的点匹配损失类似,然后最小化:

其中 P P P 是采样点云, p c p^c pc 是规范视图下 p p p 对应的GT。
接下来,估计正确的度量尺度通常可以被视为找到封装所有对象点同时具有最小体积的 3D 边界框的任务。不幸的是,只有当我们没有观察到任何异常值时,这才是正确的。由于在处理实际数据时很少出现这种情况,因此我们放宽此约束并尝试强制在最小体积的边界框中包含尽可能多的点。给定具有一些异常值的采样点,我们首先进行箱采样以确保这些点遵循近似均匀分布。为此,我们将点分为 64 个 bin。此外,每当一个容器溢出时,我们都会对固定数量的点进行统一子采样。最终得到的点集记为
P
s
P_s
Ps。图 3 (b) 也展示了这个过程。

然后给定
{
s
}
\{s\}
{s} 的估计,其成为预期大小的概率计算如下,

其中
{
k
s
,
k
n
}
\{k_s,k_n\}
{ks,kn} 是常量超参数,另外,
k
p
k_p
kp 是归一化参数,如果
p
≤
s
,
p≤s,
p≤s, 则
α
(
p
,
s
)
=
1
\alpha(p,s)=1
α(p,s)=1,否则,
α
(
p
,
s
)
=
−
1
\alpha(p,s)=-1
α(p,s)=−1。由此,尺度
{
s
}
\{s\}
{s} 的几何损失项可以导出为:

其中 B ’ = { x + , y + , z + } B’=\{x+,y+,z+\} B’={x+,y+,z+}。注意,该项仅当 B B B 中相应的边界框面从给定视点可见时才有意义。因此,我们针对被遮挡的面关闭 L ( s ) P C L_{(s)}^{PC} L(s)PC。
解释一下这段。
核心思想
目标:找到一个3D边界框(bounding box),使其尽可能包裹所有物体点,同时体积最小。
问题:如果数据中存在离群点(噪声点),直接求最小体积框会不准确。
解决思路:放宽约束,改为寻找一个包含尽可能多点的最小体积框。
步骤说明
- 点云预处理
对采样点进行分箱采样(bin sampling),使其分布更均匀。
将点分为 64 个 bin。
如果某个 bin 中的点过多,就均匀地子采样一部分点,避免某些区域点过密。
最终得到的点集记为 ( P_s )。
- 评估尺度 ({s}) 的合理性
对于一个给定的尺度估计 ( s ),计算它作为“正确尺寸”的概率:
总概率函数: f ( s ) = min ( 0 , k p ∣ P s ∣ f p ( s ) ⋅ f d ( s ) ) f(s) = \min\left(0, \frac{k_p}{|P_s|} f_p(s) \cdot f_d(s)\right) f(s)=min(0,∣Ps∣kpfp(s)⋅fd(s))
k p k_p kp:归一化参数
f p ( s ) f_p(s) fp(s):点是否在框内的评分
f d ( s ) f_d(s) fd(s):点到边界框的距离评分
点内/外评分函数: f p ( s ) = exp ( k n ∣ P s ∣ ∑ p ∈ P s ( α ( p , s ) + 1 ) ) f_p(s) = \exp\left(\frac{k_n}{|P_s|} \sum_{p \in P_s} (\alpha(p,s) + 1)\right) fp(s)=exp(∣Ps∣kn∑p∈Ps(α(p,s)+1))
- α ( p , s ) = 1 \alpha(p,s) = 1 α(p,s)=1 如果点 $ p$ 在框内,否则为 − 1 -1 −1
距离评分函数: f d ( s ) = ∑ p ∈ P s α ( p , s ) exp ( − k s ∣ s − p ∣ 2 ) ) f_d(s) = \sum_{p \in P_s} \alpha(p,s) \exp(-k_s |s - p|^2)) fd(s)=∑p∈Psα(p,s)exp(−ks∣s−p∣2))
- 衡量点到边界框边界的距离,越近越好
- 几何损失函数
将上述概率转换为损失: L ( s ) P C = ∑ i ∈ B ′ ∣ ( 1.0 − f ( s i ) ) ∣ 1 \mathcal{L}_{(s)}^{PC} = \sum_{i \in B'} |(1.0 - f(s_i))|_1 L(s)PC=∑i∈B′∣(1.0−f(si))∣1
( B’ = {x+, y+, z+} ) 表示在三个轴正方向上的边界框
损失越小,说明估计的尺度越合理
关键特点
鲁棒性:通过分箱采样和概率建模,减少离群点影响
均匀采样:避免点云密度不均匀导致的偏差
概率建模:不仅考虑点是否在框内,还考虑点到边界的距离,使边界框更贴合物体形状
这个损失函数保证了边界框在包裹尽可能多物体点的同时,保持紧致(体积小):
最大化框内点数
在 f p ( s ) f_p(s) fp(s) 中,如果点 p p p 在框内 ( α = 1 ) (α = 1) (α=1) ,则 α ( p , s ) + 1 = 2 α(p,s) + 1 = 2 α(p,s)+1=2,贡献为正。
如果点在框外 ( α = − 1 ) (α = -1) (α=−1),则 α ( p , s ) + 1 = 0 α(p,s) + 1 = 0 α(p,s)+1=0,不贡献。
因此, f p ( s ) f_p(s) fp(s) 会 鼓励框内包含更多点。
保证边界框紧贴物体表面(
f d ( s ) f_d(s) fd(s) 是关键: α ( p , s ) e x p ( − k s ∣ s − p ∣ 2 ) α(p,s) exp(-k_s |s - p|^2) α(p,s)exp(−ks∣s−p∣2)
对于框内点( α = 1 α = 1 α=1):距离边界越近( ∣ s − p ∣ 2 |s-p|^2 ∣s−p∣2 小),指数项越大,鼓励点靠近边界。
对于框外点( α = − 1 α = -1 α=−1):距离越近,惩罚越大(负值),强烈排斥框外点靠近边界。
这就像在边界处设置了一个“软性屏障”:边界应该紧贴最外侧的物体点,但不能包含外部背景点。
保证边界框尺寸尽可能小
体积最小化隐含在以上两点中:
如果框太大,虽然能包含更多点,但框内点距离边界远 → f d ( s ) f_d(s) fd(s) 降低。
如果框太小,会排除太多点 → f p ( s ) f_p(s) fp(s) 降低。
最优解是在 包含足够多点的前提下,让边界尽可能贴近最外侧点,从而自然得到最小体积。
所以,这个损失函数 保证了边界框的“紧致性”和“覆盖性”的平衡,对离群点具有鲁棒性。
总而言之,估计姿态和相应对象点云之间的几何感知损失项定义为:

其中 KaTeX parse error: Undefined control sequence: \* at position 9: \lambda_\̲*̲ 表示不同项之间的平衡权重。
2.5 边界框-位姿几何一致性
本文中,作者以
{
t
,
s
}
\{t,s\}
{t,s} 为中心,以点投票的方式取边界框的 {长,宽,高}。此外,将旋转
R
R
R 分解为三列
R
=
{
r
x
,
r
y
,
r
z
}
R=\{r_x,r_y,r_z\}
R={rx,ry,rz}。但是仅预测
r
x
r_x
rx 和
r
y
r_y
ry 以及相关置信度即可,因为他们已经完全描述了3D旋转,即
r
z
=
r
x
+
r
y
r_z = r_x+r_y
rz=rx+ry。作者还证明了
r
x
r_x
rx 和
r
y
r_y
ry 对应于边界框的平面法线。因此,给定估计的六个边界框面
{
N
i
.
D
i
}
,
i
∈
B
\{N_i.D_i\},i∈B
{Ni.Di},i∈B,定义边界框-位姿一致性如下:

然后将位姿和估计边界框之间的整体几何一致性计算为这些单独项的加权和:

2.6 总的训练目标
综上所述,GPV-Pose 采用以下损失函数:

3 效果



2万+

被折叠的 条评论
为什么被折叠?



