Conference

EgoForce: Forearm-Guided Camera-Space 3D Hand Pose from a Monocular Egocentric Camera

Christen Millerdurai, Shaoxiang Wang, Yaxu Xie, Vladislav Golyanik, Didier Stricker, Alain Pagani

DFKI; Max Planck Institute for Informatics

一句话总结

EgoForce 用单目第一视角 RGB 相机,借助”前臂”这一强度量线索和一个跨相机模型的射线空间闭式求解器,从头戴设备视角恢复出手部在相机坐标系下的绝对 3D 姿态与形状,且能在透视、鱼眼、宽视场畸变等多种光学配置间通用。

研究背景

  • 领域现状:随着 AR/VR 从笨重头显转向 Project Aria 这类轻量眼镜,感知栈越来越依赖单个第一视角 RGB 相机,因此单目第一视角 3D 手部姿态估计成为刚需。但现有单目方法大多只估计相对于根关节(如手腕)的根相对姿态,只能恢复到未知平移和尺度,拿不到手在设备度量坐标系里的绝对位置。
  • 核心痛点:从单个第一视角相机恢复绝对 6-DoF 手姿面临三重困难——深度-尺度歧义、频繁自遮挡、以及宽视场/鱼眼镜头带来的强畸变;更麻烦的是 AR/VR 设备的相机配置五花八门(透视、鱼眼、柱面、球面),投影模型各异,很难训练出一个能跨光学通用的单目系统。设备专用方法(如在 H2O 或 AssemblyHands 上训练的)一旦换相机就性能崩塌。
  • 本文 idea:两个关键洞见。其一,前臂提供强度量线索——前臂长度与整体臂围/身体尺度高度相关(人体测量学证据),且前臂与手运动耦合,据此可比纯手方法更可靠地化解深度-尺度歧义。其二,在射线空间做提升——把 2D 关节观测表示为射线(bearing vector)而非原始像素坐标,从而摆脱对特定像素坐标系的依赖,用一条统一管线覆盖透视、鱼眼和宽视场畸变光学。

方法

整体框架:给定一帧第一视角 RGB,先裁出手部与前臂两个区域,分别 token 化并注入裁剪内参(Crop Intrinsics Token),送入一个统一的臂-手 Transformer(HALO 架构)联合推断手与前臂的 2D 关键点、置信度以及根相对的 MANO/FARM 参数;再由射线空间求解器(RSS)把根相对预测提升到相机坐标系下的绝对网格。左右手-前臂各自独立走同一套流程。

flowchart LR
  A["第一视角 RGB 帧"] --> B["裁剪手 224 与前臂 112"]
  B --> C["去畸变 + 分块 token + CIT 内参 token"]
  C --> D["ViT 主干 + Transformer 解码器 联合臂手推理"]
  D --> E["2D 关键点 + 置信度 + 根相对 MANO/FARM"]
  E --> F["射线空间求解器 RSS 求共享平移"]
  F --> G["相机坐标系 手-前臂网格"]
  D --> H["前臂不可见: 掩码 + 变分先验补全"]
  H --> F

关键设计:

  1. FARM 前臂表示与统一臂-手网格。手用 MANO 参数化(姿态 \(\theta \in \mathbb{R}^{16\times 6}\)、形状 \(\beta \in \mathbb{R}^{10}\)、平移 \(t_H\));作者新提出 FARM(ForeArm Representation Model),用形状 \(\gamma \in \mathbb{R}^5\)、旋转 \(R \in \mathbb{R}^6\)、平移 \(t_F\) 描述前臂。把 FARM 的腕对齐到 MANO 腕,再沿肘方向加约 3% 肘-腕长的小偏移避免穿插,得到一个解剖上连贯、刚性锚定的手-前臂整体网格。这样前臂就成了稳定手部朝向、缩小手部可行 3D 空间的强先验。

  2. HALO 架构与裁剪内参 token(CIT)。手部/前臂区域分开处理(而不是简单放大手部裁剪包含前臂),以保留手部高频细节,再靠交叉注意力融合两者捕捉运动学结构。每个裁剪先做镜头去畸变,分块投影为 token,并把归一化的裁剪内参编码成 CIT token 与每个 patch token 融合,让模型在不同镜头和裁剪配置下都能做一致的几何推理。解码阶段用少量可学习 query(4 个手 query + 3 个臂 query)从视觉 token 里解出手臂特征,自注意力提供跨肢体上下文,让手遮挡时能借臂线索求解。

  3. 不可见前臂的变分先验补全。第一视角下前臂常出画。当没有前臂检测框时,用一个条件变分先验(CVAE)以手部特征 \(f_{\text{hand}}\) 为条件采样潜在臂编码 \(z_{\text{arm}}\),生成一个合理的前臂特征替换缺失特征——有视觉证据就用证据,没有就退回到学到的、以手为条件的运动学先验,保证手-臂配置连续且真实。

  4. 射线空间求解器(RSS)。拿到根相对关节、检测 2D 关节和置信度后,估计一个手-臂网格共享的相机坐标平移 \(t \in \mathbb{R}^3\)。对每个 2D 关键点,按标定相机模型反投影得到单位射线方向 \(d_i\);相机坐标 3D 关节 \(P_i(t) = t + J_i\) 应落在对应射线上。用正交投影算子 \(\Pi_i = I - d_i d_i^{\top}\) 消去未知深度,只保留与射线垂直的分量,解一个置信度加权最小二乘(闭式)问题:

\[\min_{t}\ E(t) = \sum_{i=1}^{M} w_i \lVert \Pi_i P_i(t) \rVert_2^2\]

求解器对根相对预测停止梯度以防不稳定拟合污染学习,并对逐帧平移用卡尔曼滤波提升稳定性。因为任何相机投影模型都能算射线方向,RSS 天然泛化到任意标定相机。训练用的总损失由 2D 热图、3D 关节、MANO、FARM、手-臂相对朝向、前臂先验 KL、相机空间 3D 关节等多项加权组成。

实验结果

在 ARCTIC、HOT3D、H2O 三个第一视角基准(另加外视角 HO3D)上评测,与把 HaMeR 结果用 DepthAnythingV2 提升到相机空间的 HaMeR-D、MobRecon、HandOccNet、HandDGP 对比。主实验(相机空间误差 CS-MJE 与 Procrustes 对齐误差 PS-MJE,单位 mm):

方法 ARCTIC CS-MJE↓ HOT3D CS-MJE↓ H2O CS-MJE↓ HO3D CS-MJE↓
HaMeR-D 2067.3 4493.7 631.6 561.5
MobRecon 81.5 116.3 49.1 121.7
HandOccNet 256.3 284.8 62.1 156.4
HandDGP 51.7 61.3 29.9 50.3
EgoForce (本文) 49.5 43.9 25.0 49.5

EgoForce 在相机空间精度上全面领先:在鱼眼强畸变的 HOT3D 上相对 HandDGP 把 CS-MJE 降低 28%(61.3→43.9 mm),在 H2O 上降到 25.0 mm,且同时保持较优的关节铰接精度(PS-MJE)。时序稳定性也更好,H2O 上相机空间加速度误差 CS-ACC 仅 5.5 m/s²(HandDGP 为 8.5)。

其余实验以文字概述:相机几何消融显示去畸变带来最大单项增益(HOT3D CS-MJE 123.4→48.7 mm),叠加裁剪内参 token 后进一步到 45.8 mm,而全帧整流反而因外围畸变变差;臂上下文消融显示可见时加入前臂裁剪把手部 CS-ACC 降 21.2%,不可见时变分先验把前臂 RS-MJE 从 28.7 降到 12.8 mm(降 55.4%);前臂线索在近场(距相机 200–300 mm)把手部尺度误差从 4.7 降到 2.7 mm,验证了缓解深度-尺度歧义的作用。整套两手端到端管线在 RTX 3090 上约 14 FPS。

亮点与局限

  • 亮点:
    • 用”前臂”这一被以往手姿方法忽视的度量线索,有原则地缓解单目深度-尺度歧义,而不是靠脆弱的人体测量硬假设或场景深度估计。
    • 射线空间闭式求解器把 2D-3D 提升放到 bearing vector 空间,天然跨透视/鱼眼/宽视场通用,摆脱像素坐标系依赖,是单相机、无 SLAM、无里程计、无手动尺度标定的逐帧稳定方案。
    • 前臂出画时用手条件变分先验补全,兼顾”有证据用证据、无证据靠先验”,保证手-臂运动连续真实。
  • 局限:
    • 依赖有标定的 3D 数据集训练,无法利用根相对方法常用的大规模 2D 手部数据,因而对野外图像的泛化受限。
    • 对相机内参仍较敏感,大幅内参失配(>150%)时性能会退化。
    • FARM 参数需逐数据集生成,部分数据集(HO3D、HOT3D、Re:InterHand、HandCO)因单目深度歧义或前臂罕见可见而无法恢复 FARM 标注。

延伸思考

这项工作把”绝对相机空间手姿”作为直接目标,对下游即插即用(物理引擎、抓取规划、碰撞避免、手-物合成)很有价值,避免了事后对齐和尺度启发式。射线空间提升的思路可推广到其他需要跨相机模型泛化的第一视角任务(如全身姿态、手-物联合估计)。值得追问的是:当前臂本身也强遮挡或运动模糊时,anthropometric 耦合先验会不会引入系统性偏差?以及能否放宽对精确标定内参的依赖,让方法在未标定的消费级设备上也稳健——这将决定它离真正”换个眼镜就能用”还有多远。