Conference

Hand Pose Estimation with Mems-Ultrasonic Sensors

Qiang Zhang, Yuanqiao Lin, Yubin Lin, Szymon Rusinkiewicz

Princeton University

一句话总结

本文提出 UltraGlove——一款在手指上贴附若干 MEMS 超声传感器、通过测量传感器两两间距离矩阵、再由轻量深度网络重建三维手部姿态的低成本手套,兼顾精度、尺寸无关性与抗外部干扰能力。

研究背景

  • 领域现状:手部追踪是 VR/AR、虚拟训练、灵巧机器人遥操作等场景的关键交互技术。主流方案分三类——视觉(RGB/RGB-D 相机)、惯性(IMU 手套)、拉伸传感(stretch sensor 手套)。
  • 核心痛点:视觉方法受自遮挡、视野范围与光照变化限制;IMU 方法因需积分陀螺仪/加速度计而存在漂移,且易受外部磁场干扰、难以区分朝向相近的不同手指姿态;拉伸传感方法难以适配不同手型,也无法区分手指的开合状态。
  • 本文 idea:改用超声传感。超声测距不依赖视线内可见、不受磁场干扰。作者把多枚微机电(MEMS)超声传感器布在手上,实时获得传感器之间的两两距离矩阵,用它作为深度网络输入来连续回归完整手部姿态,从而同时规避三类现有方案的短板。

方法

整体 pipeline 分两层:底层嵌入式系统用 7 枚 CH101 MEMS 超声传感器轮流收发,测得一个 \(7 \times 7\) 的两两距离矩阵;上层编码器-解码器网络把该矩阵映射为手部姿态(人手用 23 个关节自由度,配合 MANO 手模先验)。训练采用先在仿真数据上预训练、再在少量真实数据上微调的 sim-to-real 流程。

flowchart LR
  A["7 枚 CH101 超声传感器"] --> B["7x7 距离矩阵"]
  B --> C["Encoder: MLP + 多头自注意力 + skip"]
  C --> D["Decoder: Flatten + MLP"]
  D --> E["LSTM 时序聚合"]
  E --> F["MLP + MANO 手模先验"]
  F --> G["23 自由度手部姿态"]

关键设计:

  1. 传感器与数据采集:选用 TDK CH101(4×4×2 mm),相比传统压电超声体积小、功耗低、精度高,且波束角可达约 150 度,避免贴在手指上时漏测。7 枚传感器依次轮流作为发射端、其余作接收端,一个周期即可凑齐完整距离矩阵,经开发板串口回传主机。选 7 枚是精度与佩戴便利的折中点。

  2. 编码器(抗缺测 + 提取图结构):对每个传感器,把它到其他传感器的距离向量送入共享 MLP(\(7 \to 32 \to 32\))得到 \(7 \times 32\) 的嵌入 \(Z_1\);再用多头自注意力 \[\text{Attn}(Q,K,V)=\text{softmax}\left(\frac{QK^{T}}{\sqrt{D_k}}\right)V\] 得到 \(Z_2\),直觉上是在建模”传感器间距离如何共同构成手部姿态模式”,并对缺失测量提供鲁棒性;最后把 \(Z_1\) 与 \(Z_2\) 用 skip-connection 拼接成 \(7 \times 96\) 的特征 \(Z_3\)。

  3. 解码器(时序 + 手模先验):把 \(Z_3\) 展平后经 MLP 得到 256 维 \(Z_4\),再用 LSTM 聚合过去 5 帧信息,最后经 MLP(\(256 \to 128 \to 12\))输出 12 维 MANO 权重、由 MANO 参数化手模生成关节位置。整网用 L2 损失端到端训练,单张 3080Ti 上 1–2 小时即可。

  4. sim-to-real 训练:在仿真里按真实布局摆放传感器,用 InterHand2.6M 的姿态序列(约 46k 个姿态)驱动仿真手并计算传感器间距离,同时注入噪声、随机掩掉部分测量以模拟遮挡缺测;先在仿真数据上训练,再用约 5000 帧真实数据微调。真实数据的伪真值靠”右手戴传感器、左手镜像做同样动作 + 视觉估计”获得,并人工筛除约 15% 不同步/失败帧。

实验结果

在机械手(5 自由度、去掉 MANO 阶段直接回归 5 个舵机指令)上做定量消融,验证各模块的贡献。指标为归一化到 \([-0.5, 0.5]\) 舵机指令空间上的 L2 损失(越低越好):

配置 L2 loss ↓
去掉时序模块 (w/o seq.) 0.0196
去掉注意力模块 (w/o atten.) 0.0215
去掉 skip 连接 (w/o skip) 0.0207
完整模型 (full) 0.0163

三个模块(时序 LSTM、注意力、skip 连接)均对最终精度有正贡献,完整模型误差最低。其他结论以文字补充:原始传感器定位实验平均误差 0.65 mm、多数低于 1.2 mm;真实人手上相对伪真值的平均关节误差 1.09 cm,远优于最近邻基线的 3.64 cm;sim-to-real 微调把误差从 1.45 cm 降到 1.09 cm;仿真中 5/6/7/8 枚传感器分别得到 1.24/1.07/0.85/0.82 cm 误差,7 枚是精度与佩戴便利的最佳折中。

亮点与局限

  • 亮点:
    • 用 MEMS 超声距离矩阵这一新颖模态做手部追踪,同时规避视觉自遮挡、IMU 漂移/磁干扰、拉伸传感开合歧义三类痛点;毫米级原始测距精度。
    • 网络轻量、可实时;注意力 + 随机掩测设计使其对缺失测量鲁棒;MANO 先验带来合理手型约束。
    • sim-to-real 流程降低对大规模真实标注的依赖;系统尺寸无关,能适配不同手型;并给出了传感器选型、配置数目、电路与可扩展 MCU 方案的完整工程分析。
  • 局限:
    • 真实数据的伪真值依赖”镜像手 + 视觉估计”,本身不精确,难以拆分误差来源。
    • 手中握持物体会阻挡超声传播,导致精度下降。
    • 不预测手的全局位置与朝向(数据被归一化去除);现用开发板最多支持 8 个传感器,扩展到更多节点需频分复用等方案。

延伸思考

  • 论文提出把该框架从手部扩展到手腕、手臂乃至全身姿态捕捉,这需要更多传感器与频分复用来控制单周期测量时间的线性增长,是超声动捕规模化的核心工程挑战。
  • “握持遮挡”问题作者建议在手背/手指背面增贴传感器缓解——这与视觉方法的遮挡应对思路(多视角冗余)异曲同工,本质都是增加冗余观测。
  • 距离矩阵本质是传感器构成图上的成对测量,用注意力建模其”图结构”很自然;是否可进一步引入显式图神经网络或几何约束(如多维尺度分析 MDS 先验)来提升可解释性与外推能力,值得追问。