Journal

Shape-aware Inertial Poser: Motion Tracking for Humans with Diverse Shapes Using Sparse Inertial Sensors

Lu Yin, Ziying Shi, Yinghao Wu, Xinyu Yi, Feng Xu, Shihui Guo

Xiamen University; Tsinghua University

一句话总结

本文提出 Shape-aware Inertial Poser(SAIP),首个考虑身体形状差异的稀疏惯性动捕方法:通过把不同真实体型的 IMU 信号解耦重定向到模板成人体型、再把估计出的运动重定向回真实体型,并配合形状感知的物理优化与首个仅靠稀疏 IMU 的形状估计模块,从而能对儿童等与训练模板差异极大的体型也做出准确的实时动作追踪。

研究背景

  • 领域现状:用 6 个稀疏 IMU(手、腿、头、腰)做人体动捕近年备受关注,因其舒适便携、无遮挡且不依赖相机拍摄。主流方法(TransPose、PIP、TIP、ASIP、PNP 等)在成人角色上表现良好。
  • 核心痛点:由于真实数据稀缺,现有 SOTA 系统几乎都在”模板成人体型”合成的 IMU 数据上训练,只建模了人体姿态与 IMU 信号之间的关系。但 IMU 信号不仅受运动影响,也受体型影响:同一姿态下,绕父关节旋转产生的加速度主要受骨长(旋转半径)影响,绕骨自身旋转则受肢体胖瘦等形状属性影响,而跳跃/坠落等运动的加速度又近乎与形状无关(如重力加速度)。因此当作用对象是儿童这类体型与训练样本差异很大的个体时,精度显著下降。
  • 本文 idea:与其用多体型合成数据重训(需学习”体型-姿态-IMU”三元关系,训练复杂),不如把三元关系解耦:先把真实体型的 IMU 信号重定向到模板体型(消除形状影响),再用现成的针对模板体型的姿态估计框架建模”IMU-运动”关系,最后把结果重定向回真实体型。

方法

输入为 6 个 IMU 的加速度 \(A\in\mathbb{R}^3\)、角速度 \(\omega\in\mathbb{R}^3\)、朝向 \(R\in SO(3)\);输出为以 6D 表示的关节旋转姿态 \(\theta\in\mathbb{R}^{6n}\)(\(n=24\) 为 SMPL 关节数)与根关节全局平移 \(r_{root}\in\mathbb{R}^3\)。框架由两个协同组件构成。

  1. 形状感知运动追踪(Shape-Aware Motion Tracking)
    • 基于学习的运动信号重定向(Kinematic Signal Retargeting)。第一个网络 \(R_{acc}\) 以真实体型的加速度 \(A_R\) 与形状参数 \(\beta\) 为输入,回归出模板体型对应的加速度 \(A_T\)(消除形状影响)。用标准化后的 IMU 数据喂给沿用 PNP 的姿态估计器,得到不受体型影响的局部姿态(关节旋转)与关节速度 \(V_T\)。第二个网络 \(R_{vel}\) 再把关节速度映射回目标真实体型。\(R_{acc}\) 与 \(R_{vel}\) 均用 RNN(LSTM)建模 IMU 信号的时序特性。
    • 训练数据合成。真实世界不存在”形状条件化位置数据”的真值,因此作者用 AMASS 的运动与 SMPL 形状,把原始形状按 0.5~1.2 缩放(身高覆盖 0.8~2.0 m,含儿童体型),并基于脚地接触调整根关节全局速度:当某足顶点位移 \(\lVert v_i-v_{i-1}\rVert<0.5\) cm 视为静止接触地面,则根关节平移更新为 \(NOTESMATHSPAN15ENDNOTESMATHNOTESMATHSPAN16ENDNOTESMATHNOTESMATHSPAN17ENDNOTESMATHNOTESMATHSPAN18ENDNOTESMATHA_RNOTESMATHSPAN19ENDNOTESMATHA_TNOTESMATHSPAN20ENDNOTESMATHA_TNOTESMATHSPAN21ENDNOTESMATHV\in\mathbb{R}^{24\times3}NOTESMATHSPAN22ENDNOTESMATH\betaNOTESMATHSPAN23ENDNOTESMATHPNOTESMATHSPAN24ENDNOTESMATHNOTESMATHSPAN25ENDNOTESMATHNOTESMATHSPAN26ENDNOTESMATHNOTESMATHSPAN27ENDNOTESMATHNOTESMATHSPAN28ENDNOTESMATHNOTESMATHSPAN29ENDNOTESMATHNOTESMATHSPAN30ENDNOTESMATHNOTESMATHSPAN31ENDNOTESMATHNOTESMATHSPAN32ENDNOTESMATHR_jNOTESMATHSPAN33ENDNOTESMATHjNOTESMATHSPAN34ENDNOTESMATHA_RNOTESMATHSPAN35ENDNOTESMATH\betaNOTESMATHSPAN36ENDNOTESMATHR_{acc}NOTESMATHSPAN37ENDNOTESMATHR_{acc}NOTESMATHSPAN38ENDNOTESMATHR_{vel}\)$ 主要影响全局平移、对姿态指标影响较小。全局平移漂移曲线显示各模块对多体型受试者的有效性,且在近模板体型的 TotalCapture 上也比 PNP 更准。
  • 替代设计对比。朴素按身高缩放位置数据(Naive Scaling,SIP 20.25)与用增广 AMASS 端到端重训基线(End-to-End Training,SIP 17.82)都明显不如带重定向网络的方案;带网络后,仅用 23 段骨长(Skeleton-only)或仅用身高缩放(Size-only)因缺乏胖瘦等形状细节也逊于完整方法。用本文形状预测模块(Shape Inference)结果非常接近用真值形状(Using GT Shape)。形状估计随数据累积收敛到接近真值,并能作为副产物重建多样体型。

亮点与局限

  • 亮点:
    • 首个显式建模身体形状对稀疏 IMU 信号影响的动捕方案,通过”重定向到模板体型—估计—重定向回真实体型”解耦三元关系,可实时处理含幼童在内的多样体型。
    • 提出双向回归位置信号(加速度/速度)的学习式重定向网络,弥合体型差异导致的运动学信号差异。
    • 首个仅用稀疏 IMU 与身高输入估计人体形状的方案,并把形状相关物理属性(质量/质心/惯性)注入物理优化。
    • 发布首个含学龄前儿童的多体型惯性动捕数据集 MID(20 人、身高 110-190+ cm、150 万帧)。
  • 局限:
    • 继承基线方法的局限,难以处理脚以外的地面接触(爬行、地面翻滚),物理优化假设平地,攀爬/引体向上等地形物体交互会被重力拉回地面。
    • 九轴 IMU 依赖磁力计校准偏航,在磁干扰环境(带电设备、金属附近)会偏航失准导致姿态错误。
    • 方法依赖形状变化对 IMU 的影响,对与模板体型相近的受试者,IMU 变化过小、形状预测不佳;且需身高初始化,缺失时对体型差异极大者(如很矮的儿童)姿态难以收敛。
    • 未考虑身体残障人群;形状预测的 T-pose 网格误差约 1.6-2.1 cm,仍逊于基于图像/视频的光学方法(约 1.3 cm)。

延伸思考

  • 把”信号 = 形状 × 姿态”的耦合显式解耦为可学习的重定向映射,是应对训练分布外体型的通用思路,可能推广到其他依赖模板身体模型(如电子皮肤、可穿戴传感、UWB 融合)的动捕/交互系统。
  • “扩充训练数据不足以解决问题,需独立建模形状条件化信号”这一发现对当前普遍靠数据增广的做法是有益提醒:当物理量随隐变量非线性变化且无法用简单缩放近似时,结构化解耦往往比堆数据更有效。
  • 首次实现仅稀疏 IMU 的形状估计,暗示惯性信号中蕴含的形状线索被长期忽视;配合物理优化的质量/惯性建模,或可进一步用于康复、儿童运动分析等对个体化体型敏感的下游应用。