MOCHI: Motion Enhancement of Collaborative Human-object Interactions
Seoul National University
一句话总结
MOCHI 是一个两阶段框架,把带噪声的”多人协同操作同一物体”(MHOI)动捕数据自动增强成干净、物理合理的动作,先补出合理的抓握手指动作,再用单人动作先验对所有参与者的全身动作做去噪精修,同时保留原始交互语义。
研究背景
- 领域现状:单人的人-物交互(HOI)在动作合成与理解上已有大量进展,但”多人协同操作同一物体”(MHOI,例如两人抬桌子、传椅子)这类场景研究得很少。要建模 MHOI,第一步是采集高质量数据。
- 核心痛点:MHOI 数据采集极难。人与人、人与物之间频繁遮挡导致追踪失败;大幅度身体动作和精细手指动作需要同时捕捉,尺度差异大;多视角光学动捕受限于受控环境且硬件昂贵,单目视频方法又有深度歧义。结果是现有 MHOI 数据普遍存在接触错位、抖动、时间不连续、手指动作缺失等瑕疵,且难以规模化。
- 本文 idea:与其硬采干净数据,不如做”增强”——给定一段有瑕疵的 MHOI 动作,产出视觉与物理都合理、含身体与手部的完整序列,同时保留原数据里的交互语义。关键洞察是把难题拆解,从而复用相对充裕的单人 HOI 先验和手-物交互先验,绕开 MHOI 专用数据稀缺的困境。
方法
整体框架分两阶段:第一阶段从带噪身体动作出发,用优化生成物理合理的抓握手势,并扩展成完整的手-物交互序列;第二阶段以第一阶段的抓握与接触信息为条件,用基于扩散噪声优化的单人动作先验精修所有人的全身动作。
flowchart LR
A["带噪 MHOI 输入<br/>身体+物体轨迹"] --> B["预处理<br/>去物体轨迹抖动"]
B --> C["Stage 1 手-物交互生成"]
C --> C1["识别接触阶段"]
C1 --> C2["圆柱约束下优化抓握手势"]
C2 --> C3["扩散先验补全接触过渡手指动作"]
C3 --> D["Stage 2 全身精修<br/>扩散噪声优化 + 单人先验"]
D --> E["增强后 MHOI<br/>身体+手部+物体"]
关键设计:
-
接触阶段划分与抓握姿态优化(Stage 1):先按手腕到物体的距离阈值(8cm)配合滑动窗口卷积,把序列分成接触前、接触中、接触后三段;并用”物体运动时至少一人接触”的规则修正接触标签,区分共同搬运与交接两类场景。抓握姿态通过对整段接触帧做批量优化求解,目标函数含四项:力闭合损失 \(L_{fc}=\lVert G \cdot N_c \rVert\) 促成稳定抓握、物体交互损失(距离项 + 穿透项)、手部合理性损失(自穿透 + 姿态先验),以及本文新提出的正则项。
-
圆柱包围约束(核心创新):带噪身体动作的手腕位置不可靠但含重要语义线索,所以不直接用其精确坐标,而是从接触帧的手腕/手肘位置构造一个圆柱包围体 \(C=(r, p_{upper}, p_{lower})\),把优化出的手势约束在圆柱内。正则损失 \(L_{reg}=\sum_{v \in S(G_{hand})} [v \notin C]\, d(v, C)\) 让手几何保持在圆柱内。这样既保留身体动作暗示的抓握位置语义,又允许在有界空间内探索出物理合理的抓握。消融显示:去掉圆柱、改用随机初始化,会得到物理上合理但语义错误的抓握(比如本该抓桌面中央却抓到桌腿)。
-
单人先验做多人精修(Stage 2):直接学 MHOI 专用扩散先验受限于数据,本文改用只在单人数据(HumanML3D)上训练的动作扩散先验,通过扩散噪声优化(DDIM 反向 + 梯度归一化 + 小扰动探索)逐人精修:\(x^*_\tau = \arg\min_{x_\tau} L(\text{ReverseProcess}(D, x_\tau))\) 。逐帧目标由五项组成 \(l_t = \lambda_{pose}L_{pose} + \lambda_{contact}L_{contact} + \lambda_{IG}L_{IG} + \lambda_{col}L_{col} + \lambda_{em}L_{em}\) 。
-
把多人语义编码进单人先验:这是让单人先验服务多人场景的关键。接触目标 \(L_{contact}\) 强制接触阶段手腕对齐 Stage 1 求得的抓握目标(用精修后的物体位姿变换到全局);交互图目标 \(L_{IG}\) 构建人-人之间的自边与跨边(连肩、髋、膝、头颈),只约束边的方向对齐与速度对齐、有意剔除对噪声敏感的位置项,从而保留朝向与协同动态;此外还有防止人-人/人-物碰撞的碰撞目标 \(L_{col}\)(关节处放球形包围体,用 SDF 检测)和抑制过大动作的能量最小化目标 \(L_{em}=\sum_{j \in J} w_j \lVert a_j \rVert^2\) 。
实验结果
主实验是在 CORE4D 数据集的三个变体及生成模型输出(OMOMO)上做增强,评估接触合理性(精度/召回/F1)与动作自然度(脚滑 FS、抖动 Jitter、人际穿插 InterPene)。核心结论是各类噪声来源下都能同时改善接触与自然度。
| 数据 / 方法 | F1↑ | FS↓ | Jitter↓ | InterPene↓ |
|---|---|---|---|---|
| CORE4D-Original | - | 0.56 | 71.25 | 0.00 |
| CORE4D-Original + 本文 | - | 0.17 | 19.89 | 0.40 |
| CORE4D-Noisy | 0.79 | 0.93 | 73.05 | 0.71 |
| CORE4D-Noisy + 本文 | 0.91 | 0.21 | 19.79 | 0.75 |
| CORE4D-HMR | 0.44 | 1.27 | 83.04 | 0.32 |
| CORE4D-HMR + 本文 | 0.66 | 0.38 | 22.87 | 0.66 |
| OMOMO-2P | 0.71 | 0.51 | 113.01 | 2.49 |
| OMOMO-2P + 本文 | 0.78 | 0.16 | 15.40 | 0.69 |
其余实验用文字概述:在手-物生成上,仅用身体输入合成的手部动作在接触覆盖率(17.13 对 6.72)和穿透上都优于 CORE4D 自带的手套动捕数据;作为数据增强管线,把椅子换成 ShapeNet 的 9 种不同椅子后穿透值与原物体相近;还能从稀疏关键帧(40 帧间隔)配合 text-to-3D 生成物体来创作 MHOI,并扩展到 3-4 人、静态坐姿+动态搬运混合、以及单人 HOI(关掉人-人相关项后接触覆盖率与穿透优于 HOIDiNi)。消融证实圆柱约束、Stage 1 接触信息(\(L_{contact}\) 使 F1 从 0.81 升到 0.94)、以及 \(L_{pose}/L_{IG}/L_{col}\) 各项都有明确贡献。
亮点与局限
- 亮点:
- 首个直接针对 MHOI 增强(人-人与人-物交互并存)的方法,把复杂问题拆成”有界空间抓握优化 + 单人先验全身精修”两个可复用先验的子问题,巧妙绕开 MHOI 数据稀缺。
- 圆柱包围约束在”保留带噪身体语义”与”生成物理合理抓握”之间取得平衡,是很实用的工程洞察。
- 用交互图目标把多人协同语义编码进单人先验,且刻意剔除对噪声敏感的位置项,设计动机清晰。
- 通用性强:既能修现有数据、修生成模型输出,也能做数据增强与关键帧创作,还能退化到单人 HOI。
- 局限:
- 输入噪声过大、交互语义无法可靠识别(物体轨迹或身体姿态完全错误)时会失败。
- 对超出单人先验分布的极端速度变化处理不佳。
- 无法处理接触点持续变化的高复杂场景(如抛接物体、换手换抓握点)。
- 抓握优化每个接触阶段每只手需 3-4 分钟、全身精修每 6 秒窗口约 2 分钟,属于离线增强而非实时。
延伸思考
这项工作本质是”用充裕的单人/手-物先验去补全稀缺的多人交互数据”,思路上与用单视角先验修复动捕、用扩散噪声优化做可控生成(如 HOIDiNi、DNO)一脉相承,区别在于问题设定是”以带噪动作为输入做增强”而非”从文本从零合成”。交互图目标剔除位置项、只保留方向与速度对齐的做法,对其他”含噪多人动作”任务(社交、对抗、群体动画)可能同样适用。值得追问的是:接触点连续变化的动态抓握(抛接、换手)需要怎样的先验或表示才能覆盖,以及这套离线优化能否蒸馏成前馈网络以逼近实时。作为数据增强/创作管线,它可能成为规模化 MHOI 数据集的一条务实路径,为后续物理控制、人形机器人协同操作提供训练数据。