Conference

Large-Scale Multi-Character Interaction Synthesis

Ziyi Chang, He Wang, George Alex Koulieris, Hubert P. H. Shum

Durham University; University College London

一句话总结

在没有多角色交互数据集的前提下,本文把”大规模多角色协调交互”拆解为交互合成与过渡规划两个子问题,用预训练的两角色扩散模型搭出可协调的交互空间,再用强化学习训练一个规划网络来决定角色如何重新分组,从而合成可扩展、可迁移的多角色协调交互。

研究背景

  • 领域现状:角色动画、交互生成与人群模拟近年都有进展。单角色动画擅长在控制信号下合成高保真运动;基于深度学习的交互生成主要针对两个角色;人群模拟能容纳大量角色。
  • 核心痛点:单角色方法学不到多角色之间关键的交互模式;两角色交互方法难以直接扩展到更多角色,且不考虑角色之间的过渡;基于优化的多角色交互依赖人工设计目标函数、泛化性差;人群模拟虽然角色多,但角色间交互稀疏且被动。本文关注的大规模多角色交互需要主动、密集的近距离交互,还要能规划过渡并可随角色数量扩展。作者把这类”边交互边协调换新伙伴”的行为称为协调交互(coordinated interaction)。
  • 本文 idea:面对两大挑战——缺少含密集近距离交互的多角色数据、以及在时空上同时规划多角色过渡——作者提出一个条件生成流水线:用”分而治之”把多角色拆成若干两角色组,借助预训练两角色扩散模型撑起多角色交互空间;再用一个与运动类型无关的过渡规划网络,通过强化学习学习如何重新分组,全程无需多角色数据。

方法

整体框架是一个自回归的条件生成模型 \(M^t_{1:N} = F_\theta(M^{t-1}_{1:N}, \epsilon^t_{1:N}, C^t)\) ,即在观测到上一段所有角色的运动片段 \(M^{t-1}_{1:N}\) 后,结合采样噪声 \(\epsilon^t_{1:N}\) 与过渡计划 \(C^t\) 生成下一段运动片段。自回归的设计让角色能根据当前观测动态规划未来过渡,而不是一次性把全部编排定死。整个流水线由两个部件组成:可协调的多角色交互空间(负责合成运动)与过渡规划网络(负责协调决策)。

flowchart LR
  A[上一段多角色运动 M^t-1] --> B[过渡规划网络<br/>预测重分组选择 C^t]
  B --> C[按 C^t 把角色分成两角色组]
  C --> D[预训练两角色扩散模型<br/>逐组自回归生成]
  D --> E[分类器引导:<br/>约束组间髋部距离+平滑度]
  E --> F[下一段多角色运动 M^t]
  F --> A

关键设计分为三点:

  1. 分而治之的可协调交互空间。多角色交互通常本就由若干小规模子群构成,因此作者把 \(N\) 个角色划分成两角色组,每组交给一个预训练的两角色交互扩散模型(采用 InterGen)来生成。这样做有三重好处:借用了两角色模型已经学到的自然交互流形、绕开了对多角色数据的需求、并且对角色数量不敏感(易扩展)。生成时逐组自回归进行,新生成的组以已经生成的其他组为条件。

  2. 用分类器引导维持社交距离与平滑。新组的合成通过扩散模型的分类器引导,注入两类约束。其一是组间髋部距离,依据近体学理论(Proxemics Theory,人以髋部位置调节个人空间),只约束髋关节而非全身以避免高维时空约束过难,距离项写作 \(d(M^t_{i,j}, M') = \frac{1}{\vert M'\vert }\sum_{n'} \min(\lVert p_{i,j}-p_{n'}\rVert_2^2 - \tau, 0)\) ,其中 \(\tau\) 为阈值。其二是与上一段之间的平滑约束,用关节加速度度量 \(d(M^t_{i,j}, M^{t-1}_{i,j}) = \sum \lVert acc_{i,j}\rVert_2^2\) 。生成过程中还用运动 inpainting 掩码保持与观测片段的衔接。

  3. 运动无关的过渡规划网络。过渡计划被设计成”高层重分组选择”——即决定接下来哪些角色应两两成组去交互,而不去操心具体关节怎么动,因此规划网络与运动类型无关、可迁移。由于没有真值数据,作者把规划建模成马尔可夫决策过程并用深度强化学习训练:交互空间充当环境模型 \(E := g(\cdot)\) ,规划网络充当策略网络 \(\pi := f_\theta(\cdot)\) ,状态是若干关注角色的运动片段,动作即重分组选择。为在”过渡代表性”与”学习复杂度”间取舍,规划在局部四个角色范围内进行。奖励由两项构成:平滑奖励 \(r_{smooth} = e^{-\lVert acc_t - acc_{t+1}\rVert_2^2}\) 鼓励过渡衔接自然,多样性奖励 \(r_{div}\) 在动作新颖时给 1、否则 0,总奖励 \(r = r_{smooth} + r_{div}\) 。当某组只有一个真实角色时,用一个虚拟角色补足成两角色组。

实验结果

方法在 InterHuman 数据集的两角色舞蹈子集上训练,用过渡平滑度(TS,取加速度变化的峰值 jerk,越低越好)与髋部距离(HD,角色间髋部平均距离,用于反映角色是否重叠)两项指标评估。由于此前没有针对该任务的方法,作者以最先进的交互合成方法 InterGen 为基线,并实现了一个把可协调交互空间套在 InterGen 上、但用随机采样代替过渡规划的变体 InterGen†。

方法 TS ↓ HD 说明
InterGen 0.073 0.567 无协调空间与过渡规划,角色严重重叠
InterGen† 0.117 1.578 有协调空间、无过渡规划
本文 0.071 1.963 兼具协调空间与过渡规划,平滑度最佳

本文取得最佳的过渡平滑度,说明其合成的角色在过渡时伪影更少。值得注意的是 InterGen 的 TS 与本文接近,但作者分析这是因为 InterGen 的角色挤在很小的距离内、彼此严重重叠,过渡发生在极小范围内才让 TS 数值偏小——这一点被其明显更低的 HD 佐证(角色几乎叠在一起)。髋部距离的分布密度显示:本文呈双峰,说明角色不重叠且被规划网络清晰地引导完成了过渡;两个不具备过渡规划的方法则只有单峰。对比 InterGen 与 InterGen† 还能看出,可协调交互空间本身就有助于减少重叠,二者叠加时效果更好。

在扩展应用上,作者验证了可扩展性与可迁移性:逐步添加新角色(TS 0.026,HD 2.450)、一次性生成大场景(TS 0.075,HD 3.372)、以及把在舞蹈上训练的规划网络零适配迁移到拳击动作(TS 0.057,HD 2.155)。迁移到拳击时平滑度没有退化、髋部距离略增(因为拳击动作本身间距比舞蹈更大),印证了”把过渡计划设计成高层重分组”确实让规划网络与具体动作解耦、从而可迁移。

亮点与局限

  • 亮点:
    • 提出”交互合成 + 过渡规划”的分解思路,用两角色组的分而治之把大规模多角色交互问题变得可解且对角色数量不敏感,天然可扩展。
    • 全程无需多角色交互数据集,通过预训练两角色扩散模型 + 强化学习绕开数据瓶颈。
    • 过渡规划被抽象为高层重分组决策,使规划网络与运动类型无关,可在舞蹈、拳击等不同动作间零适配迁移。
  • 局限:
    • 依赖”多角色可近似为两角色组”这一分组近似假设。
    • 依赖预训练两角色扩散模型的合成质量,其质量上限直接影响最终结果;在无条件数据集时扩散模型的可控性有限,尽管用了分类器引导与运动 inpainting,控制精度仍有提升空间。
    • 大场景中若角色总数不能被四整除,需引入一个假想角色;当前四角色分组用的是基于距离的贪心策略。

延伸思考

  • 该方法本质上是”用已有的小规模生成模型 + 高层规划”去合成难以采集的大规模数据,这一”分组分解 + 规划做胶水”的范式对其他缺数据的多主体生成任务(如多人协作、群体动画、多智能体场景)可能同样适用。
  • 过渡计划与具体运动解耦带来的可迁移性很吸引人,但也意味着规划网络看不到低层运动细节,遇到强耦合、需要精细肢体配合的交互(如托举、对抗)时,仅靠髋部距离与平滑度奖励可能不够,值得追问它在密集接触场景下的表现。
  • 未来若能采集真实的多人近距离交互数据,既能替换掉分组近似,也能让规划网络学习更贴近真值的协调策略;作者也提到可用预定义动作(行走、回收角色)或更高级的分组策略(如第一人称感受野)来改进大场景过渡。