Conference

GPC: Large-Scale Generative Pretraining for Transferable Motor Control

Yi Shi, Yifeng Jiang, Chen Tessler, Xue Bin Peng

Simon Fraser University; NVIDIA

一句话总结

GPC 借鉴 GPT 的”离散化 + 下一 token 预测”范式,把物理仿真角色的运动技能编码成离散”运动词表”,再用自回归 Transformer 建模,得到一个可大规模预训练、并能高效微调迁移到下游任务的通用生成式运动控制器。

研究背景

  • 领域现状:物理仿真角色动画希望用一个控制器覆盖尽可能广的人类运动技能,并能方便地复用到不同任务。主流做法是先用 VAE / GAN 学一个技能的隐空间,再训练高层控制器在这个隐空间里挑技能来完成下游任务。
  • 核心痛点:连续隐空间容易 mode collapse,在流形的缝隙和外推区域产生漂移、生成不自然的动作。改用 VQ-VAE 的离散隐空间虽能缓解,但 VQ-VAE 训练本身有码本利用率低、码本坍塌等退化问题,需要大量启发式技巧(EMA 更新、死码重初始化、辅助损失)来维稳,因此以往这类离散追踪控制器大多只在约 20~40 小时的中小规模数据上训练。
  • 本文 idea:用 Finite Scalar Quantization(FSQ)替代 VQ-VAE 做离散化。FSQ 不需要显式码本,天然规避了码本坍塌等失败模式,训练大幅简化;在此之上训练 GPT 式自回归 Transformer 建模技能 token 分布,得到生成式控制器;最后用参数高效微调(PEFT)把预训练模型迁移到新任务,既复用技能又保留自然行为。

方法

GPC 的整体流水线分三个阶段:先学一套离散”运动词表”,再用自回归 Transformer 学这套词表的分布,最后用轻量适配层把冻结的预训练模型迁移到下游任务。

flowchart LR
  A["参考动作"] --> B["技能量化: FSQ 追踪控制器 (端到端 RL)"]
  B --> C["离散技能 token"]
  C --> D["生成控制器: GPT 式 Transformer 自回归建模"]
  D --> E["冻结预训练模型"]
  E --> F["任务适配: CoLA 轻量微调"]
  F --> G["下游任务动作"]

关键设计分四部分:

  • 技能量化(FSQ + 端到端 RL):沿用 DeepMimic 式的运动追踪框架,编码器把未来若干帧目标状态映射为连续隐向量,再对每一维独立做 FSQ 量化——把 \(\tanh\) 压到 \([-1,1]\) 后按 \(L\) 个固定标量档位四舍五入,隐式定义了一个大小为 \(L^d\) 的离散码本,无需学习显式码本。解码器根据角色当前状态和离散码输出各关节目标旋转,交给 PD 控制器转成关节力矩驱动仿真。整个编码器-解码器用 PPO 端到端训练,量化操作的梯度用直通估计器(STE)回传。关键点在于”端到端 RL”:让离散码直接朝着”能被物理控制器忠实执行”的方向优化,而不是先在纯运动学数据上监督训练再冻结。

  • 生成控制器(GPT 式自回归):一个时间步会产生 \(d\) 个 \(L\) 元 token,直接建模序列太长。作者用固定分组把每 \(G\) 个连续 token 打包成一个更大词表的 token,在词表大小与序列长度间取得平衡。分组后的 token 序列的联合分布用带因果自注意力的 Transformer decoder 自回归建模,训练时用 teacher forcing + 交叉熵拟合 FSQ 产出的 token。推理时逐 token 用 nucleus(top-p)采样,既压低采到低概率离群 token 的风险,又保留行为多样性;最终 token 序列交给冻结的 FSQ 解码器生成动作。

  • 任务适配(CoLA):提出 Conditional Low-rank Adaptation,在 DoRA(把权重更新解耦为幅度和方向分量)基础上,用 FiLM 对低秩分量做任务条件调制——由轻量 MLP 从任务观测 \(c\) 产生缩放 \(\gamma(c)\) 和偏置 \(\beta(c)\),作用在低秩空间上。整套只新增不到 1% 的参数,既能条件化到不同任务,又保持训练稳定。

  • 微调方式(RLFT + SFT):下游任务通过 PPO 强化学习微调(RLFT)优化任务奖励;探索时用无条件生成模型引导的 nucleus 采样做正则,保住自然行为。当有示例动作时,可先做监督微调(SFT),用交叉熵在离散码上提高任务相关技能 token 的概率,把控制器偏向合适的技能子集,再接 RLFT 精修,缓解探索低效问题。

实验结果

实验在 Isaac Gym 仿真、基于 ProtoMotions 框架进行,FSQ 用 40 个离散 token、每 token 9 个量化档位(隐式码本 \(9^{40}\))。主实验对比不同量化方式在大规模 Bones(约 680 小时)和 AMASS(约 40 小时)上的追踪表现:

方法 Bones 成功率(%)↑ Bones MPJPE↓ AMASS 成功率(%)↑ AMASS MPJPE↓
MLP(无量化) 99.98 25.56 99.59 30.26
VQ-VAE 99.94 37.92 99.30 59.28
FSQ(本文) 99.98 34.90 99.51 44.43

无量化瓶颈的 MLP 追踪精度最好,符合直觉;但在有量化的两种方法里,FSQ 在成功率和 MPJPE 上均优于 VQ-VAE,且不需要码本启发式或辅助损失。其它实验以文字补充:与”先在运动学数据上监督预训练再冻结编码器”的变体(FSQ-K)相比,端到端 RL 训练的 FSQ 成功率 99.98% vs 99.03%、MPJPE 34.90 vs 78.26、码本利用率 82.15% vs 76.34%,验证端到端优化的重要性;token 分组消融显示 \(G=5\) 在多样性(APD)与质量间表现最佳;下游任务上,GPC 相比 CVAE 基线在相同任务条件下保留了行为多样性(CVAE 因直接选码而趋于确定性、动作单一);SFT 会降低策略熵、把行为偏向指定风格(如蹲走),且不损害任务回报与抗扰动鲁棒性。

亮点与局限

  • 亮点:
    • 用 FSQ 取代 VQ-VAE,去掉显式码本与一整套维稳启发式,把离散运动表示的训练显著简化,并成功扩展到 600+ 小时的大规模数据。
    • “离散化 + 下一 token 预测”的 GPT 式范式迁移到运动控制,追踪成功率高达 99.98%,并涌现出对扰动的类人响应、跌倒后翻滚爬起等自然恢复行为,无需专门奖励。
    • CoLA 以不到 1% 的额外参数做参数高效微调,迁移到下游任务的同时保留预训练的自然行为与多样性。
  • 局限:
    • 主要聚焦于运动(locomotion)类任务,尚未覆盖更广的技能类型。
    • 缺少高层多模态条件(如文本引导)和人-物交互任务的支持,作者将其列为未来方向。
    • 分组因子偏大时(\(G \ge 8\))显存开销和词表规模会变得不可承受,存在序列长度与词表大小的工程权衡。

延伸思考

这篇工作把大语言模型的核心配方(离散 tokenizer + 自回归 Transformer + 预训练后 PEFT 微调)几乎完整地搬到了物理运动控制领域,”运动词表”和”下一动作 token 预测”的类比相当直接。相比 ASE、CALM、MaskedMimic 等前作,它的差异点在于用 FSQ 换掉了 VQ-VAE 这个长期的训练痛点,从而把数据规模推到数百小时。值得追问的是:FSQ 的隐式码本虽避免了坍塌,但离散档位是否会限制极精细动作的表达(MPJPE 仍逊于无量化 MLP);以及 token 分组这种固定打包方式是否可以换成学习式的、语义更明确的层级 tokenization。若结合文本条件与人-物交互,GPC 有望成为物理角色版的”通用动作基座模型”。