What is the Best Automated Metric for Text to Motion Generation?
University of Texas at Austin
一句话总结
本文系统性地检验了文本到人体动作生成任务中各类自动评估指标与人类主观判断的相关性,指出现有指标在单样本层面几乎都不可靠,并提出一个基于多模态 BERT 式编码器的新指标 MoBERT,在样本级和模型级都显著超越已有方案。
研究背景
- 领域现状:从自然语言生成骨骼人体动作(text-to-motion)近年发展迅速,研究者不断堆叠更强的神经网络架构,评估上普遍沿用 FID、R-Precision、Multimodal Distance 等指标,以及更早期的坐标误差类指标。
- 核心痛点:人类主观评价才是这类任务的黄金标准,但耗时且昂贵;而现有自动指标从未被认真验证过是否真的与人类判断相关。由于一句描述可以对应多种合理动作(一对多问题),指标选得对不对直接影响模型评估与设计方向。
- 本文 idea:先构建一个带人类评分的动作-文本数据集,用它系统地衡量各指标与人类判断的相关性;再针对现有指标在单样本层面的失效,设计一个可微、无需参考动作的学习型指标 MoBERT。
方法
本文分两条主线:一是数据集与相关性分析框架,二是新指标 MoBERT。作者从 HumanML3D 测试集采样 400 条多样化提示,用四个代表性模型(Guo et al.、TM2T、MotionDiffuse、MDM)加上 HumanML3D 参考动作共生成 2000 条动作,用 Blender 渲染成带纹理、光照和运镜的拟真视频,再通过 Amazon Mechanical Turk 收集”自然度(Naturalness)”和”忠实度(Faithfulness)”两个维度的 Likert 评分(0-4),经质控后得到 1400 条带人类评分的样本。随后用 Pearson 相关系数分别在样本级和模型级上衡量每个自动指标与人类评分的一致性。
flowchart LR
A["动作 22 关节 + 文本提示"] --> B["动作分块编码 (14 帧/块)"]
A --> C["文本 BPE 分词嵌入"]
B --> D["拼成多模态序列 + CLS"]
C --> D
D --> E["共享 Transformer 编码器"]
E --> F["MLP + Sigmoid 对齐概率"]
E --> G["聚合特征 + SVR/回归拟合人类评分"]
关键设计:
- 统一编码器而非双塔:不同于 CLIPScore 用两个独立编码器再算余弦相似度,MoBERT 把动作块和文本 token 拼成一条多模态序列,送入同一个 Transformer 编码器。注意力机制能在两种模态坍缩成单一向量之前,同时捕捉动作与文本的时序对应关系,从而更准确地判别正确/错误配对。
- 动作分块编码:先按 Guo et al. 的方式把 \(N \times 22 \times 3\) 的动作预处理成 \(N \times 263\) 表示(含根关节全局位移旋转、逐帧关节线速度、足地接触二值信号),再把连续帧按 14 帧(约 0.7 秒)分块、带 4 帧重叠,以压缩冗余并保留帧间信息。
- 对齐预测训练与平衡损失:以”给定动作与文本是否匹配”的二分类(对齐预测)为训练任务,为每个正样本随机采一个负例描述。作者发现朴素二元交叉熵 \(H(q)\) 会退化到只预测单一标签,于是改用平衡损失 \(\mathcal{L}_2 = \sqrt{H(V)^2 + H(R)^2}\);又因 HumanML3D 描述多样性低,用 Sentence Transformer 相似度对负例加权(相似描述降权),得到最终损失 \(\mathcal{L}_f = \sqrt{H(V)^2 + \left( \frac{(1-\alpha)H(R)}{\sum_i (1-\alpha_i)} \right)^2}\)。
- 轻量回归微调:原始对齐概率已无监督地给出评分;进一步丢弃输出层、在约 1260 条人类评分上用 SVR 或线性回归拟合(十折交叉验证防过拟合),可显著提升与人类判断的相关性,且线性/Ridge 版本保持完全可微,可作为训练目标。
实验结果
主实验是各指标与人类评分在模型级与样本级上的 Pearson 相关性对比(↓ 表示应为负相关,↑ 应为正相关):
| 指标 | 模型级-忠实度 | 模型级-自然度 | 样本级-忠实度 | 样本级-自然度 |
|---|---|---|---|---|
| Root AVE ↓ | -0.926 | -0.908 | -0.013 | 0.007 |
| R-Precision ↑ | 0.816 | 0.756 | 0.036 | 0.042 |
| FID ↓ | -0.714 | -0.269 | - | - |
| Multimodal Distance ↓ | -0.212 | -0.299 | 0.025 | 0.014 |
| MoBERT 对齐概率 ↑ | 0.991 | 0.841 | 0.488 | 0.324 |
| MoBERT + SVR 回归 ↑ | 0.962 | 0.986 | 0.624 | 0.528 |
结论要点:现有指标在样本级几乎全部接近零相关(最好的旧指标 Faithfulness 仅约 0.208),说明它们无法评价单条生成质量;但在模型级,被许多论文抛弃的坐标误差类指标(尤其带根关节/分量缩放的 Root AVE)反而能达到近乎完美的相关,R-Precision 次之,FID 对自然度表现很差,Multimodal Distance 全程偏弱不推荐。MoBERT 的对齐概率在无人类监督下就把样本级忠实度相关性提到 0.488;加上小规模人类评分微调后进一步升至 0.624(忠实度)与 0.528(自然度),模型级接近完美,全面超越所有基线,且无需参考动作。
亮点与局限
- 亮点:
- 第一个正面回答”哪个自动指标最贴近人类判断”的系统性研究,附带一个带人类评分的动作-文本数据集。
- 澄清了社区的一个误区——被新指标替换掉的传统坐标误差指标其实在模型级表现极强,而部分新指标反而不可靠。
- MoBERT 是首个在样本级与模型级都强相关、且无需参考动作、完全可微的评估指标,可直接嵌入训练做优化目标。
- 局限:
- 数据集仅 1400 条标注、只覆盖 HumanML3D 测试集一小部分,且模型级相关性只基于 5 个模型,P 值偏弱、易受偶然性影响。
- MoBERT 仅在 HumanML3D 上预训练,对分布外(OOD)动作与词表覆盖不足的鲁棒性仍属推测,缺乏真正 OOD 且带人类评分的数据验证。
- 样本级相关性虽为最佳,但绝对值仍不高,说明单样本自动评估远未替代人类评价。
延伸思考
- 该工作把机器翻译领域”指标必须与人类判断对齐”的方法论迁移到动作生成,提示其他生成任务(文本到视频、文本到 3D)同样值得先审视评估指标本身,而非只卷模型。
- MoBERT 可微且无需参考,理论上可作为生成模型的训练损失或强化学习奖励,用来直接优化人类偏好,这条思路值得追问其在实际训练中是否会被”钻空子”(reward hacking)。
- 随着动作生成模型持续进步,当前样本的误差分布可能不再代表未来模型,指标的”最优性”需要伴随不断收集的人类评分动态重估,这对建立可持续的评估基准提出了要求。