Conference

GAIA: Generative Animatable Interactive Avatars with Expression-conditioned Gaussians

Zhengming Yu, Tianye Li, Jingxiang Sun, Omer Shapira, Seonwook Park, Michael Stengel, Matthew A. Chan, Xin Li, Wenping Wang, Koki Nagano, Shalini De Mello

NVIDIA; Texas A&M University; Tsinghua University

一句话总结

GAIA 是一个只从在野 2D 人脸图像集合学习的可动画 3D 生成模型,用嵌入 FLAME 头部形变模型、共享 UV 参数化的表情条件高斯来生成头像,既能高保真新视角合成,又能对身份与表情进行解耦的交互式动画控制。

研究背景

  • 领域现状:基于在野 2D 图像训练的 3D 感知生成模型(如 3D GAN)在视觉保真度和多视角一致性上进步很大,能低成本地生成逼真的 3D 人脸,且泛化到真实拍摄条件。
  • 核心痛点:让这类生成模型”可动画”很难。已有工作大多用神经辐射场或三平面表示,形变是隐式学到的,无法精确直观地控制表情;其渲染慢,还依赖 2D 超分上采样,损害 3D 一致性(头发、皱纹等细节尤甚)。更根本的是,生成模型学到的隐空间会把身份、表情、光照、配饰等因素纠缠在一起,而动画场景要求表情随时间变化、身份等其他因素保持不变,因此必须把表情相关因素从隐空间中解耦出来。此外,传统图形学早已表明高质量动画细节(如皱纹)需要建模随动画状态变化的动态纹理,这一点被当前 3D 生成模型忽视了。
  • 本文 idea:用带内建表情形变的可形变参数模型 FLAME 作为强先验,通过共享 UV 参数化在 FLAME 上生成并嵌入 3D 高斯;让生成器额外以表情为条件,学习表情相关的几何形变与动态外观细节;再用双分支架构把身份与表情的生成过程分开,从而在生成设定下实现解耦、可控、实时的动画。

方法

整体框架:GAIA 用 StyleGAN 风格的生成器在 FLAME 头模的 UV 图上生成各类高斯属性图(位置、尺度、旋转、不透明度、颜色),再把这些属性提升到 3D 规范空间,套用一个广义蒙皮函数随 FLAME 参数驱动,最终由高斯光栅化器渲染。生成器分身份分支与表情分支两路:身份分支负责与人相关的几何与外观,表情分支在身份分支输出之上产生表情相关的偏移(模拟传统面部动画的动态位移)。训练用对抗损失,配合形状条件判别器与表情条件判别器。

flowchart LR
  z["隐码 z / 相机 π / 形状 β"] --> M[映射网络 M]
  M --> ws[中间隐变量 ws]
  ws --> Bs["身份分支 Bs → 基础属性图 Ā"]
  ws --> Be["表情分支 Be(+表情 ψ)→ 属性偏移 δA"]
  psi[表情 ψ] --> Be
  Bs --> Add["A = Ā + M⊙δA"]
  Be --> Add
  Add --> Lift["3D 提升(嵌入 FLAME 模板)"]
  Lift --> Skin["广义蒙皮 S(关节 J / 姿态 θ)"]
  Skin --> R[高斯光栅化渲染 R]
  R --> D["形状/表情条件判别器 Ds, De"]

关键设计:

  1. UV 参数化的高斯属性生成:把 3D 高斯的各类属性摆放到与 FLAME 对应的 UV 图上生成,从而借用成熟的 2D 生成骨干(StyleGAN),同时在无结构的点表示与 FLAME 的可形变、可关节化结构之间架起桥梁,便于在形变下正则化。位置属性被解释为 FLAME 模板顶点上的偏移,尺度与位置偏移都用 \(\tanh(\cdot)\)、softplus 等非线性变换约束范围,可理解为在形变模型之外附加的”修正 blendshape”与细节外观。

  2. 表情条件生成与双分支解耦:把 FLAME 形状 \(\boldsymbol{\beta}\) 与表情 \(\boldsymbol{\psi}\) 作为额外条件加入生成器,能更好拟合数据分布并建模表情相关的几何/外观变化(如皱纹)。但直接加条件会让生成器借表情标签”记住”身份,改表情会连带改身份。为此设计两分支:身份分支产出基础属性 \(\bar{A}_\star\),表情分支基于身份分支的中间特征产出偏移 \(\delta A_\star\),最终属性为 \(A_\star = \bar{A}_\star + M \odot \delta A_\star\),其中人脸区域二值 UV 掩码 \(M\) 把表情分支的影响限制在脸部(不波及头发等区域)。

  3. 广义蒙皮驱动动画:把生成的模板高斯提升到规范 3D 空间后,用与 FLAME 原始蒙皮同形式的广义蒙皮函数驱动——通过重心坐标双线性采样原始 blendweight 矩阵得到作用于所有生成高斯的权重 \(W_g\),即 \(G = S(G_T, J, \boldsymbol{\theta}, W_g)\)。这样自然继承 FLAME 的面部绑定(含颈、颌、双眼球),兼容既有图形管线。

  4. 正则化与多阶段对抗训练:对表情分支施加 \(L_2\) 偏移正则、并禁用表情引起的位置/尺度偏移(表情细节多为局部效应),对眼球 UV 区施加全变差损失以稳定眼球旋转,对口腔做缝合并只在嘴部加位置/尺度偏移以建模牙齿舌头。训练分两阶段:先只训身份分支(配形状条件判别器),从 256² 逐步到 512² 分辨率;再加入表情分支联合训练(配表情条件判别器),用零初始化层让表情分支影响从零缓慢增大。

实验结果

在 FFHQ 在野人脸数据集上,与三平面方法 EG3D、Next3D 及基于静态模板 UV 高斯的 GGHead 对比。EG3D 与 GGHead 不支持带解耦控制的动画,故其动画指标记为 N/A。FID 衡量图像质量,AED(表情/眼睑/下颌的平均表情距离)、APD(平均姿态距离)衡量动画忠实度,ID 衡量身份一致性。

方法 是否用超分 FID↓ AED-exp↓ AED-eye↓ AED-jaw↓ APD↓ ID↑
EG3D 3.28 N/A N/A N/A N/A N/A
Next3D 3.18 0.93 0.149 0.046 0.031 0.74
GGHead 4.06 N/A N/A N/A N/A N/A
GAIA(本文) 3.85 0.53 0.083 0.040 0.027 0.72

在不使用 2D 超分的前提下,GAIA 的 FID 优于 GGHead;相比 Next3D,GAIA 在各项动画指标(AED、APD)上全面更好、ID 一致性相当。Next3D、EG3D 因依赖 2D 超分虽 FID 略优,却牺牲了 3D 一致性(用极线图分析可见 Next3D 有噪声与波纹伪影,GAIA 更平滑)。

消融实验(同一张表内)显示:单分支无条件动画能力最差;仅加形状条件改善了 FID/AED 但表情不准;加表情条件提升图像与表情精度却破坏身份一致性(ID 掉到 0.42);单分支同时加形状+表情条件能救回身份但牺牲动画精度;朴素双分支能准确动画但身份一致性偏低(0.61);加入本文正则后(ID 0.72)动画精度与身份一致性兼得。动画形变方式上,换成最近邻 blendweight(FID 8.65)或 GNARF 的表面场(FID 12.36)都会产生明显伪影。

效率方面,GAIA 生成 21.96 ms、渲染仅 1.09 ms、约 43.38 FPS、显存 463.8 MB,均优于 Next3D(36.61 ms / 16.69 ms / 18.76 FPS / 701.3 MB);若身份固定可缓存身份分支输出进一步加速到约 52 FPS,达到交互速度。

亮点与局限

  • 亮点:
    • 只用在野 2D 图像、以对抗监督就学到可动画的 3D 头像生成模型,无需多视角/单目视频的精确重建监督。
    • 用 FLAME 提供可靠的粗表情先验,再用表情条件高斯学习皱纹、动态外观等细节,兼顾直观可控与高保真。
    • 双分支+多阶段训练+区域掩码/正则,系统性缓解了生成设定下身份与表情的纠缠这一核心难题。
    • 显式高斯表示 + 无需 2D 超分,带来更好的 3D 一致性和交互级实时渲染,并因广义蒙皮而兼容既有图形管线,支持眼球、下颌等精细控制。
  • 局限:
    • 依赖 FLAME 及其表情/姿态参数与外部估计器(SMIRK 拟合、3DMM 位姿、MODNet 抠背景),动画能力与保真受这些先验和标注质量约束;FLAME 只建模面部区域,头部其余区域的精细动画靠学习补足。
    • 训练成本较高(8 张 A100 约 5 天),且在 FFHQ 单一数据集上评测;表情分支影响需靠掩码与正则强行约束,解耦并非天然保证。
    • FID 相比使用 2D 超分的方法仍略逊,属于 3D 一致性与图像清晰度之间的取舍。

延伸思考

  • 该工作把”传统图形学的动态纹理/修正 blendshape 思想”迁移到 3D 生成 GAN 中,是一条把参数化先验与神经生成结合的清晰路线,值得与基于扩散模型或前馈重建的头像方法对比:GAN 路线在实时性与解耦控制上有优势,扩散路线在多样性与文本可控性上可能更强。
  • 依赖 FLAME 意味着表达力受限于该形变模型,未来可探索更强的头部/上身形变先验、或让形变基与外观联合学习,以覆盖夸张表情、舌头、复杂发型与配饰。
  • 交互级速度 + 解耦控制使其适合虚拟数字人、远程会议、AI 代理等落地场景;把身份分支缓存的思路推广到批量多角色场景、或与语音/表情驱动信号打通,是值得追问的工程方向。