HairLRM: Strand-based Hair Modeling via Large Reconstruction Models
LightSpeed Studios; Zhejiang University; Hong Kong Baptist University
一句话总结
HairLRM 把大重建模型(LRM)生成的粗糙 3D 头发网格当作几何骨架,再用一个”双朝向自编码器”把这层表面几何提升成高保真的逐根发丝,从而在单视图/多视图输入下稳健重建包括马尾、卷发等复杂发型。
研究背景
- 领域现状:数字人对高保真 3D 头发的需求很高,但一头头发多达约 15 万根、拓扑复杂,工业界仍高度依赖人工制作。近年数据驱动方法能从单视图或多视图自动重建发丝,但仍有明显短板。
- 核心痛点:作者认为当前逐根建模的不准确,根源不只是数据稀缺(如常用合成数据集规模有限),更在于”直接从 2D 投影回归高维 3D 向量场”这件事本身是欠定的。缺少结构约束会导致两类顽疾:一是全局结构崩塌,在马尾、辫子等复杂拓扑中深度排序与遮挡无法解析;二是流形歧义,单一向量场表示会把卷发那种高频、多方向的走向过度平滑。
- 本文 idea:借助 LRM 已经学到的强几何先验。LRM 能从少量输入生成高保真 3D 表面,但表面流形表示与头发所需的体积化、逐根几何天然不兼容,而且从粗表面推导准确发丝走向本身也是难题。HairLRM 用 LRM 网格作为显式几何脚手架,再设计一套”双朝向”表述把粗表面转成细粒度发丝。
方法
整体框架:输入一张肖像,先分割出头发区域并合成到标准模板胸像上得到标准化图像,再用图像到 3D 的 LRM 生成初始表面网格 M 作为粗几何先验。核心是双朝向自编码器(DOAE),它同时吃图像与网格,通过在潜空间中优化潜码,把表面几何转化为高保真的体积化 3D 朝向场;随后提取显式发丝,并经两级修正(表面引导的朝向校正、迭代式朝向场精化)得到最终结果。多视图与单视图共用同一流程(LRM 天然支持多视图输入)。
flowchart LR
A["输入肖像 / 多视图"] --> B["分割并合成到模板胸像"]
B --> C["图像到 3D LRM 生成粗网格 M"]
C --> D["DOAE 潜码优化"]
D --> E["3D 朝向场 O"]
E --> F["表面引导朝向校正"]
F --> G["混合策略提取发丝"]
G --> H["迭代精化 回灌编码器"]
H --> I["最终逐根头发模型"]
关键设计:
-
双朝向自编码器(DOAE):架构沿用 Dora 的思路,把基于显著点的双交叉注意力和 transformer 版 3DShape2VecSet VAE 结合。这里”双”指两组互补点云共同条件化编码器——刻画全局头发体积的均匀点云 Puniform,和强调方向剧变区域(卷曲、走向边界、分缝)的显著点云 Psalient。每个采样点定义为 7 维 \(s = [x, o, c]\):3 维位置、3 维朝向、1 维二值标记(头发或胸像)。流程是先对两组点云做最远点采样得到稀疏集,再分别与均匀/显著点做交叉注意力,然后对二者之和做自注意力得到潜码 z;解码器不像以往只预测 SDF 或占据,而是额外输出朝向与分类,得到预测的符号距离、朝向和分类标签。
-
双流形合成数据:为训练准备了约 5.2 万个发型(来自 DiffLocks 4 万、Perm 1 万、UniHair 2 千),覆盖直发、波浪、卷发、长发、辫子等。每个发型对齐到胸像后,从密集发丝算占据栅格并抽等值面得到头发网格,与胸像网格布尔并得到统一表面用于算 SDF;显著点云用基于发丝的 k-means 聚类,取每簇最靠近中心的发丝重采样得到;均匀点云在包围盒栅格上按最近发丝切向赋予朝向、过远则丢弃,并叠加胸像内部采样点。
-
朝向空间均匀采样:头发朝向分布高度不均,随机采样会过度代表主流方向、引入偏置。作者用 Fibonacci 球构造 \(N_{dir}\) 个均匀方向锚点,把朝向分箱后均匀抽样;实验证明这对卷发帮助最大。
-
表面引导朝向校正:为防止发丝穿透底层表面,对每个采样点找到网格上最近点,若距离小于阈值就把朝向投影到该点切平面(去掉沿法线分量),并用随距离衰减的权重与原朝向做混合,保证离开表面时平滑过渡。
-
混合式发丝提取与迭代精化:结合两种范式——先按 CT2Hair 的均值漂移、分段生成、引导生长得到引导发丝 G,再从未被覆盖的头皮顶点用前向牛顿平流追加发丝 E,合并成最终发型。迭代精化则把第一遍提取出的发丝重新转成点云回灌编码器,回归出更好的潜码来初始化第二轮优化;因为一遍结果已经足够好,实验中一次迭代即收敛。运行时用重建网格和输入图像在线优化潜码,监督来自随机采样点的 SDF、由 HairStep 预测并反投影到 3D 的朝向线索 Oproj 与分割标签 Cproj;用户也可在 3D 表面画稀疏方向笔画作为约束。
实验结果
主实验用 Perm 测试集做 DOAE 各变体的消融,报告卷发、直发与总体上的均方误差(MSE)与平均角误差(MAE)。均匀流与显著流缺一不可,去掉均匀采样(ES)也明显变差,完整模型全面最优(角误差约降到基线一半左右)。
| 变体 | MSE 总体↓ | MAE 总体↓ |
|---|---|---|
| PtXformerV3 | 0.040 | 14.82° |
| DOAE 仅均匀流 | 0.029 | 12.78° |
| DOAE 仅显著流 | 0.032 | 13.37° |
| DOAE 无均匀采样 | 0.021 | 10.70° |
| DOAE 完整 | 0.011 | 7.13° |
与四个单视图 SOTA 的对比中,作者按输入视角渲染重建结果,比头发轮廓 IoU(形状)与相对 HairStep 2D 朝向的平均角误差(走向)。HairLRM 取得最佳 IoU 0.84 与最低朝向误差 18.8°,优于 Im2Haircut(0.76 / 22.0°)与 HairStep(0.62 / 27.5°),并且是首个能从单张图像稳健重建马尾、双马尾发型的方法。
运行时约每张肖像 15 分钟,主要瓶颈是潜码优化(约 10 分钟),其次 LRM 生成网格(约 3 分钟)、头发生长(1–2 分钟)、精化与预处理(不到 35 秒);推理显存约 4 GB,远低于训练的约 80 GB。
亮点与局限
- 亮点:
- 把问题从”直接回归 3D 向量场”重构为”以 LRM 网格为显式脚手架 + 潜空间优化”,用强几何先验缓解单视图的欠定性,明显改善全局轮廓与复杂拓扑。
- 双朝向表述配合双点云交叉注意力,同时兼顾全局体积与高频方向细节;首次稳健重建马尾/双马尾。
- 骨架与 LRM 后端解耦(DOAE 只吃网格),管线对单/多视图统一;支持用户笔画交互与下游转发片卡。
- 局限:
- 重建质量被 LRM 网格上限约束;对紧编辫、非洲卷等欠代表发型仍吃力。
- 优化式推理较慢(约 15 分钟/张)。
- 真实图像中相机内参不准会导致反投影分割偏差,出现发梢处的发丝/网格错位缺口。
延伸思考
作者明确指出把优化后的潜流形蒸馏成前向式解码器是有前景的加速方向,这与”优化式重建质量高但慢、前向式快但难处理不规则输入”的经典权衡一致。用 LRM 表面作为强先验来约束逐根/体积几何的思路,或许能迁移到其他”纤维状/编织状”结构的重建(如毛皮、织物、植被)。此外,方法对 2D 朝向图(HairStep)和 LRM 后端(Hunyuan3D)都有依赖,这两处上游模型的进步会直接抬高其上限,但也意味着误差会沿链条传导,值得关注端到端联合优化的可能。