Journal

A Few-Step Generative Model on Cumulative Flow Maps

Zhiqi Li, Duowen Chen, Yuchen Sun, Bo Zhu

Georgia Institute of Technology

SIGGRAPH 2026Neural & Generative

一句话总结

本文提出 Cumulative Flow Maps(CFM):一个统一的少步/一步生成框架,把生成模型里的”瞬时流映射”抽象成”累积流映射”,只改时间嵌入和训练损失、不动网络结构、不做蒸馏,就能让 Flow Matching、DDIM、EDM 等多种主流范式在图形任务上把采样步数压到 1~10 步(推理提速 10×~200×),且几乎不损失质量。

研究背景

  • 领域现状:扩散模型与流匹配已广泛用于图形学的图像、点云、隐式场(SDF)等生成任务。从流动力学视角看,生成模型本质是在概率空间里学一个把噪声分布搬运到数据分布的”流映射”。但直接学这种有限时间的长程搬运非常难,所以实践中大家都退而学”瞬时动力学”(如速度场),再靠多步数值积分逼近,导致推理步数多、成本高。
  • 核心痛点:现有的少步/一步加速方法要么依赖蒸馏(teacher-student),要么像 Mean Flow 那样只绑定在 \(u\)-prediction 的流匹配公式上,无法自然迁移到图形学里常用的 DDIM、EDM、\(x_1\)-prediction 流匹配等框架。也就是说,缺一个跨范式通用的少步生成理论。
  • 本文 idea:提出一个连接”瞬时更新”与”长程搬运”的统一抽象。用一个抽象函数 \(F[\cdot,\cdot,\cdot,\cdot]\) 把各种范式的瞬时流映射写成同一形式,再取其极限复合定义出累积流映射,并为它设计一套可训练的累积参数化。Mean Flow 只是该框架在 \(u\)-prediction 下的一个特例。

方法

CFM 的主干是”抽象统一 → 累积扩展 → 场方程训练”三步:先把不同生成范式的瞬时流映射统一成 \(\psi_{t\to t+h}(x)=F[m_t(x),x,t,t+h]+O(h)\) 的形式;再把瞬时映射复合到有限时间,得到累积流映射 \(\psi_{t\to r}\) 及其参数化场 \(m_{t\to r}(x)\),满足 \(\psi_{t\to r}(x)=F[m_{t\to r}(x),x,t,r]\),直接支持从时刻 \(t\) 跳到任意未来时刻 \(r\);最后针对”累积场无法用条件形式监督”这一根本困难,推导出一个基于场方程的等价重写,把训练变得可行。

flowchart LR
  A["瞬时流映射 ψ(t→t+h)"] --> B["抽象函数 F 统一表示<br/>u-FM / x1-FM / DDIM / EDM"]
  B --> C["极限复合 → 累积流映射 ψ(t→r)"]
  C --> D["累积参数化场 m(t→r)"]
  D --> E["场方程重写 + 条件瞬时场监督"]
  E --> F["少步 / 一步采样"]

关键设计分四点:

  1. 抽象函数统一表示(是什么):作者引入抽象函数 \(F[f_1,f_2,f_3,f_4]\),并对它加了可微、可逆、恒等(\(f_3=f_4\) 时 \(F=f_2\))、仿射结构四条假设。\(u\)-FM、\(x_1\)-FM、DDIM、EDM 都能写成这个形式的具体实例。这样做的好处是解耦了变量依赖,让后续的累积扩展与训练推导对所有范式一次性成立,而不必逐个范式重推。

  2. 累积流映射与累积参数化(怎么扩展):把瞬时映射按分区无限复合得到长程映射 \(\psi_{t\to r}\),它满足半群性质 \(\psi_{t\to r}(x)=\psi_{s\to r}(\psi_{t\to s}(x))\)。再定义累积场 \(m_{t\to r}(x)\) 去参数化它。一个关键性质(Theorem 1)是当 \(r\to t\) 时 \(m_{t\to r}(x)\to m_t(x)\),即累积场与瞬时场自洽——这让模型既能从头训练,也能从已有多步模型初始化加速训练。

  3. 训练难题与场方程重写(为什么难,怎么解):直接监督累积场需要一个”条件累积场”,但作者证明这样的自洽条件累积场根本不存在(Challenge 1)。解决办法是把 \(m_{t\to r}(x)\) 重写成”瞬时场 + 累积场对 \(t,x\) 的导数”的等价形式(Theorem 3),其中导数项以组合形式 \(\partial_t m_{t\to r}(x)+\partial_4 F[m_{t\to t}(x),x,t,t]\,\partial_x m_{t\to r}(x)\) 出现。由于重写后损失里出现的是瞬时场,就能用可解析的条件瞬时场 \(m_t(x\mid X_{t_1})\) 引入数据监督,再对当前模型预测施加 stop-gradient 作为 \(m_{t\to r}\) 的估计,得到可计算的替代损失(Theorem 4 证明它与目标损失只差一个与参数无关的常数)。

  4. 工程实现极简(怎么做):只需在原时间嵌入器上给 \(r\) 加一个嵌入器,把原来的 \(\mathrm{emb}_t\) 换成 \((\mathrm{emb}_t+\mathrm{emb}_r)/2\);当 \(r=t\) 时退化为原模型。训练时按比例 \(\alpha=0.5\) 混入 \(r=t\) 的瞬时训练样本以稳定收敛。导数项既可用自动微分的 JVP 计算,也可用离散差分近似(供不支持 JVP 的网络使用)。

实验结果

在 CelebA-HQ-256 无条件图像生成上,CFM-DDIM 与多步 DDIM 及一致性模型(训练/蒸馏)对比,报告 FID-50k(越低越好):

方法 128 步 4 步 1 步
DDIM 23.0 123.4 132.2
Consistency Distillation 59.5 39.6 38.2
Consistency Training 53.7 19.0 33.2
CFM-DDIM(本文) 19.2 17.5 24.9

可见原始 DDIM 在少步下崩溃(4 步 FID 高达 123),而 CFM-DDIM 在 1 步和 4 步下都显著领先其它加速方法,128 步也不劣于原模型。消融显示:从预训练多步模型自蒸馏能进一步降 FID;而关掉瞬时场混合(\(\alpha=0\))会让训练彻底失败(FID 572),印证了瞬时-累积自洽性的必要性。

其余任务用文字概括:几何分布生成(GeoDist,Chamfer Distance)中 CFM-EDM 最稳健,3/6/60 步几乎无差异(约 0.017~0.018),而 \(u\)-FM 在此任务失效——说明不同任务需匹配不同范式,EDM 对几何分布是必要的。关节位置预测(PDT)上 CFM-DDIM 用 5~10 步就达到甚至超过原 PDT 1000 步 DDPM 的精度(CD-J2J 5.2% vs 6.4%),实现约 200× 加速。SDF 稀疏条件生成(仅 64 个表面点)4~10 步即可获得与 64 步 Functional Diffusion 相当的重建质量。图像转草图任务上 1~4 步 CFM 与 50 步 SwiftSketch 在 MS-SSIM 和 DreamSim 上基本持平,达 50× 加速。

亮点与局限

  • 亮点:
    • 用一个抽象函数把 \(u\)-FM、\(x_1\)-FM、DDIM、EDM 统一起来,把 Mean Flow 从”只适配 \(u\)-prediction”推广成跨范式通用框架,理论优雅且可迁移。
    • 完全不改网络结构、不做蒸馏,只动时间嵌入和损失,工程改造成本极低,且能从已有多步模型热启动。
    • 覆盖图像、几何分布、关节预测、SDF、草图五类图形任务,10×~200× 提速且质量基本不降,通用性说服力强。
    • 明确指出”没有单一范式适配所有任务”(EDM 之于几何分布、\(x_1\)-FM 之于像素空间图像),为实践选型提供了有价值的经验结论。
  • 局限:
    • 需要选对范式——框架虽通用,但具体任务该用哪个实例仍需经验判断,\(u\)-FM 在几何分布/像素图像上会失效。
    • 训练损失依赖对模型输出关于 \(t,x\) 的导数(JVP 或差分),相比普通训练有额外计算/实现开销。
    • 大量正确性依赖论文附录中的定理证明(累积场重写、条件-边际损失等价性),正文只给结论,实际稳定性仍需在更大规模数据集与更多架构上进一步验证。

延伸思考

  • 该框架把流体仿真里的”流映射”思想迁移到概率空间的生成建模,是物理仿真与生成模型交叉的一个有代表性的例子;作者也明确提到灵感来自并行发展的流体流映射方法。可以进一步追问:其它物理搬运技术(如涡量/特征线方法)是否也能启发新的生成参数化。
  • 与 Mean Flow、Shortcut Models、Consistency Models 等少步方法相比,CFM 的核心差异在于”统一抽象 + 场方程训练”而非”针对单一范式的重参数化”。一个值得探索的方向是把它接到大规模文生图/文生 3D 的主流扩散骨干上,看少步加速在高维条件生成中的表现。
  • 论文强调不同任务要匹配不同范式,那么能否设计一个自动为给定任务/数据选择最优 \(F\) 实例的元学习或搜索机制,会让该框架更易落地。