SS4D: Native 4D Generative Model via Structured Spacetime Latents
The Chinese University of Hong Kong; Shanghai AI Laboratory; Zhejiang University; Stanford University
一句话总结
本文提出 SS4D:一个”原生”的 4D 生成模型,直接从单目视频生成动态 3D 物体。它不再像以往那样在预训练的 3D 或视频生成模型上做优化拼凑,而是把预训练 3D 生成模型 TRELLIS 的”结构化 3D 潜表示”扩展成”结构化时空潜表示”,在约 2 分钟内生成高保真、时序连贯、结构一致的 4D 内容。
研究背景
- 领域现状:静态 3D 物体生成已取得显著进展,但把”物体如何随时间运动”也建模进来的动态 3D(即 4D)生成明显滞后。4D 生成在影视、游戏、VR 等领域潜力巨大。
- 已有两条路线及其痛点:
- 基于分数蒸馏采样(SDS)的方法:借用预训练多视角/视频扩散模型的先验去优化 4D 表示(如 4D 高斯、Dy-NeRF)。概念优雅,但常出现过饱和伪影,且每个实例往往需要数小时优化。
- 前馈式方法:微调视频模型做多视角视频生成再用摄影测量损失重建 4D。速度更快,但几何往往粗糙或带噪,在剧烈运动下难以保持时空一致。
- 本文 idea:既然原生 3D 生成模型(在大规模 3D 数据上训练)已在质量与效率上超越 SDS 与大重建模型,那就把这条演化路径延伸到 4D。以 TRELLIS 为骨干——它把 3D 物体编码为带属性通道的稀疏体素网格,借稀疏体素的空间局部性提供强空间归纳偏置——把”时间”作为第四个维度引入潜空间,从而继承强空间一致性,同时缓解 4D 训练数据稀缺的问题。
方法
整体框架
给定动态物体的单目视频 \(I = \{I_t\}_{t=1}^{T}\)(\(T\) 为帧数,每帧 \(I_t\in\mathbb{R}^{3\times H\times W}\)),目标是产出高质量的 4D 表示。SS4D 先用 4D Flow Transformer 从视频生成一段粗粒度的体素结构 \(P=\{p_t\}_{t=1}^{T}\),再用 4D Sparse Flow Transformer 生成稀疏的结构化时空潜表示 \(Z=\{z_t\}_{t=1}^{T}\),最后解码成逐时刻的一组 3D 高斯 \(K=\{K_t\}_{t=1}^{T}\),即最终 4D 内容。两个 Transformer 阶段都内嵌”Temporal Layer”以捕捉时序一致性。
背景上,TRELLIS 把 3D 资产转成体素化特征 \(f=\{(f_i,p_i)\}_{i=1}^{L}\),其中 \(p_i\in\{0,1,\dots,N-1\}^3\) 是激活体素坐标、\(f_i\in\mathbb{R}^C\) 由多视角渲染的 DINOv2 特征聚合而来;再经 3D VAE 编码为结构化潜表示 \(z=\mathcal{E}(f)=\{(z_i,p_i)\}_{i=1}^{L}\)。生成分两阶段(先生成稀疏结构 \(\{p_i\}\),再生成潜特征 \(\{z_i\}\)),均用 DiT 架构和条件流匹配(CFM)目标。SS4D 把这一套整体扩展到时空域。
关键设计一:时间对齐(Temporal Alignment)
预训练 3D 模型逐帧生成质量高,但缺乏时间感知,直接套用到视频上会产生明显时序不一致。SS4D 把空间自注意力扩展为时间自注意力:用 einops 记法把时间轴重排到序列长度维做注意力后再还原:
\[z = \text{rearrange}(z,\ (B\ T)\ M\ C \to B\ (T\ M)\ C)\]
\[z = \text{TemporalAttn}(z)\]
\[z = \text{rearrange}(z,\ B\ (T\ M)\ C \to (B\ T)\ M\ C)\]
其中 \(B\) 为批大小、\(T\) 为帧数、\(M\) 为注意力长度、\(C\) 为特征维度。考虑时序的局部性与全注意力随帧数增长的二次复杂度,时间层采用移位窗口注意力(shifted window),在非移位与移位窗口配置间交替,兼顾局部聚合与全局信息交换。位置编码上,保留 TRELLIS 的绝对位置编码来编码 3D 空间坐标,并在时间轴上加入 1D 旋转位置编码(RoPE)来捕捉相邻潜表示的动态关系;这种混合 4D 位置编码让模型即便在固定帧数上训练,也能泛化到不同时长的序列。
一个关键发现是:仅对扩散模型做时间对齐还不够。由于 VAE 只在静态 3D 物体上训练,编解码时序连贯的 4D 特征会引入闪烁。于是把同样的时间对齐策略也施加到 VAE 上,显著减少重建高斯的抖动,是获得高质量结果的关键。
关键设计二:长序列生成与 4D 压缩
从长视频生成连续 4D 序列时,以往方法常遇到质量退化、不一致,且优化时间急剧上升。SS4D 一方面靠 1D RoPE 提升外推能力,另一方面利用帧间大量冗余信息,对长序列的 4D 表示做压缩。为此设计了 4D 压缩卷积网络 CompNet:给定输入时空潜表示 \(z\in\mathbb{R}^{L\times D}\),先对每帧施加带空间下采样的稀疏 3D 卷积,在 \(2^3\) 的局部区域内聚合潜表示;再用稀疏 1D 卷积促进帧间信息交换;随后引入时间下采样块,把同一 \(xyz\) 位置跨帧的两个激活体素打包,从而压缩帧长、降低后续 Transformer 的计算量。压缩后时间步经 AdaLN 层整合、视频条件经多个含 Temporal Layer 的 Transformer 块注入;再按 CompNet 逆序解压,解压时的上采样块通过跳连与压缩阶段的下采样块相连以传递空间信息,最终把潜表示恢复到原始结构。
关键设计三:训练策略
- 数据整理:从 Objaverse 与 ObjaverseXL 精选 16000 个带动画的 3D 物体,过滤掉视觉质量低或运动幅度极小的样本。特征聚合激活体素时,只考虑体素可见的渲染视角,而非对所有视角平均;所有视角都不可见的体素被丢弃。这样既缩短时空潜表示长度、提升训练效率,也减少特征噪声、改善重建质量。
- 渐进式学习:网络动画帧长各异,直接在长序列上训练收敛慢。故先在短动画上学习时空潜表示间的动态关系,再选取高质量、长时长的子集微调以应对长序列(训练时从 8 帧起,逐步增到 16、32 帧)。
- 随机遮挡增强:真实物体常处于复杂环境、被部分遮挡或因快速运动产生运动模糊。通过对条件视频帧随机施加黑色遮挡来模拟这类伪影,提升模型对遮挡与运动模糊的鲁棒性。
实验结果
实现细节:用 Blender 的 Cycles 引擎渲染训练数据,每段动画取前 36 帧。管线含四个模型(4D Structure VAE、4D Flow Transformer、4D Sparse VAE、4D Sparse Flow Transformer),其中 4D Structure VAE 因几乎完美重建 4D 结构序列而冻结,其余三个微调。在 8×A800 上用 AdamW(学习率 1e-4、FP16)训练约 7~8 天。
在合成数据集 ObjaverseDy 与 Consistent4D 上,SS4D 在所有指标上大幅领先所有基线(DG4D、Consistent4D、STAG4D、L4GM)。
ObjaverseDy:
| 方法 | LPIPS ↓ | CLIP-S ↑ | PSNR ↑ | SSIM ↑ | FVD ↓ |
|---|---|---|---|---|---|
| DG4D | 0.231 | 0.869 | 13.72 | 0.784 | 693 |
| Consistent4D | 0.189 | 0.884 | 15.63 | 0.817 | 640 |
| STAG4D | 0.202 | 0.871 | 15.96 | 0.821 | 716 |
| L4GM | 0.243 | 0.887 | 14.48 | 0.782 | 686 |
| 本文 | 0.150 | 0.932 | 18.09 | 0.842 | 465 |
Consistent4D:
| 方法 | LPIPS ↓ | CLIP-S ↑ | PSNR ↑ | SSIM ↑ | FVD ↓ |
|---|---|---|---|---|---|
| DG4D | 0.215 | 0.896 | 15.47 | 0.785 | 641 |
| Consistent4D | 0.228 | 0.886 | 13.66 | 0.768 | 674 |
| STAG4D | 0.204 | 0.890 | 16.89 | 0.821 | 740 |
| L4GM | 0.219 | 0.908 | 15.69 | 0.803 | 596 |
| 本文 | 0.149 | 0.947 | 18.90 | 0.843 | 455 |
显著更低的 FVD 说明生成的 4D 资产时空一致性更好。效率上,本文推理约 2 分钟,远快于优化式方法(DG4D 15 分钟、STAG4D 1 小时、Consistent4D 1.5 小时),仅慢于前馈式 L4GM(3.5 秒),但质量全面胜出。
真实视频(DAVIS)用户研究:从 14 段相机运动较稳的视频、请 25 位有 3D/视频生成背景的用户按几何质量、纹理质量、运动连贯性打分(1~5,采用平均用户排名 AUR)。本文在三项均以大幅优势领先(几何 4.497、纹理 4.413、运动 4.527),远超次优。
消融:
- 时间对齐(VAE 重建):无时间对齐 PSNR 27.11 / 闪烁 2.99 / FVD 403.88;加时间对齐提升到 PSNR 30.58 / 闪烁 2.22 / FVD 157.16,显著降低闪烁。
- 遮挡增强:无增强时被岩石遮挡的犀牛前腿无法重建,加增强后能推断补全完整形状。
- 可见性特征聚合:相比对所有特征平均(Mean,PSNR 31.63、平均长度 6605、编码速度 68.4),仅聚合可见视角(Visible,PSNR 31.07、平均长度 5261、编码速度 76.3)在重建质量相当的同时缩短序列、加快编码。
亮点与局限
亮点:
- 首个”原生”4D 生成范式:直接在 4D 数据上训练生成器,而非在 3D/视频模型上做 SDS 或摄影测量拼凑,从而同时获得高保真、时序连贯与结构一致。
- 把成熟的结构化 3D 潜表示(TRELLIS)优雅地扩展到时空域:以时间对齐(含 VAE 端对齐)+ 混合 4D 位置编码(绝对空间编码 + 时间 RoPE)解决时序一致性,缓解 4D 数据稀缺。
- 用 CompNet 的因子化 4D 卷积做时间压缩,配合渐进式训练与随机遮挡增强,支撑高效的长序列生成与真实场景鲁棒性。
- 效率与质量兼得:约 2 分钟出结果,在合成与真实数据上全面超越 SOTA。
局限:
- 沿用 TRELLIS 的两阶段管线,训练效率不如完全端到端方法。
- 主要在合成数据上训练,应用到真实输入时纹理常被过度简化、难以生成照片级真实外观;引入真实视频数据训练有望缓解。
- 失败场景:透明/多层物体(只保留最外层体素,难以刻画复杂折射,如水晶球)、高频细节(如迷彩裤纹样难以保持一致、出现闪烁)、快速运动与强运动模糊(如奔跑的狗形状重建失败)。
- 与其他生成模型一样,可能继承 Objaverse/ObjaverseXL 的偏差,并有被滥用生成误导性内容的风险。
延伸思考
- “把静态 3D 生成的成熟骨干沿时间维扩展”是一条比”拼装现成 2D/3D 先验”更根本的路线:当某个模态的原生生成模型足够强时,让相邻高维模态(3D→4D)继承其归纳偏置,往往比从零训练或蒸馏更高效、更一致。这与 3D 生成本身从 SDS/LRM 演进到原生模型的历史相呼应。
- 时序一致性不能只靠生成器:本文发现必须同时对 VAE 做时间对齐才能消除闪烁,提示”编码-解码”环节本身也是时序伪影的来源,任何做动态内容的潜空间方法都应审视自编码器的时间行为。
- “空间局部性 + 稀疏体素 + 帧间冗余压缩”三者结合,为长序列 4D 生成提供了可扩展的算力路径;透明/高频/快速运动这三类失败恰好指向纯表面体素表示与像素级监督缺失的本质短板,后续引入像素空间损失或体积/多层表示或是突破方向。