Conference

CAGS: Color-Adaptive Volumetric Video Streaming with Dynamic 3D Gaussian Splatting

Daheng Yin, Yili Jin, Jianxin Shi, Isaac Ding, Miao Zhang, Fangxin Wang, Zhaowu Huang, Cong Zhang, Jiangchuan Liu, Fang Dong

Simon Fraser University; The Chinese University of Hong Kong, Shenzhen; Southeast University

一句话总结

针对基于 3D Gaussian Splatting 的体积视频流传输,提出”颜色自适应”方案:用可伸缩矢量量化压缩高斯属性来建立分级质量(LoD),再用服务端渲染的低分辨率参考图在客户端做颜色复原,从而在带宽波动下获得远高于现有方法的画质。

研究背景

  • 领域现状:体积视频(VV)流传输把动态三维场景实时送到客户端,支持 6 自由度自由视角浏览,是沉浸式远程呈现、数字孪生、机器人遥操作等应用的底座。3D Gaussian Splatting(3DGS)因实时、照片级真实的渲染质量成为主流表示,但高斯属性维度高、数据量大,给带宽受限的流传输带来压力。
  • 核心痛点:现有做法有两条路。一是基于”密度”的分级细节(LoD),即减少高斯数量——但每个高斯覆盖一小块体积区域,删掉高斯会造成场景覆盖不足、出现结构性空洞与明显画质崩塌。二是属性压缩(如矢量量化 VQ),它能较好保住结构,但主要副作用是颜色失真;而且已有 VQ 大多面向静态存储压缩,缺乏自适应流传输所需的质量可伸缩性。
  • 本文 idea:作者的前期实验发现两点关键事实——激进的 VQ 主要破坏颜色而保留了结构;并且这种颜色失真可以借助一张”颜色准确的低分辨率参考图”在渲染结果上被有效纠正。由此提出 Color Adaptation 方案:用 VQ 建立 LoD,用服务端渲染的低分辨率参考图在客户端复原颜色。

方法

整体框架分离线与在线两阶段。离线阶段用可伸缩矢量量化(SVQ)把每个差分帧的高斯属性压成”基础层 + 多个增强层”的分级结构,再切片并用 Draco/Gzip 压缩。在线阶段服务端根据上传的视角历史预测客户端视角、决定自适应视场(FoV),从最高质量层渲染低分辨率参考图并随选定切片一起下发;客户端渲染收到的切片得到带颜色失真的图像和深度图,用后渲染视角对齐(PRPA)对齐参考图,最后用轻量网络复原颜色显示。

flowchart LR
  A["3DGS 序列 (差分帧)"] --> B["SVQ 分层量化 + 切片压缩 (离线)"]
  B --> C["服务端: 视角预测 + 自适应 FoV"]
  C --> D["选切片/LoD + 渲染低分辨率参考图"]
  D --> E["客户端: 渲染切片 → 失真图 + 深度"]
  E --> F["PRPA 对齐参考图"]
  F --> G["轻量网络颜色复原 → 显示"]

关键设计有三个,分别对应把 Color Adaptation 落地到实时系统时的三个难点:

  1. 可伸缩矢量量化 SVQ(要点:让 VQ 具备分级质量)。传统 KMeans VQ 是”扁平”聚类,不能分级;而层次聚类 AHC 每轮都要算两两距离,对每帧超过十万个高斯来说不可行。SVQ 先在随机子集上跑 KMeans,再像 AHC 那样按”合并两簇引入的量化误差”作为簇间距离,反复合并最近的簇构成二叉树。随后借鉴 Huffman 编码思想按簇在树中的位置分配索引:截断低位比特就自然回退到父簇(更粗的 LoD)。于是码本被组织成存高位比特的基础层和存低位比特的增强层,反量化只需拼接收到的比特再查表,解码极快、不成为瓶颈。

  2. 后渲染视角对齐 PRPA(要点:修正视角预测误差带来的错位)。互联网存在 40–90 ms 延迟,逐帧上传视角再等参考图会超出 30 FPS 的交互预算(每帧 33.3 ms),所以服务端必须提前按预测视角渲染参考图,预测误差就导致参考图和客户端实际视角错位,严重损害复原质量。PRPA 用客户端渲染出的深度图,把客户端视角的像素反投影到参考视角、采样对应颜色,生成对齐后的参考图。它与传统 DIBR 不同:DIBR 用参考图自己的深度去 warp,而 PRPA 用目标视角的深度去对齐参考图。为处理映射到遮挡区域产生的伪影,PRPA 记录重投影深度、遮挡像素取最小深度可见、其余标记为遮挡,再迭代用非遮挡邻域的平均色替换遮挡像素(error erosion),得到更干净的对齐图。整套用 GPU 矩阵运算实现,开销可忽略。

  3. 自适应视场 Adaptive FoV(要点:平衡覆盖与像素密度)。视角预测误差可能让参考图只覆盖部分实际视口,PRPA 后留下缺失区域;单纯放大参考 FoV 虽提升覆盖,却降低目标区域的像素密度,同样伤质量。作者用轻量 LSTM 预测缩放因子 \(s_i = (s^x_i, s^y_i)\),据此把参考 FoV 相对固定的客户端视口 FoV 缩放:\(F^x = (1 + s^x_i) F^x_0\)、\(F^y = (1 + s^y_i) F^y_0\)。模型输入客户端视角的旋转、位置及其时间变化、历史状态等。为得到训练监督,作者用一个”快速近似真值 FoV”:只把参考图四个角像素按固定深度(如 10 m)投影到客户端视口来估计所需最小 FoV,避免投影全部像素的高昂计算。该策略与视角预测解耦,是即插即用的。

实验结果

主实验之一是把 SVQ 与多种可伸缩压缩方法在最高质量层做率失真与解码延迟对比(PSNR 越高越好、Size 与 dec.t 越低越好)。SVQ 在保持相当画质的同时,解码延迟比 HAC/HAC++/CompGS 低一到三个数量级,最适合实时流传输。

方法 Neural3DV PSNR Neural3DV 解码(s) Meet.Room PSNR Dyn.3DGS PSNR
SPZ high 23.1 0.075 21.8 21.0
CompGS 24.9 6.213 25.0 19.1
HAC 22.2 24.407 25.2 20.5
HAC++ 21.5 51.708 25.2 20.9
SVQ 66bit 24.5 0.015 26.0 25.3
SVQ 76bit 25.1 0.015 26.4 23.3

系统层面,在消费级 GPU(RTX 3080)上服务端与客户端均可运行,客户端以 60 FPS 渲染、30 FPS 流传输:客户端 SVQ 解码约 2.58 ms、PRPA 约 2.11 ms、颜色复原约 6.5 ms(1600×1200),服务端视角预测与动态 FoV 各约 1 ms、低分辨率参考图渲染约 1.7 ms,整体满足实时预算。在固定与波动带宽下,CAGS 相比现有 LoD 方法(LTS-F)和基于 VQ 的 V3-A,PSNR 提升约 5~20 dB,且在 5G 波动带宽轨迹下质量更高更稳定;快速头动瞬间会因预测误差出现短暂质量下降,但短暂且被人眼运动感知所掩盖。消融显示去掉 PRPA 画质大幅下降、去掉 Adaptive FoV 也有可观损失。方法还能与 Dynamic 3DGS、4DGS、HiCoM 等多种体积视频制备方式结合,表现出通用性。

亮点与局限

  • 亮点:
    • 观察角度新颖——把”VQ 主要损坏颜色而非结构”这一现象转化为系统设计动力,用低分辨率参考图做示例式颜色复原,绕开了密度 LoD 的结构空洞问题。
    • SVQ 在获得分级可伸缩性的同时保持了 VQ 的极快解码,解码延迟远低于神经编解码方案,真正满足实时交互。
    • PRPA 与 Adaptive FoV 针对服务端预渲染必然产生的视角错位/覆盖不足给出轻量、可 GPU 化的对症解法,且与视角预测方法解耦、即插即用。
    • 与多种 3D/4D 高斯表示兼容,可搭上后续高斯压缩的进展。
  • 局限:
    • error erosion 只能减轻而非消除遮挡区域伪影,为保实时未在复原网络中专门处理,快速运动时仍可见残留伪影。
    • 颜色复原依赖参考图与深度对齐的质量,快速头动导致预测误差增大时会出现瞬时画质下降。
    • 方案面向”差分帧”式高斯表示,对不满足该组织形式的表示适配性有待验证。

延伸思考

作者指出 VQ 引起颜色失真可能是跨越多种 3D 表示的普遍现象(NeRF 上也有报告),因此 Color Adaptation 有望超越高斯,成为通用的 3D 内容流传输颜色纠正范式,值得在更多表示上验证。另一个值得追问的点是复原网络与 PRPA/erosion 的分工边界——若允许更强的复原模型,是否能进一步吃掉遮挡伪影而不破坏实时预算;以及自适应 FoV 的 LSTM 与更强的视角预测器联合优化能否进一步压缩快速运动下的质量抖动。