Journal

Gabor Fields: Orientation-Selective Level-of-Detail for Volume Rendering

Jorge Condor, Nicolai Hermann, Mehmet Ata Yurtsever, Piotr Didyk

Università della Svizzera italiana

SIGGRAPH 2026Rendering

一句话总结

用”高斯 + 各向异性 Gabor 核”的混合来表示体密度场,靠在频域上剔除部分核就能连续地控制细节层级(LOD),既省内存又加速渲染,还顺带支持凝视渲染、运动模糊和程序化云的生成。

研究背景

  • 领域现状:基于原语(primitive)的体表示——用一堆椭球状高斯核去拟合体密度场——近年成为体渲染的热门选择,比传统离散体素网格省内存、渲染快,还支持物理光线追踪、二次光线、解析透射率积分等。
  • 核心痛点:体素网格天然容易做层级结构(mipmap、剪枝八叉树),用来做 LOD 既能降渲染开销又能抗锯齿;但高斯核做不到这点。高斯的功率谱以原点为中心、覆盖全频段,想做 LOD 只能靠解析低通滤波(得到同样多但空间支撑更大的核,反而更慢)、或者重新拟合每一级(内存翻倍、优化昂贵、层间还可能跳变不连续)。按大小剪枝高斯也不行——小高斯里也藏着重要的低频信息,删了会在粗层出现瑕疵。
  • 本文 idea:换一种核。Gabor 核是”高斯包络 × 正弦调制”,它在频域是一对关于调制峰频对称的高斯,也就是天然只存在于某个频段。这样一来,滤掉某个频段就等价于直接删掉对应的一批核。借鉴可导金字塔(steerable pyramid)的思路,把体积组织成”低通高斯打底 + 各频段各方向的 Gabor 残差”的连续拉普拉斯金字塔,做 LOD 只需在渲染时按需 mask 掉一部分核,零额外内存、层间连续。

方法

整体框架:先定义一个可解析积分的 3D 各向异性 Gabor 核,用它和高斯核一起把体密度场表示成一个”频率-方向”金字塔(低频用高斯、残差用 Gabor);再通过一套分层可导渲染拟合,把已有的体素网格蒸馏成这种 Gabor Field;渲染时利用 Gabor 核的频率与方向选择性,随机或确定性地只对一部分核做光线求交,从而在做 LOD 的同时加速路径追踪。

flowchart LR
  A["体素密度场"] --> B["构建高斯金字塔<br/>逐层分频"]
  B --> C["分层可导渲染回归<br/>低频=高斯, 残差=Gabor"]
  C --> D["Gabor Field<br/>频率+方向金字塔"]
  D --> E["渲染时按频率/方向<br/>mask 核 + 解析线积分"]
  E --> F["连续 LOD / 加速路径追踪"]

关键设计:

  1. 3D 各向异性 Gabor 核与解析积分:核形如 \(g(x)=\frac{1}{\sqrt{8\pi^3\lvert\Sigma\rvert}}e^{-\frac12(x-\mu)^T\Sigma^{-1}(x-\mu)}\cos(\vec{\omega}^T(x-\mu))\),其中协方差 \(\Sigma=RSS^TR^T\) 决定包络形状,调制方向 \(\vec{\omega}\) 被绑定到包络上(\(\vec{\omega}=RS^{-1}(\omega,\omega,\omega)^T\)),让”越小的核覆盖越高的频率”这一性质自然成立。作者推导了它沿任意光线段的闭式线积分——难点在于积分里出现复数误差函数(Faddeeva 函数),他们用截断到 16 项的泰勒展开来近似 \(\mathrm{Re}[\mathrm{erf}(z)]\),对极短段则直接用中点法则退化成一次密度求值,兼顾精度与速度。

  2. Gabor Fields 金字塔与 LOD:把体积看成不同频段核混合的组合——零频 Gabor(即高斯)作为低通基底,\(f_0>0\) 的 Gabor 建模各频段残差,再按方向拆分成”松弛版”可导金字塔(松弛是因为 Gabor 不正交、支撑无限,无法保证正交性)。单个 Gabor 密度可正可负,但只要所有重叠原语(含高斯)在任一点的总和为正就仍是合法密度场。做 LOD 时无需存储新层级,只要在渲染时 mask 掉高频核即可得到连续的低通版本。

  3. 频率与方向选择性加速:Gabor 核的线积分强烈依赖光线相对调制平面的朝向——沿调制平面积分时因相消干涉趋近于零,且频率越高方向选择性越强。据此作者提出两类随机-解析估计器:随机拉普拉斯路径追踪在每段随机决定积分哪些频段(控制变量式做法:总是包含高斯低通层、再随机加入若干高频层),用每样本方差/偏差换取更快的体积穿越;方向选择性路径追踪把核按方向和频率分箱,渲染每条光线前先算它与各箱朝向的对齐度 \(a=\lvert\cos\theta\rvert\),用权重 \(w(a)=e^{-f_0^2 a^2/2}\) 做重要性采样或直接剪掉贡献小的核。实现上借助 OptiX 的可见性掩码,给每级金字塔分配掩码 \(V_l=2^l\),光线掩码与之做按位与,在遍历 BVH 之前就筛掉不需要的原语。此外还有自适应裁剪(根据阈值 \(\epsilon\) 解出每个核的有效支撑 \(E_{\text{adaptive}}\),高频 Gabor 可用更小支撑)进一步降本。

  4. 分层可导回归:把离散体素网格蒸馏成 Gabor Field。先建一个”感知模糊程度与分辨率无关”的高斯金字塔(\(\sigma_l=\sigma_0 2^l\)),最低几层直接拟合高斯混合,其余层用单个 Gabor 混合联合拟合。优化基于图像空间可导渲染,损失是 L1 + SSIM 加上偏好小尺度、稀疏权重的正则,以及一个防混叠的频率正则 \(\mathcal{L}_{\text{freq}}=\sum_i \mathrm{sigmoid}(a(f_{0,i}-\phi_{\text{limit}}))\),仅在峰频接近奈奎斯特上限时才激活。由于 Gabor 不是合法概率分布、无法用 EM 热启动,作者借鉴 MCMC 式高斯优化,用随机梯度朗之万动力学向中心参数注入各向异性噪声促进探索,并把”死核”(权重低于阈值)传送到存活核旁重生以保持密度场基本不变。

实验结果

主实验是把多种体积资产从体素网格回归成原语混合,在相同原语数量下对比 Gabor Field 与高斯原语体积(Condor et al. 2025,用同一套管线重新回归以求公平)的层析回归质量。下表取论文报告的各资产平均值(WDAS Cloud 为 1/8 分辨率):

表示 PSNR↑ (dB) SSIM↑ L1↓ LPIPS↓ 平均原语数
Gabor Fields(本文) 49.39 0.9993 0.001695 0.0281 26,197
Gaussian(基线) 47.44 0.9988 0.002141 0.0306 26,197

在相同原语数下,Gabor Field 平均 PSNR 高约 2 dB,各项误差指标也更优,尤其在高频细节(如烟羽、火焰)上更清晰;代价是每个原语多存一个参数 \(\omega\),因此内存略高于高斯(如 Bunny 1.38 MB vs 1.25 MB),但相比原始体素网格(Bunny 578 MB)仍是数百倍压缩。渲染性能方面,在多重散射路径追踪下,相近方差与原语数时 Gabor Field 一般比高斯更快且质量更高;LOD 压力测试里 176 个各含 33,280 核的 Bunny(合计约 585 万原语)经按需过滤后有效原语降到约 76 万(缩小 7.7 倍),显著加速并消除锯齿。消融显示不透明度正则、中心重要性采样、频率正则对质量影响最大。凝视渲染约 1.96 倍加速、运动模糊约 1.78 倍加速。

亮点与局限

  • 亮点:
    • 把”频域局部性”这一 Gabor 核的固有性质直接转化为 LOD 能力——滤波 = 删核,零额外内存、层间连续,思路优雅。
    • 为各向异性 Gabor 核推导了沿任意光线段的闭式线积分与距离采样,使其真正能用于物理体渲染(单次/多次散射、正向/逆向路径追踪、层析)。
    • 频率与方向双重选择性带来一整套加速策略,且能把误差”引导”到特定空间频率上做感知友好的权衡。
    • 一个表示统一支撑 LOD、凝视渲染、运动模糊、程序化云生成等多种应用。
  • 局限:
    • 回归较慢(单张 RTX 4090 上 0.1–2 小时),且不同类别资产间需少量手调;作者坦言更理想的”前向”构造(类似小波/Gabor 变换)因 Gabor 不正交、无法构成完备无重叠的基而暂不可行。
    • 相比高度优化的体素网格实现,虽压缩率约 4300 倍且每样本方差更小,但渲染速度明显更慢——这是原语法压缩率/质量/速度之间的已知权衡。
    • 多重散射下的多数加速策略要靠引入偏差;OptiX 可见性掩码仅 8 位,限制了方向/频率分箱数量;极端低通时会出现浅密度”光晕”伪影。
    • 用于辐射场仍有视角依赖导致的根本困难(纯 Gabor 核可能朝向无贡献方向变成伪影),留作未来方向。

延伸思考

  • 这项工作把图像/纹理领域成熟的可导金字塔、Gabor 噪声思想迁移到了体积原语渲染,和 3D Gaussian Splatting 一系的”原语即表示”路线一脉相承,但把重点从重建质量转向了”频域可控性”这一常被忽视的维度。
  • “删核即滤波”的连续 LOD 若能解决前向构造问题(如 Transformer 前馈式点云重建来一次性产出金字塔),就有望摆脱昂贵的逐资产回归,成为体积资产的通用多分辨率格式。
  • 把误差按空间频率定向分配的能力,天然契合凝视渲染与后置去噪的联合优化——在有限样本预算下,先激进删核再靠感知模型/去噪补偿,可能是实时体渲染值得深挖的方向。
  • 辐射场版本一旦跑通(需要方向正则、中间帧监督或更好的剪枝),有望为原语式辐射场带来自然连续的 LOD,这是当前 3DGS 类方法仍缺的一环。