Journal

Holographic Parallax Improves 3D Perceptual Realism

Dongyeon Kim, Seung-Woo Nam, Suyeon Choi, Jong-Mo Seo, Gordon Wetzstein, Yoonchan Jeong

Seoul National University; Stanford University

一句话总结

作者搭建了一套全彩、高画质的全息近眼显示感知测试平台,在自然观看条件下用用户实验系统比较了 2.5D、3D(RGB-D)、3D(光场)、4D 光场四类 CGH 监督格式,发现「携带视差线索」的光场全息在各种眼动/瞳孔条件下都显著更逼真,即便在眼盒中心也如此,从而给出「全息渲染应重建视差」的感知设计准则。

研究背景

全息近眼显示被视为下一代 VR/AR 的有力候选:它通过对光波复振幅的调制,能提供高分辨率的体三维图像,还天然支持像差矫正与视力矫正。近年来结合机器学习的计算全息(CGH)算法在画质上取得突破,使全息图像质量首次跨过了能开展稳健用户实验的门槛。

问题在于:现有 CGH 算法针对不同的目标内容格式做优化——有的用 2.5D 的 RGB-深度图、有的用 3D 焦栈(focal stack)、有的用 4D 光场——但这些评测几乎都基于「固定相机、理想视点」的拍摄结果。而真实的人眼并非静止相机:它不断转动、瞳孔大小随亮度收缩放大,且个体差异大。由于全息显示的眼盒(eyebox)尺寸有限、计算量大,很多算法只按中心视点近似三维场景,忽略了其他视点的表现。

这就带来两个核心问题:(1)为某一相机/理想视点优化出来的近似三维全息场景,在人眼自然观看下是否真的提供令人满意的三维体验?在当前有限的光学扩展量(étendue)下,这些近似造成的差异是否可被人察觉?(2)若要确定「最优三维格式」,需要满足什么条件才能跨过感知阈值?本文正是围绕这两个问题,首次在现代全息显示上做面向三维真实感的感知研究。

核心方法

四类 CGH 监督格式的比较

作者把 CGH 的监督目标按能表达的视觉线索强弱分为四档(见论文 Table 1),并用极线平面图(EPI)展示各格式在角度维度上携带的空间信息差异:

  • 2.5D(RGB-D 焦板 focal slab):单一法向视角,一条光线只有单点、无视角相关性,模糊/遮挡都是近似。
  • 3D w/ RGB-D(单视点 RGB-D 生成焦栈):一条光线可含多点,但焦栈由单张 RGB-D 图生成,容易过拟合中心视点,视差仍是近似。
  • 3D w/ LF(用密集光场生成焦栈):用 25×25 视角的光场生成焦栈,能自然处理遮挡、离焦模糊正确,但视角相关性仍近似。
  • 4D(光场 / 全息立体图):直接以 9×9 正交视角光场作为监督目标,唯一能正确重建遮挡、视差、镜面高光等视角相关效果的格式。

只有含视差线索的光场类格式(3D w/ LF、4D)能在眼盒范围内提供正确的视角相关信息。

眼盒-瞳孔的成像建模

作者先做仿真:把人眼瞳孔在眼盒平面上近似为一个二值低通滤波器,它对显示信号进行采样。通过改变瞳孔的位移(displacement)与大小(size)来模拟眼动和亮度变化,并用 PSNR、SSIM 与感知度量 FovVideoVDP(以 JOD 为单位,1 JOD 对应 75% 观察者能分辨的差异阈值)评估重建结果。

据此把观看情形分为两大类:

  • 过填充瞳孔(overfilled):人眼瞳孔小于眼盒。此时随瞳孔偏心,3D w/ LF 画质下降更明显,4D 的衰减更小。
  • 欠填充瞳孔(underfilled):人眼瞳孔大于眼盒。此时 3D w/ LF 在仿真度量上反而优于 4D。

仿真中一个关键观察是:用 PSNR/SSIM 比较时 4D 甚至可能不占优,但 FovVideoVDP 上 4D 在整个眼盒范围能超出约 1 JOD,说明传统 2D 图像度量会低估视差带来的感知收益。

感知测试平台与用户实验

作者搭建了单 SLM(1920×1200)、全彩激光二极管的桌面级全息近眼显示样机,配眼动仪实时记录并对齐被试瞳孔位置与大小。系统显示分辨率 1600×900,视场 18.6°×10.5°,最大分辨率 43 cpd(超过人眼 30 cpd 视锐度),眼盒 2.2 mm×1.1 mm(刻意设计得小于平均人眼瞳孔,以逼近最不利的欠填充场景)。用 24 帧二值 CGH 时间复用实现全彩去散斑。

实验用三段体三维场景(landscape_day、landscape_night、village),深度范围 0~9.57 D(从光学无穷远到眼前 11 cm),覆盖年轻人的调节范围,且诱发的眼视差超过中央凹的最小角分辨率。采用二选一强迫选择(2-IFC)范式,成对呈现刺激后让被试选「更真实的 3D」,用 JOD 标度累计投票。四种观看条件:

  • Center:瞳孔置于眼盒「甜点」,对应欠填充瞳孔;
  • Decentered / Vignetted:眼睛水平偏心约 1.25 mm / 2.5 mm;
  • w/ head movement:不限制头部运动。

所有条件都不限制眼动。共招募 28 名被试(离群分析后保留 26 人),每人 216 试次(6 对 × 3 重复 × 3 场景 × 4 条件)。

技术细节

  • 深度范围与视角数的关系:由光场采样定理,系统可表达的最大屈光度深度范围为

\[D_{max}=\frac{2N_u}{f\,(2N_u-f\lambda B_x^2)}\]

其中 \(f\) 为目镜焦距,\(\lambda\) 为波长,\(N_u\) 为角分辨率,\(B_x\) 为场景空间带宽。信号经低通滤波后深度范围变宽;但当场景带宽高达 30 cpd 时,需要更多视角才能保证一定深度范围。

  • Stiles-Crawford 效应:人眼对经瞳孔中心入射的光更敏感(视锥细胞方向敏感性),作者用瞳孔切趾(apodization)建模:

\[A(x_p,y_p)=A_o(x_p-x_c,y_p-y_c)\,10^{-p(\lambda)\left((x_p-x_c)^2+(y_p-y_c)^2\right)}\]

其中 \(A_o\) 为原始的圆形二值滤波器,\(p(\lambda)\) 为波长相关参数(仿真取 \(2.5\times10^4\))。该效应意味着即便瞳孔极大,视差图像也依然可被感知,因为切趾权重随偏移指数衰减。

  • 自由度、约束数与光学扩展量:作者把自由度定义为(可优化像素数 × 帧数),约束数定义为(目标像素数 × 视角数 × 平面数)。光场优化带来的真实感提升,本质源于其丰富的时空-角度信息转化为更多约束。三者之间存在紧约束权衡,而 étendue 扩展会进一步放大视差格式的优势。

实验结果

主用户实验(26 名被试)用两尾 z 检验分析 JOD 分数,结论清晰:

  • 4D 在全部四种观看条件下都显著优于其他所有格式,与 2.5D、3D w/ RGB-D 相比部分条件差异超过 1 JOD。
  • 3D w/ LF 显著优于 2.5D 与 3D w/ RGB-D,且在有头部运动的条件下优势更明显。
  • 2.5D 与 3D w/ RGB-D 之间在任何条件下都无显著差异——说明只加深度图而不加视差,几乎没有感知收益。
  • 眼动记录显示,即便限制头部,眼睛仍有大幅运动;实测平均瞳孔直径 4.5~5 mm(对应约 1 cd/m² 的低亮度),确认 Center 条件确为欠填充瞳孔。若亮度提高到常规 VR 的数百尼特,瞳孔更小,视差在过填充条件下的收益会被进一步放大。

一个有趣的「反转」:即使在瞳孔足够大覆盖眼盒的 Center 条件下,用 9×9 视角监督的 4D 仍胜过用 25×25 视角生成焦栈的 3D w/ LF——尽管该条件下仿真 VDP 仅 0.51 JOD(不足 1 JOD)。仿真度量与真实用户结果之间的差距,指向 3D 质量度量这一尚待开拓的研究方向。

需要多少视角? 第二个实验比较 3×3、5×5、7×7、9×9(经侧带滤波后有效视角 3×1、5×2、7×3、9×4)。24 名被试的结果显示:相邻视角数之间几乎都有显著差异,唯一例外是 village 场景的 7×3 vs 9×4(p=0.45)。原因可由深度分布解释:village 场景物体较集中于波前记录平面(WRP)附近深度,所需视角更少;深度分布越宽的场景需要越多视角。

贡献与局限

贡献

  1. 仿真了眼动、瞳孔大小波动、视网膜方向敏感性(Stiles-Crawford 效应)对全息三维场景感知的影响,揭示了「基于相机的评测」与「基于人眼的评测」之间的系统性差异。
  2. 搭建了全彩、高画质的全息近眼显示感知测试平台,并在多种观看条件下开展用户实验,确定了实现三维真实感所需重建的最优格式。
  3. 通过用户实验给出核心发现:支持视差线索的 4D(光场)CGH 在各种观看条件下(即便头动受限)都显著提升三维真实感,为「全息渲染应重建视差」提供了感知证据与设计准则。

局限

  • 未采用低层心理物理方法(如测定具体的辨别/检测阈值),因为需要海量密集采样的光场与 CGH 集,时间与内存开销过大。
  • 实验为单目全息显示,若用双目平台可结合双眼视差与视网膜运动得到更确定的结论。
  • 仿真 VDP 与用户实验之间的「真实感反转」无法仅靠亮度/对比度校准解释,暗示现有基于 2D 显示的感知度量不适用于三维内容,需要专门面向现代三维显示的感知度量。
  • 研究在有限 étendue(欠填充瞳孔)下进行;若扩展 étendue、增大眼动可能进一步放大视差格式的优势,但尚待验证。

延伸思考

这项工作的价值不在于提出新的 CGH 算法,而在于用严格的感知实验回答了一个方向性问题:全息显示到底要不要花代价去重建视差?答案是肯定的——哪怕在眼盒中心、瞳孔覆盖整个眼盒的「最不该看出差别」的情形下,视差依然带来可感知的真实感提升。这对全息渲染的算力分配是重要指引:与其在单视点上堆画质,不如把预算投向多视角/光场监督。

另一个耐人寻味的点是仿真感知度量(FovVideoVDP)与真实用户偏好之间的反转,说明当前建立在 2D 显示上的质量度量在评价「带完整深度线索的三维显示」时会失效。随着全息、光场、多焦面等能提供真实深度线索的显示逐渐成熟,构建面向三维内容、纳入眼视差与调节等阈值的新一代感知度量,可能是光学、图形学与视觉科学交叉的一片蓝海。