Towards Understanding Depth Perception in Foveated Rendering
Università della Svizzera italiana
一句话总结
这篇论文首次系统研究了注视点渲染(foveated rendering)中的外周模糊对立体深度感知的影响,通过心理物理实验建立了一个感知模型,得出结论:常用强度乃至约 2× 更强的外周模糊都不会损害立体视锐度(stereoacuity),甚至适度模糊还可能略微改善它。
研究背景
- 领域现状:注视点渲染利用人眼外周空间分辨率下降的特性,把算力集中到中央凹、降低外周画质,已被 Unity、Nvidia VRS 等图形 API 和 Meta Quest、Apple Vision Pro 等设备采用。其理论基础几乎都来自外周视觉的空间分辨率与模糊感知研究。
- 核心痛点:现有工作只关注外周的空间画质,却忽视了模糊对其他依赖亮度对比度的视觉线索(尤其是深度)的影响。立体视差是最基础的深度线索之一,而深度还原是视觉真实感的核心。以往研究分别测过”偏心度降低立体视锐度”和”模糊影响立体视”,但从未把二者放到注视点渲染这一同时发生的场景下联合考察。
- 本文 idea:设计一个宽频(broadband)刺激,在不同偏心度与不同模糊强度下定量测量可分辨的最小视差阈值,据此拟合一个连续感知模型,量化”不损害立体视锐度前提下能施加的最大模糊量”,并在自然场景中验证。
方法
整体框架
作者要拟合一个立体视锐度阈值曲面 \(T(\theta, \sigma)\),即在偏心度 \(\theta\) 和高斯模糊标准差 \(\sigma\) 下人能分辨的最小视差。整体流程是:设计一个环形随机点刺激并施加受控的深度起伏与模糊,用二选一强迫选择(2AFC)阶梯法测出各条件下的阈值,再用加权拟合得到心理测量曲线与最终的解析模型,最后在自然场景上做验证实验。
flowchart LR
A[环形宽频刺激<br/>随机点纹理+正弦深度起伏] --> B[受控变量<br/>偏心度θ / 模糊σ]
B --> C[2AFC 阶梯法<br/>Best PEST 测阈值]
C --> D[Weibull 拟合<br/>取75%点得 Tp]
D --> E[抛物线+指数拟合<br/>得连续曲面模型 M]
E --> F[自然场景验证<br/>Forest / Kitchen]
关键设计
-
刺激设计(隔离视差线索):刺激做成一个环形,能均匀覆盖整个视场方向。纹理用 50% 随机点图案,尺度按各偏心度下对比敏感度函数(stelaCSF)的峰值频率缩放,让立体匹配处于最优可感状态;深度用正弦起伏,其空间频率也取人眼最敏感的深度起伏频率(随偏心度移动)。环带边缘做随机抖动(dithering),并对每个 \(\sigma\) 预渲染并在模糊后恢复全动态范围,目的都是消除除双眼视差以外的单眼深度线索,从而单纯测量视差敏感度。
-
视差的人工诱导:左眼图不动,只在右眼图上按深度图对像素做水平重采样偏移来制造视差。生成公式为 \(I_R(u, v) = I_L(u + s(d) \cdot I_D(u, v), v)\),其中 \(s(d)\) 是由目标视差 \(d\) 决定的 UV 偏移量,\(I_D\) 是深度图。这样能精确控制呈现的视差大小。测量在三个偏心度进行:\(0^\circ\)(中央凹)、\(10^\circ\)、\(20^\circ\)(受头显仅支持 25° 内双眼视野限制),\(\sigma\) 从 \(0'\) 到 \(15'\)(20° 处额外加测 \(26.6'\)),共 19 个条件。
-
阈值估计:每个条件用 Best PEST 过程最多呈现 60 次,拟合一条改进的 Weibull 曲线取 75% 检测概率点作为阈值。由于概率范围是 0.5(瞎猜)到 1(全对),曲线形式为 \(F(x) = 1 - \tfrac{1}{2} e^{-(x/\lambda)^k}\)。用自助法(bootstrap)100 次得到阈值及其不确定度,相对不确定度大于 0.3 的测量当作离群点剔除(约占 20%)。
-
感知模型拟合:观察到阈值 \(T\) 随 \(\sigma\) 增大并非单调上升,而是先降后升,于是对每个偏心度拟合抛物线 \(p_1(\theta)\,(\sigma - p_2(\theta))^2 + p_3(\theta)\),其中 \(p_1\) 控制陡峭度、\(p_2\) 是最优模糊位置、\(p_3\) 是最低阈值。再用指数曲线 \(p_i(\theta) = a e^{b\theta} + c\) 在偏心度方向插值,得到覆盖 \(\theta \in [0, 20]\)、\(\sigma \in [0, 15]\) 的连续曲面 \(M\)。\(p_2\) 随偏心度升高向更大 \(\sigma\) 移动,说明外周能容忍更强模糊。
实验结果
主实验测得的模型给出了各偏心度下”立体视锐度最优的模糊量” \(p_2\) 与对应的最低阈值 \(p_3\)。下表汇总模型在三个测量偏心度处的关键取值(\(T\)、\(\sigma\) 单位为角分 \('\)):
| 偏心度 \(\theta\) | 最优模糊 \(p_2\)(视锐度最佳处的 \(\sigma\)) | 最低阈值 \(p_3\) | 趋势 |
|---|---|---|---|
| \(0^\circ\)(中央凹) | ~\(1.35'\) | ~\(0.16'\) | 阈值最低,几乎不受模糊影响 |
| \(10^\circ\) | \(5.41'\) | ~\(0.30'\) | 容忍更强模糊,视锐度更早达最优 |
| \(20^\circ\) | \(11.33'\) | ~\(0.92'\) | 容忍最强模糊,整体阈值抬高 |
核心结论:该模型给出的可容忍模糊量超过了文献中所有已报告的注视点模糊强度,说明常用注视点渲染的模糊完全不会损害立体视锐度,稳定立体视锐度的模糊上限约为传统做法的 2× 之高。此外,在最优模糊点之前去除高频(\(\sigma < p_2\))还会略微提升立体视锐度,作者推测这与去除混叠频率(Nyquist–Shannon 采样定理下的错误重建)导致的立体匹配错误有关,但去混叠所需的 \(\sigma\) 比实测最优值低约 50%,因此该假设不能完全解释现象,暗示存在超出混叠范围之外、仍干扰立体匹配的高频。
验证实验在 Forest 和 Kitchen 两个自然场景上进行(15 名被试),把画面左右两半分别用 0mm IPD(无视差)和可变 IPD(0–20mm)呈现,比较全分辨率(Org)与注视点渲染(Fov)两种风格下的 IPD 阈值。结果显示两种风格的阈值与变化率的均值、中位数都无显著差异(变化率约 0%,箱线图缺口重叠、95% 置信度下中位数无显著差异),证明注视点渲染没有损害复杂场景中的整体立体视锐度;但在复杂刺激上未能复现简单刺激里”适度模糊提升视锐度”的效应。
亮点与局限
- 亮点:
- 首次将”偏心度”与”外周模糊”联合放到注视点渲染场景下考察立体深度感知,填补了明确的研究空白。
- 刺激设计严谨,逐项按对比敏感度函数与深度起伏敏感度优化,尽力隔离出纯视差线索。
- 产出的感知模型形式简洁(抛物线 + 指数插值),可直接用于指导注视点渲染的模糊分配,并在自然场景上做了验证。
- 给出有实践意义的反直觉洞见:立体视对高频丢失出奇地鲁棒,深度线索的容错空间比空间画质大得多。
- 局限:
- 偏心度仅测到 \(20^\circ\)(受头显双眼视野限制),模型外推到 \(\theta > 20\) 时 \(p_1\) 斜率过陡需换成常数拟合,覆盖范围有限。
- 被试样本小且性别高度不均衡(主实验 11 人、10 男,含 2 名作者),测得阈值作者自陈只反映趋势而非绝对阈值。
- “适度模糊改善立体视锐度”的机制未被证实:去混叠假设与实测最优模糊量存在约 50% 的偏差,且该效应在复杂场景中无法复现。
- 只研究了立体视差这一种深度线索,运动视差、遮挡、调节等其他线索未涉及。
延伸思考
- 这项工作与作者团队此前关于注视点渲染中运动感知(speed estimation 会被模糊破坏并需后处理恢复)的研究形成对照:不同视觉线索对注视点模糊的敏感度差异很大,提示”降低空间画质不等于可以同等降低深度/运动等线索的质量”。
- 对系统设计的直接启示:在做注视点相关压缩时,深度图应与图像内容分开、谨慎压缩;displacement mapping、LOD 等依赖深度的渲染流程也不应默认被注视点模糊所掩盖。
- 最耐人寻味的开放问题是”为何去除可见极限以外的高频仍能改善立体视锐度”——若能厘清超出混叠范围之外仍干扰立体匹配的高频来源,或许能反过来主动操纵图像内容来增强空间感知,这对多焦/变焦显示、gaze-contingent 压缩都有潜在价值。