Journal

Towards Attention-aware Foveated Rendering

Brooke Krajancich, Petr Kellnhofer, Gordon Wetzstein

Stanford University; TU Delft

一句话总结

本文通过心理物理学用户实验,首次建立了”考虑注意力分配”的偏心率相关对比敏感度模型,证明当用户把注意力集中在中央凹任务时,外周视野的可容忍模糊程度显著提高,从而为注视点渲染带来更大的带宽节省空间。

研究背景

  • 领域现状:注视点图形(foveated graphics)利用人眼外周视觉的空间锐度衰减来降低 VR/AR 的渲染与传输带宽,其核心依赖偏心率相关的对比敏感度函数(CSF)模型,近年已有 StelaCSF 等统一模型覆盖空间/时间频率、偏心率、亮度、面积等多个维度。
  • 核心痛点:所有现有 CSF 模型的数据,都来自”要求被试把高度注意力隐蔽地投向外周判别任务”的实验。而真实世界与 VR/AR 中,人的注意力大多随视线显性投向中央凹,外周分到的注意力很少。因此现有模型系统性地高估了外周的感知能力,使得注视点渲染过于保守。
  • 本文 idea:把”隐蔽注意力(covert attention)”的调制效应纳入对比敏感度建模。通过在中央凹施加一个视觉负荷任务来强行”抢走”注意力,测量此时外周对比判别阈值如何抬升,从而拟合出注意力感知的 CSF 模型。

方法

整体思路是”先测量、再建模、后验证、终评估带宽”:用一个中央凹的快速视觉呈现(RSVP)任务作为注意力调制器,在不同注意力强度下测外周对比阈值,拟合成一个乘性修正因子叠加到已有 CSF 上,再在真实注视点渲染场景中验证其预测力。

flowchart LR
  A["中央凹 RSVP 任务<br/>低/中/高三档负荷"] --> B["外周 Gabor 对比判别<br/>测阈值 t_a(e)"]
  B --> C["拟合注意力阈值模型<br/>与注意力增益 g_a(e)"]
  C --> D["乘性修正现有 CSF<br/>S_a = S / g_a(e)"]
  D --> E["注视点渲染 + FovVideoVDP 验证"]
  E --> F["带宽/算力增益分析"]

关键设计:

  1. 用 RSVP 任务调制注意力:在中央凹注视点呈现一串 1°×1° 的红绿字母(每个持续 500/N 毫秒),要求用户报告唯一目标字母”T”的颜色。通过字母数 N(1/4/6)控制任务难度,对应”低/中/高”三档强制投向中央凹的注意力。难度越高,留给外周的注意力越少。

  2. 外周对比判别测量:在注视点左右两侧对称呈现 Gabor 光栅,用户判断两块的朝向是否一致(2AFC),配合 QUEST 自适应阶梯法测出对比判别阈值。为让不同偏心率下的基线阈值可比,用皮层放大因子把 Gabor 的空间频率与直径按 7°/14°/21° 缩放。

  3. 注意力阈值模型与增益:观察到阈值随偏心率近似线性抬升(带轻微畸变),用偏心率平方根拟合每档注意力的阈值曲线 \[t_a(e) = p_0 \sqrt{e} + p_1\] 再定义相对”低注意力”基线的注意力增益 \[g_a(e) = \frac{t_a(e)}{t_{\text{low}}(e)}\] 在正交性假设下,注意力感知敏感度即为现有 CSF 除以增益: \[S_a(e, \cdots) = S(e, \cdots)\,\frac{1}{g_a(e)}\] 其中 \(S\) 取 StelaCSF。文中还给出一个把注意力条件连续化 \(a_c \in [0,1]\) 的统一模型作为可选插值方案。

  4. 接入注视点渲染管线:以 Guenter 等人的线性最小可分辨角(MAR)模型 \(\omega(e) = m e + \omega_0\) 描述外周锐度衰减,斜率 \(m\) 作为可测阈值。把注意力模型作为正交缩放因子并入 FovVideoVDP 质量预测器,用来预测/优化各注意力条件下的可接受模糊强度。

实验结果

主实验测量了三档注意力下外周对比阈值相对”低注意力”基线的抬升倍数(threshold elevation / 注意力增益 \(g_a\)),是全文最核心的结论——注意力从外周撤离时,外周敏感度显著下降。

偏心率 低注意力(基线) 中注意力 高注意力
约 2× 更高
21° 3× 以上 约 4×

配对 t 检验显示中/高注意力下阈值随偏心率显著上升(\(p < 0.05\)),且各注意力档之间差异显著。有意思的是”中”与”高”两条曲线梯度非常接近,说明注意力调制效应是非线性的(从”低”到”中”变化剧烈,”中”到”高”趋于饱和)。

验证实验用与主实验不同皮层放大率、不同适应亮度的新刺激,证明注意力感知模型的阈值预测误差在几乎所有条件下都显著低于原始 StelaCSF。注视点渲染实验(30 名被试)进一步显示:注意力越集中于中央凹,可接受的 MAR 斜率越大(更激进的模糊也不被察觉),且并入本模型的 FovVideoVDP 预测与人类判断的一致性显著优于原版。带宽分析表明”低/中/高”三档全局平均 MAR 斜率分别为 0.0198 / 0.0420 / 0.0596,据此在高密度显示与大视场下可带来数倍到上千倍的采样密度增益。

亮点与局限

  • 亮点:
    • 首个把”注意力分配”这一高层认知因素纳入偏心率相关对比敏感度建模的工作,指出并纠正了现有 CSF 模型系统性高估外周感知的偏差。
    • 模型以简单的乘性正交因子形式接入,可直接叠加到任意现有 CSF(如 StelaCSF)与注视点渲染质量预测器(FovVideoVDP),落地成本低。
    • 三项递进的用户研究(阈值测量、跨条件验证、真实图像注视点渲染)加带宽分析,证据链完整。
  • 局限:
    • 不提供测量注意力的方法——隐蔽注意力难以用眼动仪直接测得,实际应用中如何在线估计用户注意力仍是开放问题。
    • 正交性假设并非处处成立,注意力增益随亮度升高有压缩趋势;模型不应外推到测量偏心率范围之外。
    • 未提出新的注视点渲染算法或压缩方案,仅演示感知效应;被试人数少(低层心理物理学常见)、未覆盖时间域效应。

延伸思考

  • 落地的关键瓶颈在”如何实时估计隐蔽注意力”。作者提示瞳孔扩张与注意力努力的关系、瞳孔光反射、以及眼动结合图像显著性等方向,若能形成可靠的在线注意力代理,本模型即可驱动自适应注视点渲染。
  • 该工作与显著性预测、任务驱动渲染、以及基于内容的注视点强度调节天然互补——实验已观察到不同图像内容对可接受模糊强度有显著影响,把内容相关的质量阈值校正与注意力模型联合,是提升带宽收益的自然下一步。
  • 训练与练习会改变人分配注意力的能力,长期使用 VR/AR 的用户其外周敏感度可能随之漂移,这为模型的个体化与自适应校准提出了更长期的研究命题。