Journal

The Shortest Route is Not Always the Fastest: Probability-Modeled Stereoscopic Eye Movement Completion Time in VR

Budmonde Duinkharjav, Benjamin Liang, Anjul Patney, Rachel Brown, Qi Sun

New York University; NVIDIA

一句话总结

本文通过大规模心理物理实验(12,000+ 次注视试验),提出首个可操作的概率模型,预测在立体 VR 中把视线移动到 3D 目标所需的”完成时间”分布,并揭示了”最短路径未必最快”这一反直觉现象。

研究背景

  • 领域现状:人眼在 3D 空间中改变注视点,主要靠两类运动——快速一致、方向性的扫视(saccade),以及缓慢不一致、改变深度的聚散(vergence)。视觉科学对扫视已有成熟的时间模型(主序列 main sequence),但对聚散运动、尤其是二者叠加的联合运动,至今没有统一的神经学理论。
  • 核心痛点:VR/AR 头显同时解锁了扫视与聚散两类运动,但由于缺乏对联合运动定量规律的理解,设计者无法回答”用户把视线移到某个 3D 目标要花多久”这类对界面布局、注视点渲染至关重要的问题。人眼行为本身的随机性与眼动追踪噪声进一步加大了建模难度。
  • 本文 idea:绕开”聚散运动神经机制是什么”这一未解难题,采取操作化(operational)思路——不关心眼动的中间轨迹,只关心”双眼何时落到目标上”;并且不做确定性预测,而是用概率分布刻画其中的噪声与个体差异。

方法

整体框架:先在宽视场立体 VR 中做心理物理实验,测量在不同聚散幅度 \(\Delta\alpha_v\) 和扫视幅度 \(\Delta\alpha_s\) 组合下的注视完成时间(offset time);再对每个实验条件用 ExGauss 分布拟合其时间分布,最后用径向基函数把稀疏采样的分布参数插值成一个连续、可微、可对任意 3D 眼动做预测的模型。

flowchart LR
  A["立体 VR 心理物理实验<br/>12,672 次试验"] --> B["按条件拟合<br/>ExGauss 分布 (MLE)"]
  B --> C["RBF 插值<br/>μ σ τ 三参数"]
  C --> D["端到端可微模型<br/>预测任意 Δα 的完成时间分布"]
  D --> E["解析求最优扫视幅度 / 优化 UI 深度"]

关键设计:

  1. 用两个角度参数化 3D 注视位置。把横断面上任意注视点用聚散角 \(\alpha_v = \alpha_l - \alpha_r\)(左右眼视线夹角,编码深度)和扫视角 \(\alpha_s = (\alpha_l + \alpha_r)/2\)(左右眼平均方向,编码方向)联合表示。一次眼动即位移向量 \(\Delta\boldsymbol{\alpha} = (\Delta\alpha_v, \Delta\alpha_s)\)。实验受硬件限制,把范围约束在 \(\alpha_v \le 8.4^\circ\)、\(\alpha_s < 15^\circ\),且只研究位移量、忽略初始位姿。

  2. 只测”何时落到目标”而非轨迹。完成时间定义为从目标出现到双眼都稳定落在目标上的时长。判定要求左右眼角速度都低于 \(5^\circ/\text{sec}\),且各自方向落在目标 \(1^\circ\) 以内。这一整体化定义规避了消费级眼动仪精度不足、难以可靠分辨聚散中间过程的问题。

  3. 用 ExGauss 分布刻画偏斜的时间分布。观测到的完成时间呈正偏态,故选用指数修正高斯分布,其概率密度为

\[f_T(t; \mu, \sigma^2, \tau) = \frac{1}{2\tau} e^{\frac{2\mu + \sigma^2/\tau - 2t}{2\tau}} \operatorname{erfc}\!\left(\frac{\mu + \sigma^2/\tau - t}{\sqrt{2}\sigma}\right)\]

三个参数 \(\mu, \sigma, \tau\) 分别控制位置、展宽与偏斜。对 19 组条件各自用极大似然估计拟合参数。

  1. RBF 插值 + 梯度下降回归成连续模型。用 \(M=4\) 个高斯核径向基对每个 ExGauss 参数做插值,例如 \(\hat{\mu}(\Delta\boldsymbol{\alpha}) = \sum_i^M w_i^\mu \varphi(\varepsilon^\mu \lVert \Delta\boldsymbol{\alpha} - \boldsymbol{c}_i^\mu \rVert)\),核为 \(\varphi(r) = \exp(-r^2)\)。整个模型可微,因此可解析地求出让完成时间期望最小的”最优扫视幅度” \(\Delta\alpha_s^* = \arg\min_{\Delta\alpha_s}(\hat{\mu} + \hat{\tau})\)。

实验结果

核心发现之一是联合运动的完成时间随扫视幅度呈非单调的”U 形”:在发散(divergent)条件下,纯聚散最慢,加入适中扫视反而能”加速”聚散,但扫视过长又会因行程增加而变慢——即”最短路径未必最快”。下表为消融实验,验证联合建模(同时用聚散与扫视幅度)相比只用单一维度的必要性(KL 散度越低越好):

模型配置 输入信息 KL 散度↓
FULL(本文) 聚散 + 扫视幅度 .172
VER 仅聚散幅度 .236
SAC 仅扫视幅度 .444

其余关键结论:纯扫视平均完成时间 \(.37 \pm .12\) s,明显快于纯聚散 \(.59 \pm .15\) s,联合运动居中(\(.48 \pm .16\) s);泛化实验中,对留一法划分的未见用户和随机划分的未见试验,K.S. 检验均 \(p > .99\),无法拒绝”模型预测与真实数据同分布”;在射箭、篮球、自然户外三个真实场景、12 位未见被试上,模型预测与实测在各条件、各被试、各场景均通过 K.S. 检验,且再次复现了 \(C_m < C_l < C_s\)(中距离最快)的 U 形反直觉规律。

亮点与局限

  • 亮点:
    • 首个针对立体 3D 联合眼动完成时间的可操作概率模型,绕过了尚无定论的神经机制争议直接服务图形学应用。
    • 实验规模扎实(主实验 12,672 试验 + 验证实验 7,776 试验),且给出对未见用户/试验/场景的严格泛化验证。
    • 模型端到端可微,可直接用于解析优化,落地了 VR 游戏难度评估、车载 HUD / AR 界面最优投影深度(如户外 KITTI 2.5 m、室内 1.3 m)等应用。
  • 局限:
    • 只建模位移量 \(\Delta\boldsymbol{\alpha}\),忽略了初始注视深度与偏心度,而这些确实会影响完成时间。
    • 受 VR 显示限制,聚散范围保守(\(\le 8.4^\circ\)),且未建模透视式 AR 中调节(accommodation)带来的延迟。
    • 未刻画头动与眼动的协同,也刻意剔除了反应时间中的图像相关变量(对比度、空间频率、认知负荷等)。

延伸思考

  • 该模型把”人眼把视线移到 3D 目标要多久”变成了一个可微、可优化的量化指标,天然适合与注视点渲染、动态兴趣区调度结合——例如根据预测的完成时间分布来安排何时对目标区域提升清晰度。
  • “最短路径未必最快”的 U 形规律提示:VR/AR 的 UI 布局不应只按屏幕角距离最短来排布,而应把深度切换的代价一并纳入,这对车载 HUD、手术导航等对反应时间敏感的场景尤其重要。
  • 把 ExGauss + RBF 这套”分布拟合 + 可微插值”的框架推广到其他带噪声的人因行为(如反应时间、指点误差)建模,可能是一条通用的路径;后续若能补上初始深度、调节、头眼协同等维度,有望形成更完整的 3D 视觉性能度量体系。