Journal

Modeling and Exploiting the Time Course of Chromatic Adaptation for Display Power Optimizations in Virtual Reality

Ethan Chen, Sushant Kondguli, Carl Marshall, Yuhao Zhu

University of Rochester; Meta

一句话总结

本文提出一种无需眼动追踪的 VR 省电方法:利用人眼”色适应”(chromatic adaptation)需要时间才能完成这一特性,在场景中缓慢地把光源从 D65 白点平移到一个省电(偏绿/偏红)的色调,在可控的感知损失预算内让用户几乎察觉不到变化,从而把 OLED 显示功耗降低约 31%。

研究背景

VR 设备功耗紧张,而随着分辨率与刷新率提升,显示屏在总功耗中的占比越来越高,是省电的首要目标。OLED 显示功耗与像素颜色强相关——蓝色子像素通常比红、绿更耗电,因此把画面颜色整体推离蓝色就能省电。

一个已知的可利用现象是”色适应”:人的视觉系统会自动缩放各类视锥细胞的敏感度,使得在不同光照下对中性色(白)的感知保持稳定,就像”折算掉”了光源本身的颜色。于是一个自然的想法是:在虚拟场景里把光源从参考白点 S 换成另一个更省电的光源 T,同时对像素做色适应变换,让画面在感知上等价于原图,但功耗更低。

难点在于色适应不是瞬时的——人眼要几分钟才能完全适应新光源。已有工作(PEA-PODs 中的 whitepoint shift)把光源变换瞬间施加,忽略了适应的渐进性,因而产生可见瑕疵。此外,之前研究色适应时间进程的工作要么依赖主观、有文化差异的”颜色命名”任务,要么受限于固定的短时窗(如 10 秒),无法建模”适应状态如何随时变光源而变化”,也无法探明人能适应到的光源边界。本文正是要补上这一模型,并把它用于省电优化。

方法

整体分为两条主线:先找出”哪些光源省电”,再建立”适应状态随时间如何变化”的心理物理模型,最后把两者结合成一个求解最优光源平移轨迹的优化问题,并在真机上实现。

关键设计 1:识别省电光源

作者把”目标光源 T 的平均显示功耗”建模为三步。首先,对场景中每个线性 sRGB 颜色 c,用色适应变换(CAT)从 D65 适应到 T,得到 \(c_T = f_{D65 \to T}(c)\)。其次,OLED 显示某颜色的功耗建模为各通道值的线性组合加静态功耗:\(p(c_T) = \mathbf{p}_{disp}^{T} \cdot c_T + p_{static}\),其中 \(\mathbf{p}_{disp}\) 为各通道单位功耗向量(由真机测量回归得到)。最后,用大规模自然场景数据集 Places365 统计颜色分布作为权重,估计平均功耗:

\[ P(T) = \sum_{c}^{N} p(c_T) \cdot W_c \]

其中 \(N = 256^3\) 为 8-bit sRGB 颜色总数,权重归一化到和为 1。在整个可见色域上扫描 T,发现偏绿和偏红的光源能省电:一方面色适应会把其他颜色也整体推向红/绿,另一方面该 OLED 的蓝色子像素功耗约为红绿的两倍,推离蓝色即降功耗。

关键设计 2:用微分方程建模适应状态时间进程

核心概念是”适应状态” \(a(t)\),即用户此刻内心认定为”白”的颜色(内部白点);场景实际光源记为 \(A(t)\)。作者借鉴并扩展经典 Weber 定律,用一阶常微分方程描述适应状态的变化速率:

\[ a'(t) = \frac{da(t)}{dt} = k_1\,(k_2 A(t) - a(t)) \]

直觉是:适应速率与”当前内部白点和实际光源之差”成正比——光源越偏色,适应越快。\(k_1\) 是适应速率系数;\(k_2 \in [0,1]\) 是适应完整度系数,用来刻画”部分适应”(人永远无法完全适应过于偏色的光源):当 \(k_2 = 1\) 时最终会完全适应,\(k_2 < 1\) 则只能部分适应。

关键设计 3:用最大似然估计”隔空”测量适应状态

难点是无法”冻结时间”直接测 \(a(t)\),因为测量本身会让适应状态漂移。作者设计了一个二选一强迫选择(2AFC)任务:在模拟自然场景功率谱的粉噪声背景(缓慢偏色)上,同时闪现两个沿光源轨迹排布、相距 6 JND 的色块——一个”更靠前”(further)、一个”滞后”(lagging),让被试选哪个更接近中性(无彩色)。用户越倾向选某块,说明其适应状态越靠近该块。

用逻辑斯蒂心理测量函数描述”选滞后块”的概率:

\[ G(m - a;\,k, x_0) = \frac{1}{1 + e^{-k(m - a - x_0)}} \]

其中 \(m\) 是两色块中点。每位被试先在恒定 D65 下做校准阶段(此时 \(a(t)\) 恒为 D65)拟合出个人的 \(k, x_0\)。有趣的是校准发现,很多人在两块等距时并非各 50% 概率,存在内在偏好,该函数正好能捕捉这一偏置——这也否定了前人”无彩色点对应 50/50”的假设。

随后在测量阶段,边平移光源边持续做 2AFC,用最大似然估计求解 \(k_1, k_2\):

\[ \arg\max_{k_1, k_2} \prod_{t \in \mathcal{L}} G(m(t) - a(t; k_1, k_2);\theta) \cdot \prod_{t \in \mathcal{F}} 1 - G(m(t) - a(t; k_1, k_2);\theta) \]

\(\mathcal{L}\)、\(\mathcal{F}\) 分别是选择滞后块和更靠前块的时间步集合。

关键设计 4:三相测量协议

为稳健分离 \(k_1\) 与 \(k_2\),光源轨迹 \(A(t)\) 设计成三相分段线性函数:第一相从 D65 以速度 \(v\) 沿方向 \(\phi\) 平移到距 D65 为 \(D\)(取 6 JND)的终端光源;第二相在终端光源保持 \(t_1\);第三相瞬间跳回 D65 并保持 \(t_2\)。若只用第一相,\(a(t)\) 近似线性,一个自由参数就能拟合,\(k_1\) 与 \(k_2\) 无法分离;加入保持相后,\(a(t)\) 趋近 \(k_2 D\),从而隔离出 \(k_1\)。对该分段 \(A(t)\) 可解析求解微分方程得到 \(a(t)\) 的闭式表达。研究招募 9 名被试,每人约 10 小时,测四条轨迹(三条不同角度直线 + 日光轨迹)× 三种速度。

关键设计 5:功耗优化与实现

目标是在感知约束下最大化稳态省电。用 \(A(t)\) 与 \(a(t)\) 在色度空间的距离量化感知损失,优化问题为:

\[ \arg\min_{A(t)} P(A(t_{max})) \quad \text{s.t.} \quad \max_{0 \le t \le t_{max}} [A(t) - a(t)] \le \Delta T \]

即要求光源在 \(t_{max}\) 内平移到终端,且全程内部白点与实际光源之差不超过允许阈值 \(\Delta T\)。由于对线性轨迹 \(A(t) - a(t)\) 单调递增,约束简化为只看终点;又因走得越远越省电,问题化为在四条实测轨迹上分别求最优恒定速度,并可解析给出最优 \(v\)。

作者在 Meta Quest Pro 上用 ShaderLab 片元着色器 + C# 导演程序实现:导演按最优的 1.47 弧度轨迹在两分钟内插值出当前光源,着色器用线性 Bradford CAT 对每个像素做变换。计算极轻——90 FPS 下约 7.5 GFLOPs,占移动 GPU 算力不到 0.6%。

实验结果

作者提出的方法称为 Gradual Chromatic Adaptation(GCA),在前两分钟渐进平移光源后稳定。验证研究招募 20 名新被试,用 5 段全景视频,在相同功耗预算(\(\Delta T = 5\) JND,约 31% 省电)下比较各方法被察觉瑕疵的概率,用广义估计方程做统计检验。对比方法包括瞬时色适应(ICA)、亮度滚降(BR,需眼动追踪)、渐进均匀调暗(GUD)以及 GCA+GUD 组合。

拟合得到的四条轨迹系数如下(日光轨迹的 \(k_1, k_2\) 最高,印证人对日光适应更快更完整):

第一相轨迹 \(k_1\) \(k_2\)
日光轨迹 0.127 0.712
直线 @ 1.470 弧度 0.101 0.685
直线 @ 1.863 弧度 0.107 0.638
直线 @ 2.256 弧度 0.069 0.707

信号检测理论给出的可辨识指数 \(d'\)(越接近 0 越难被察觉):

方法 平均 d’ 命中率 虚警率
GUD + GCA 0.035 23.9% 20.6%
GUD 0.209 25.9% 17.0%
GCA 0.424 31.9% 17.0%
ICA 0.909 49.1% 17.0%
BR 1.728 70.1% 12.5%

关键结论:GCA+GUD 组合是唯一在统计上与对照组无显著差异的方法(\(p = 0.213\)),说明色适应省电与亮度调暗互补,组合后 31% 省电几乎无感知损失。GCA 显著优于瞬时色适应 ICA(\(p < 0.005\)),证明渐进平移的必要性;GCA 与 GUD 无显著差异。BR 因眼动追踪功耗(假设 100 mW)在同等功耗预算下表现最差。此外,令人意外的是直线 1.47 弧度轨迹在功耗-感知权衡上 Pareto 优于常用的日光轨迹。功耗对 \(t_{max}\) 和 \(\Delta T\) 的敏感度分析显示存在明显的边际递减,因为时间足够长后瓶颈从适应速率 \(k_1\) 转为适应完整度 \(k_2\)。

亮点与局限

亮点:

  • 提出建模”动态时变光源下适应状态时间进程”的新心理物理范式,用 2AFC + 最大似然估计”隔空”测量适应状态,避开了颜色命名任务的主观性与短时窗限制。
  • 无需眼动追踪即可省电,规避了眼动追踪本身的功耗开销,且着色器实现极轻量(<0.6% GPU 算力)。
  • 发现日光之外的直线轨迹(1.47 弧度)反而更优,拓展了此前主要局限于日光轨迹的认知。
  • 组合 GCA+GUD 实现 31% 省电且感知上与原始视频无统计差异。

局限:

  • 模型假设心理测量函数只依赖 \(m - a\) 距离而非绝对适应状态,且 \(k_2\) 在给定轨迹下恒定、跨三相通用;更精确的做法是把 \(k_2\) 参数化为 \(A(t)\) 甚至光源历史的函数。
  • 色适应本身随亮度变化,而本研究在恒定亮度下建模,GUD+GCA 在调暗时沿用单一亮度的适应模型,是三名被试更易察觉组合条件的原因之一;参数为群体级回归,个别人可能需要个性化。
  • 假设原始场景白点为 D65、光照相对稳定、且 VR 使用不中断;若摘下头显重新暴露于环境光则需重启适应,动态光照场景需扩展。
  • 仅实测四条轨迹,插值/外推到更多轨迹需要更多数据,而每条轨迹每人需 10 小时以上采集成本高。

延伸思考

这项工作的巧妙之处在于把一个纯感知科学问题(适应状态如何随时变光源演化)转化为可解析、可优化的工程模型,再落到真机着色器上,形成”科学建模 → 优化 → 部署”的完整闭环。相比依赖眼动追踪或瞬时变换的省电方案,它把”人眼适应需要时间”从障碍变成了可利用的资源。

顺着作者指出的方向,几个值得推进的点很清晰:把适应模型扩展到不同亮度层次(这对与调暗结合至关重要),引入光源暴露历史与个性化参数以覆盖那些更敏感的用户,以及把色适应与颜色中央凹渲染(color foveation)联合起来同时利用两种感知冗余。更大的想象空间在 AR——真实世界光照持续调制色觉,色适应对省电与准确色彩复现都更关键,而其前提是成熟的光照估计。随着 AR 工具链光照估计日益成熟,这类把人眼时间特性纳入渲染管线的技术有望真正落地。