Conference

Photoreal Scene Reconstruction from an Egocentric Device

Zhaoyang Lv, Maurizio Monge, Ka Chen, Yufeng Zhu, Michael Goesele, Jakob J. Engel, Zhao Dong, Richard A. Newcombe

Meta

一句话总结

针对第一人称设备(智能眼镜)拍摄的视频,本文通过视觉惯性捆绑调整(VIBA)获取高频、卷帘快门感知的相机标定,并把物理成像模型嵌入 3D Gaussian Splatting 的光栅化过程,在无需改动标准光栅化内核的前提下实现高动态范围、无噪声的照片级场景重建。

研究背景

  • 领域现状:以 NeRF 和 3D Gaussian Splatting 为代表的神经渲染,仅凭带位姿的图像就能重建高质量场景,天然契合轻量化的第一人称眼镜设备,已被广泛用于场景理解与空间 AI。
  • 核心痛点:现有方法通常直接采用设备视觉惯性里程计给出的帧率级 6DoF 位姿,把 RGB 相机当作全局快门相机处理。但头部高速运动下,卷帘快门相机的每一行像素曝光时刻不同,单一帧位姿无法刻画正确的像素运动;加之眼镜没有硬件防抖,低光下还叠加运动模糊与噪声,导致像素级重建精度不足、出现漂浮物与错位。
  • 本文 idea:从输入采集到重建算法系统性地解决第一人称传感问题——用 VIBA 得到卷帘快门感知的高频连续轨迹作为标定,再把卷帘快门、镜头渐晕、曝光增益等物理成像因素显式建模进高斯光栅化,并配合”短曝光欠曝拍摄”策略从噪声暗视频中恢复高动态范围场景。

方法

整体框架

系统分三段:先由设备的状态估计管线在 IMU 频率(约 1 kHz)上产出闭环连续轨迹,并在 VIBA 阶段对卷帘快门 RGB 相机做全局联合标定,输出逐行像素的精确时间戳与位姿;随后把这条高频轨迹和原始传感器模型(增益、曝光、渐晕)代入改造后的高斯光栅化成像方程完成重建;最后在采集端用短曝光策略压制运动模糊,把降噪交给重建损失自然处理。

flowchart LR
  A[第一人称设备原始视频<br/>RGB+双SLAM相机+双IMU] --> B[VIO 开环帧率轨迹]
  B --> C[SLAM 闭环+重定位]
  C --> D[VIBA 高频卷帘快门感知联合标定]
  D --> E[高频连续6DoF轨迹+逐行时间戳]
  E --> F[物理成像模型高斯光栅化]
  A --> F
  F --> G[高动态范围照片级重建]

关键设计

  1. 卷帘快门感知的 VIBA 标定:与直接套用 COLMAP 这类离线捆绑调整不同,VIBA 用卷帘快门模型联合全局快门 SLAM 相机做标定,在硬件无法提供准确触发时刻时把相机时间偏移也纳入优化,并在 IMU 频率上重估所有标定参数,使追踪点的重投影误差达到亚像素级。它给重建提供了现成系统所没有的”高频卷帘快门感知成像模型”,尤其能改善追踪点稀疏区域的标定质量。

  2. 高频位姿下的成像光栅化模型:把高频轨迹表示成可在任意时刻查询的分段连续位姿函数 \(T(t)=f_T(t)\) 。卷帘快门相机每一行像素有各自的异步曝光时刻,原始未畸变图像上满足 \(t(u)=t(0)+(\frac{u_h}{H})\cdot\Delta dt_r\) 。像素颜色由曝光区间内多次位姿采样的场景辐照度累积并经相机响应函数得到:\(C(u)=\phi(\omega(u)\int_0^{t_e}\pi(u,S,T(t(u)+t))dt)\) ,其中 \(\omega(u)\) 综合了模拟增益、镜头渐晕与归一化,\(\phi(\cdot)\) 为相机响应函数。

  3. 畸变兼容与运动采样:图像矫正后行号与曝光时刻的线性关系被破坏,使得依赖针孔假设的已有方法失效。本文为矫正图构造一张”行号比例查找表” \(R(u)\) ,把时间查询改写为 \(t(u)=t(0)+R(u)\Delta dt_r\) ,从而支持鱼眼等高阶畸变模型且无需改动通用光栅化内核。采样数量按场景稀疏深度的重投影误差自适应:保证半数重投影像素误差小于 1 像素,准静态视角只需 1 个位姿样本,快速运动时约需 8~16 个。前向批量光栅化、后向用 gather 汇聚,反传参与梯度的像素数与单图一致。

  4. 动态范围、模糊与噪声处理:场景颜色以 gamma 压缩的辐照度 \(c=\phi^{-1}(r)\) 编码(默认 gamma 2.2),避免线性空间在高动态范围场景下损害优化。对模糊,作者认为从模糊图恢复锐利细节在人体运动的稀疏采集下不可靠,转而在采集端用短曝光规避;对噪声,gamma 压缩后近似平方根变换可白化光子散粒噪声,直接由 L1/L2 重建损失吸收,无需额外去噪,标准 3D-GS 训练目标即可胜任室内场景。

采集侧受 HDR+ 启发:室内 150~300 lux 环境下把 RGB 曝光限制在最长 2 ms,用快曝光换取低模糊、可从噪声暗视频恢复无噪声高动态范围场景。

实验结果

主实验在 Digital Twin Catalog(DTC)数据集上评测,因其有精确 3D 对齐的真值,可同时衡量外观(PSNR)与几何(深度、法向)。深度用尺度不变 L1、法向用 L1 误差衡量。方法同时验证在 3D-GS 与 2D-GS 两种光栅化变体上,并逐项消融。

方法 PSNR↑ 深度误差↓ 法向误差↓
本文(3D-GS) 29.83 0.1505 0.3078
去掉运动采样 28.93 0.1769 0.3171
去掉 VIBA 28.52 0.1730 0.3274
去掉场景 gamma 28.76 0.1768 0.3236
splatfacto 基线 24.81 0.1749 0.6627
本文(2D-GS) 29.54 0.1474 0.1509

其余实验用文字补充:在自采的 Aria 室内外各 6 段场景上,本文相对 splatfacto 与 3DGS-on-move 两个基线在几乎所有场景的 PSNR/SSIM 上领先,基线普遍出现细节丢失与漂浮物;引入 VIBA 带来约 2~3 dB 的 PSNR 提升,运动采样再补约 1 dB,gamma 建模在高动态范围的室外场景增益更明显。在 Meta Quest 3 单段录制上,本文(3D-GS)取得 PSNR 29.54、SSIM 0.9147、LPIPS 0.2271,去掉 VIBA 或运动采样均一致下降,验证了方法可迁移到其他商用头显。

亮点与局限

  • 亮点:
    • 把物理成像因素以”连续轨迹上的位姿像素阵列 + 行号比例查找表”的方式接入光栅化,无需定制光栅化内核或改走光线追踪,可直接套用到 3D-GS、2D-GS 等广泛变体,并天然支持鱼眼等高阶畸变。
    • 从采集到重建的系统性方案,基于开源第一人称平台 Project Aria,数据、代码与录制配置公开,可复现;短曝光欠曝的采集策略巧妙地把”抗模糊”前移到硬件端,把”抗噪声”交给重建损失。
    • 一致地量化了 VIBA 与运动采样的独立贡献(各约 +1 dB 起),并在跨设备上得到相同结论。
  • 局限:
    • 假设静态场景,人体、阴影、光照变化与场景运动都未处理,限制了实际可扩展性。
    • 第一人称轨迹视角覆盖常不足,任意人类运动轨迹下的重建仍未解决,易出现伪影。
    • 极低光(低于 50 lux)下信号不足导致失败;对严重模糊本文选择回避而非直接从模糊图恢复,依赖采集端配合。

延伸思考

本文的价值在于点明了”标定精度”这一常被忽视的上游环节对下游神经重建质量的决定性影响——高频卷帘快门感知的位姿相比帧率级位姿能带来数 dB 的差距,这提示后续工作在追求更强表示之前,先审视输入位姿是否物理正确。方法把成像模型解耦成与光栅化内核无关的采样过程,思路上可迁移到未来的高斯变体乃至其他可微光栅化管线。若要突破静态假设,可结合动态高斯或稀疏视角先验来补偿第一人称视角覆盖不足;而极低光失败则更多受限于传感硬件,或需与原始 RAW 域 HDR 重建方法(如从噪声低动态范围输入恢复辐射场的路线)进一步结合,形成软硬件端到端的采集—重建协同设计。