Journal

Collaborative On-Sensor Array Cameras

Jipeng Sun, Kaixuan Wei, Thomas Eboli, Congli Wang, Cheng Zheng, Zhihao Zhou, Arka Majumdar, Wolfgang Heidrich, Felix Heide

Princeton University; KAUST; University of Washington; Université Paris-Saclay

一句话总结

本文提出一种”协作式”片上超表面阵列相机:用 2×3 共 6 片超透镜各自负责可见光谱的不同片段,通过分布式大规模端到端优化(1 亿个纳米柱参数)联合设计光学与重建算法,在超薄形态下实现全可见光谱高质量成像,且不依赖生成式先验、无幻觉。

研究背景

  • 领域现状:超表面(metasurface)用亚波长纳米结构调控波前,被视为替代笨重折射光学的潜力方案;近年出现了用单片超透镜或超表面阵列贴近传感器的”平板计算相机”。
  • 核心痛点:超透镜本质上是强色散光学,波长依赖导致宽带成像时色差严重、分辨率与视场难以兼顾。此前最成功的宽带超光学成像方法(Chakravarthula 等)受限于巨大的参数空间,只能优化中心透镜、周边透镜靠叠加楔形相位启发式扩展视场,成像退化明显,还需依赖生成式模型恢复图像,带来”幻觉”风险(例如把书上的 ‘86’ 复原成 ‘65’)。
  • 本文 idea:基于两点观察——单片超透镜在窄带内可有良好聚焦;多张以不同方式光学编码的测量可协作融合出高质量结果。于是让阵列中每片透镜负责互补的光谱片段,联合优化并用非生成式的协作重建把它们融合成一张全光谱清晰图像。

方法

整体框架:系统分为”设计阶段”与”重建阶段”。设计阶段建立一个可微、随视场空变的成像模型(含超透镜神经代理),对 6 片超透镜相位与其点扩散函数(PSF)联合优化,配合多图联合去卷积;由于 1 亿参数 × 上百个波场条件的显存需求高达约 2 TB,采用分布式元光学训练框架完成。重建阶段先做视差对齐,再用同一套多图联合去卷积加上一个可学习去噪器,恢复出单张清晰图像。

flowchart LR
  A[入射波场 波长+入射角] --> B[超透镜神经代理<br/>结构→宽带相位]
  B --> C[空变角度相关 PSF]
  C --> D[6 片阵列测量 v_k]
  D --> E[两阶段视差对齐<br/>单应矩阵+RAFT光流]
  E --> F[联合维纳去卷积<br/>SNR 加权协作融合]
  F --> G[噪声感知去噪网络]
  G --> H[全光谱清晰图像]

关键设计:

  1. 结构到相位的神经代理:超透镜由高 1000 nm 的氮化硅纳米柱构成,占空比 \(d=D/P\)(柱宽与 350 nm 间距之比)决定相位响应。以往用多项式代理拟合”占空比—波长—宽带相位”的关系,无法收敛到 1% 误差以内。本文改用三层全连接 ReLU 网络代理 \(\Phi_{\lambda_t}(d)=N_{proxy}(d,\lambda_t)\ \mathrm{mod}\ 2\pi\),训练数据来自 FDTD 仿真,能准确刻画高度非线性的宽带相位映射,同时保持整条管线可微。

  2. 协作阵列与联合维纳滤波:这是”协作”的核心。作者把经典维纳滤波推广为多图联合形式——分母是 6 片 PSF 模值之和而非单片,因此每片滤波在去卷积时”知道”其他片的存在,各片按自身信噪比在傅里叶域加权贡献。这一设计放松了对单片透镜”全谱都要好”的苛刻要求,转而促成互补协作,整体宽带重建质量更高。由于商用 RGB 传感器拿不到逐波长的高光谱测量,作者进一步用相机光谱响应函数(CSRF)加权的宽带平均 PSF 与 RGB 图做近似实现。

  3. 光谱无关训练:不去估计场景光谱,而是训练一个对光谱鲁棒的光学设计。每次迭代随机采样少量波长(成像用 3 个、构造去卷积 PSF 用 108 个)合成测量并恢复,使阵列对真实世界各种光源都稳健。

  4. 分布式大规模元光学优化:中间张量比模型参数大两个数量级,单卡放不下。作者基于 PyTorch FSDP(全分片数据并行)把波场(不同波长与入射角)和模型分片到多卡,用 all-gather 汇聚各卡 PSF 形成全局宽带 PSF、用 all-reduce 汇总全局损失,构成端到端可微的大规模元光学训练框架(实际用 36 张 H100 训练)。

  5. 视差对齐与噪声感知去噪:阵列各子孔径从略不同视角成像存在视差。先用 ChArUco 标定的单应矩阵做粗对齐,再对(先去卷积过的)图用预训练 RAFT 光流做稠密精对齐。融合后的联合维纳滤波是高通操作会放大噪声且噪声随光谱变化,故设计噪声估计子网先预测方差图 \(\hat{\sigma}=N(\hat{u}_{fused})\),再由条件去噪子网 \(\hat{u}=D(\hat{u}_{fused},\hat{\sigma})\) 做非盲去噪。

实验结果

主实验是在真实高光谱数据集上、连续宽带照明(400 至 700 nm,1 nm 采样)下与两种既有平板超光学方法的重建质量对比。既有方法只在其被优化的离散波长处表现尚可,一旦进入连续宽带就因未优化波段信噪比低而明显退化;本文协作设计在全谱上稳健领先。

方法 SSIM↑ PSNR [dB]↑ 1-LPIPS↑
Tseng 等 2021a 0.72 25.92 0.55
Chakravarthula 等 2023 0.80 27.34 0.62
本文(Proposed) 0.95 34.03 0.87

其余关键结果:消融实验表明空变去卷积、视差对齐、联合去卷积、噪声估计四个模块各自不可或缺,去掉任一模块 SSIM/PSNR/LPIPS 均下降(完整管线 SSIM 0.67 / PSNR 21.14 dB / 1-LPIPS 0.52,其中去掉联合去卷积退化最重)。真实原型(2×3 阵列、3.6 mm 焦距、50°×50° 视场)在室内外多种光照下重建质量与色彩接近约 50 mm 长的传统多组元参考相机。与依赖扩散先验的 Chakravarthula 等相比,本文既更准确又无幻觉内容,且重建实时运行在 35 FPS,比其扩散模块快约 2000 倍。

亮点与局限

  • 亮点:
    • “协作阵列 + 联合维纳滤波”的思路巧妙——不强求单片全谱最优,而让多片按信噪比互补,从根上规避单片超透镜的带宽极限。
    • 非生成式重建,实时(35 FPS)且无幻觉,相较扩散先验方法在安全性与速度上都有明显优势。
    • 把 FSDP 分布式训练引入元光学,首次支持 1 亿参数、上百波场、含离轴角度的端到端联合优化,突破了以往显存受限只能优化中心透镜/离散波段/仅轴上的局面。
    • 物理仿真到真实原型验证链条完整,附带高光谱视差合成数据集与真机采集。
  • 局限:
    • 仍需计算重建才能出图,无法像传统折射相机那样直接成像。
    • 作为研究原型保留了较厚的传感器盖玻璃,限制了内部挡光结构高度与焦距进一步缩短,且为避免串扰需非连续的子透镜排布,从而增大所需传感器尺寸、降低整体集光效率。
    • 重建时间瓶颈在稠密光流(约占 60%),依赖 RAFT 等预训练模型。

延伸思考

  • 协作式”各管一段光谱、再联合融合”的范式,可能迁移到其他强色散/强像差的计算光学系统(如衍射光学、折衍混合镜头),也让人联想到多帧/多曝光融合的思想在光学域的对应。
  • 阵列天然带有角度复用,作者指出可直接从原始测量做深度估计,向轻量深度相机方向延伸值得关注。
  • 若把神经代理扩展到角度与波长相关的透过率、并去掉径向对称约束,有望解锁更高数值孔径的元光学应用;反过来若接受径向对称假设则可用一维衍射模型大幅省显存,这是设计空间与算力之间的可调权衡。
  • 论文给出的智能手机化设想(2×2、1.5 mm 元件、5 mm×5 mm 占地、60° 视场)指向实际落地路径,但其可行性还有赖于 ISP 硬件、光流网络剪枝与去噪蒸馏等工程优化。