Thin On-Sensor Nanophotonic Array Cameras
Princeton University; University of Washington
一句话总结
用一片贴在传感器盖玻璃上、仅 700 nm 厚的超表面(metasurface)透镜阵列取代传统的多片镜头堆栈,配合一个基于扩散模型先验的概率式重建算法,做出一台能在真实户外宽波段光照下成像、视场角达 100° 的超薄计算相机。
研究背景
- 领域现状:手机等商用相机为了矫正像差(偏离高斯线性光学模型的畸变),要堆叠越来越多的透镜元件,光学系统的高度和重量因此难以缩小(iPhone 13 的镜头堆栈超过 7 片、约 8 mm 长)。超表面元光学(metaoptics)用亚波长纳米散射体阵列调制波前,器件厚度只有一个光波长量级,是压缩体积的有希望方向。
- 核心痛点:现有超表面成像质量远不如折射镜头——超表面天生是色散的(衍射光学的通病),设计波长以外会出现相位缠绕不连续,产生严重色差;三阶像差(彗差、场曲、畸变)在设计中根本没被考虑;小孔径(约 50–100 μm)限制了角分辨率和进光量。此前最成功的宽波段方案(Tseng et al. 2021 的 Neural Nano-Optics)也只能做到 40° 视场、面向 OLED 三色窄带、且分辨率只有几千像素,出了实验室就严重模糊。
- 本文 idea:不去硬造一片又大又全能的超透镜,而是把”大视场 + 宽波段聚焦”这个联合优化难题拆解为一个由多枚小视场斜置透镜(skewed lenslets)组成的阵列,每枚各管一块视场,再用一个概率式学习重建把阵列的多幅子图恢复并拼合成一张百万像素图。
方法
整体框架分两大块:前端是一个可微设计的片上超表面透镜阵列(3×3),把不同入射视场的光学调制分摊到各个子透镜上,用连续光谱采样的随机梯度优化学出相位剖面;后端是一个概率式反卷积重建,把物理成像前向模型与扩散模型自然图像先验交替迭代,逐个子孔径去卷积再融合成宽视场大图。
flowchart LR
A["场景光"] --> B["片上超表面阵列 3x3 斜置超透镜"]
B --> C["传感器阵列测量 9 幅子图"]
C --> D["逆滤波 数据保真项"]
D --> E["扩散先验 采样自然图像流形"]
E --> D
E --> F["融合网络 拼合去畸变"]
F --> G["百万像素宽视场图"]
关键设计:
-
把透镜看作棱镜的组合:一枚透镜可近似为一系列无穷小楔形棱镜的堆叠——中心处表面平行不产生偏折,越靠边缘楔角越大、偏折越强,从而聚焦。作者据此把光学层设计为”小透镜相位 + 楔形相位”的协同优化:楔形相位负责把视场扩到边缘(斜置各子透镜指向不同视场),小透镜相位负责缩短后焦距(只要 2.5 mm 后焦距,而单片折衍射方案往往要 10 mm 以上),同时还用透镜相位去补偿棱镜引入的色散像差。
-
径向对称超透镜阵列 + 可微 RCWA 代理:超表面用 700 nm 高、350 nm 间距的氮化硅纳米柱构成,优化变量是纳米柱宽度决定的局部”占空比”(duty cycle)。相位约束为径向对称(避免逐像素优化陷入局部极小,且只需沿一条半径仿真即可覆盖全视场 PSF)。用严格耦合波分析(RCWA)预计算数据,拟合两个可微多项式代理算子:相位→结构的逆映射(在标称波长 452 nm 处把相位换成占空比)和结构→相位的正映射(给定几何算出其他波长的相位),从而把高度色散的响应变成可反传的模型。相位表达式为
\[\phi_{m,n}(r) = \phi(r) + \frac{2\pi}{\lambda_w}\left(x_i \sin\psi^{m,n}_x + y_i \sin\psi^{m,n}_y\right)\]
其中 \(\phi(r)\) 是可优化的径向对称相位,后一项是固定的楔形相位。
-
连续光谱随机优化:借助基于 FFT 的带限角谱法(ASM)算出各子透镜随波长与视场角变化的 PSF,再对真实 RGB 图做卷积加高斯-泊松噪声得到传感器测量。优化时在可见光谱上连续采样(每 50 nm)、视场角每 15° 采样,用 Adam 跑约 15 小时,损失是逐像素 MSE 加 LPIPS 感知损失。还提出”全光谱相位初始化”:先优化一个把整段可见光能量都聚焦到视场中心的相位当初值,显著压制色差。
-
概率式扩散反卷积:把去卷积写成带自然图像先验的最大后验估计,用半二次分裂(HQS)拆成”逆滤波数据项闭式解 + 先验项”两步交替迭代。先验项不求单点最大,而是用一个扩散模型(DDPM 训练、DDIM 采样,约 20 步)在当前迭代解附近的自然图像流形上采样多个合理解——因为反卷积本身是欠定的(多个清晰图可能映射到同一测量)。扩散模型以真值、传感器测量、耦合变量 \(z_t\)、权重 \(\mu_t\) 和时间步编码拼接为条件,用对错位鲁棒的 Contextual Bilateral(CoBi)损失训练,以应对真实数据对的轻微错位。最后一个 UNet 融合网络把 9 幅去卷积后的子图做单应变换、拼接、混合成全传感器分辨率的大图。
数据方面,用 ImageNet 与 MIT-5K 采样 10000 张图按前向模型仿真出配对数据训练,再用一套分束器双相机(超透镜相机 + 常规参考镜头相机,PTP 亚毫秒同步)在真实室内外采集的配对数据微调。
实验结果
主实验是仿真下”超薄相机整机设计”的对比(3×3 阵列、含融合,在未见过的验证集上评测),本文方法在三项指标上全面领先各类平面相机方案:
| 方法 | SSIM ↑ | PSNR (dB) ↑ | 1-LPIPS ↑ |
|---|---|---|---|
| FlatCam [2017] | 0.544 | 19.25 | 0.292 |
| FlatNet [2020] | 0.533 | 20.61 | 0.426 |
| DiffuserCam [2017] | 0.479 | 16.42 | 0.255 |
| Kingshott et al. [2022] | 0.594 | 21.24 | 0.348 |
| 本文(Tikhonov 先验) | 0.731 | 25.47 | 0.71 |
| 本文(完整) | 0.892 | 32.66 | 0.803 |
FlatCam / DiffuserCam 这类方案虽能收很大锥角的光,但把空间和颜色信息混叠进覆盖整块传感器的 PSF,难以恢复高频细节。消融显示:换成非学习的 Tikhonov 先验仍比所有平面相机基线高 4 dB 以上(约 25.5 dB),而扩散先验在同样输入下再提升约 7.2 dB。此外在只评概率反卷积(单中心孔径)的对比中,本文相对 FLAT-Net、Multi-Wiener-Net 等学习基线也有 1 dB 以上 PSNR 优势。MTF 分析表明本文超透镜在各入射角下都优于 Tseng et al. 2021、法向入射时接近衍射极限,实测 Siemens 星图散射也明显更小。真实室内外拍摄中,本文首次实现了实验室外的宽波段超表面成像。
亮点与局限
- 亮点:
- “透镜=棱镜阵列”的分解思路优雅,把大视场宽波段这个耦合难题拆成多个小视场子问题,配合斜置楔形相位把视场翻倍到 100°、后焦距压到 2.5 mm。
- 用可微多项式代理绕开对大孔径超表面做全波仿真的算力/显存瓶颈,得以在连续光谱上做端到端随机优化。
- 把扩散模型当自然图像先验嵌进物理反演的迭代循环,用概率采样处理去卷积的欠定性,重建细节明显优于过度平滑的学习基线;并给出真实配对数据的采集方案,做到出实验室成像。
- 局限:
- 与传统大光学系统一样依赖 GPU 重建、功耗高,尚未在边缘设备上实现快速推理。
- 原型没有用满光学孔径——为避免光学挡板与子透镜重叠,把子透镜分散排布在非连续区域,只用了约 40% 的传感器面积(约 15% 面积做光阑),总光效偏低。
- 边缘视场(强楔形相位的子透镜)空间细节明显弱于中心,靠融合网络补全;角落信息缺失。
- 未显式建模制造误差。
延伸思考
这条路线把”光学 - 算法”的边界进一步往算法侧推:光学只需把可反演的信号打到传感器上、留够 MTF,剩下交给计算重建。值得追问的是扩散先验在多大程度上是在”恢复”而非”合成”细节——概率采样虽缓解了欠定性,但在关键任务成像(科学/医疗)里,先验幻觉的可控性和可信度需要更严格评估。另外,把扩散反卷积嵌进迭代循环带来的推理成本,与作者设想的 ASIC/边缘部署之间存在明显张力,后续工作(如同组 2025 年的 Collaborative On-Sensor Array Cameras 把纳米柱规模扩到上亿、全谱联合优化)也在继续推进阵列协同设计与效率问题。分散子孔径造成的低光效,若能配合可制造的光学挡板做连续排布,是提升实用性的关键一步。