Conference

Animating Street View

Mengyi Shan, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz

University of Washington

一句话总结

给定一张街景图片或全景图,本文提出一套全自动系统,先擦除画面里原有的人和车,再用带真实光照、阴影与遮挡的合成行人和车辆重新填充场景,生成任意长度的高分辨率动画视频。

研究背景

  • 领域现状:Google 街景等服务让人足不出户虚拟游览世界,但这些内容都是静止的——没有走动的行人、行驶的车辆。直接采集街景视频又受限于采集设备、存储成本和隐私问题。
  • 核心痛点:已有的物体插入 / 单图动画方法要么需要手工插入、要么只能处理短片段(1-2 秒且带明显瑕疵)、要么依赖多视角图像加 LiDAR(如基于 NeRF 的方法),且大多只处理车辆、忽略更复杂的行人交互。缺少一个只需单张图就能自动生成长视频的完整方案。
  • 本文 idea:不追求提升场景理解本身,而是把一批成熟的预训练模型(分割、深度、阴影检测)与传统仿真 / 渲染管线以新颖方式组合成一个可运行在普通笔记本上的端到端系统,实现遮挡感知、光照一致的街景动画。

方法

整体框架分三个阶段串联:先从单图重建场景的几何、光照与语义信息,再在重建结果上仿真行人与车辆的行为,最后把 3D 角色渲染回原图并合成阴影与遮挡。

flowchart LR
  A["输入: 单张街景图/全景"] --> B["Stage 1 重建: 分割/深度/太阳方向/阴影/地平面"]
  B --> C["Stage 2 仿真: BEV 势场行人仿真 + 车道交通仿真"]
  C --> D["Stage 3 渲染: 光照/阴影/遮挡合成"]
  D --> E["输出: 任意长度场景视频"]

关键设计:

  1. 场景重建:用 Stable Diffusion inpainting 配合 SegFormer 分割擦除原有人车;用 SegFormer + 零样本的 CLIPSeg 识别可行走 / 可驾驶区域;用 AdaBins 单目深度估计拟合地平面方程 \(aX + bY + cZ = 1\),为插入物体定标尺、定相机角度并处理遮挡。
  2. 太阳与阴影估计:训练一个基于 ResNet50 的太阳方向估计网络,把方位角 \([0, 2\pi)\) 分成 36 个 bin、仰角 \([0, \pi/2)\) 分成 18 个 bin,用交叉熵做分类;再用预测分布的方差判断是强方向光还是漫射环境光。结合检测到的阴影区域,构造一个悬在物体上方的”阴影遮挡体”(shadow occluder)网格,让场景阴影能投射到插入物体上。
  3. 行人与交通仿真:把可行走区域投影到鸟瞰图(BEV)网格,基于 Treuille 等人的势场算法做人群仿真——构造不适场(discomfort field)让行人远离边缘、障碍和彼此,用快速行进法求解满足 eikonal 方程 \(\lVert \nabla \phi(x) \rVert = C\) 的势场 \(\phi\),每一步沿梯度更新位置。车辆按检测到的车道行驶,并通过一个红绿灯 / 斑马线交通模块控制人车在路口的停走。
  4. 渲染合成:逐帧用 Unity HDRP 分层渲染。先渲染带不透明地面的彩色层得到阴影,再渲染透明地面的深度层得到物体掩码,据此计算阴影掩码 \(M_s\) 和物体掩码 \(M_o\) 并按阴影色因子合成;遮挡则用精修后的深度图做标准 Z-buffering,特别针对细长物体用其与地面的交点重估深度。

实验结果

由于是该任务首个端到端系统,缺乏可直接对比的完整基线,作者对唯一需要训练的太阳方向估计子模块做了定量比较(用从 19093 张街景全景派生的数据集训练与测试,角度误差越低越好):

方法 方位角误差↓ 仰角误差↓
本文 38.7° 12.3°
Hold-Geoffroy et al. 2019 59.3° 15.9°
Ma et al. 2016 58.7° 16.9°

其余能力(阴影遮挡体、路径规划、交通仿真、阴影 / 遮挡渲染)以定性视频结果展示。系统在 156 张街景图上运行:重建每张 5-10 秒,仿真 30 fps,最高分辨率(4032×3024)下渲染 1 分钟视频约需 10 分钟离线处理(可用标准着色技术或降分辨率做到实时)。失败统计中,语义分割(45 例)与深度估计(38 例)是最主要的错误来源。

亮点与局限

  • 亮点:
    • 首个只需单张图片(含已知焦距)或 360° 全景就能生成任意长街景动画的自动系统,可跑在普通笔记本上。
    • 巧妙地把现成预训练模型与传统仿真 / 渲染组合,无需大规模训练集、标注或高端硬件。
    • 同时处理行人和车辆及其在路口的交通交互,并做到光照、阴影、遮挡一致。
  • 局限:
    • 不支持弯道 / 斜坡 / 上下坡,不做自动交通方向检测,无法恢复障碍物看不见的背面,也不能把阴影投射到任意场景几何上。
    • 光照模型是近似的,并非完整全局光照渲染。
    • 强依赖预训练模型精度,对非街景视角、复杂光照等分布外图像会失败。
    • 作者也坦承素材在外观、性别、族裔上的多样性有限,未显式建模真实人口分布。

延伸思考

  • 系统的天花板由所依赖的预训练分割 / 深度模型决定,随着这些基础模型进步(例如更强的开放词表分割、单目几何估计),本方案可自然扩展到更广的场景类型。
  • 与近来基于扩散模型或 3D-aware GAN 的视频生成路线相比,本文走的是”重建 + 仿真 + 传统渲染”的组合路线,可控性、几何一致性和无需大数据是其优势;若把渲染层替换为神经渲染或把行为仿真升级为学习式策略,可能进一步提升真实感与行为多样性。
  • “根据场景布局建模真实人口分布”是作者点出的开放问题,涉及公平性与真实性,值得结合社会属性数据谨慎探索。