Aerial Path Planning for Urban Geometry and Texture Co-Capture
Shenzhen University; Beijing Normal University
概述
本文提出了城市场景的”几何与纹理协同采集”(geometry and texture co-capture)问题:在一次无人机(UAV)飞行中,同时采集既能重建高精度结构几何、又能生成高保真纹理贴图的图像集合。以往基于 UAV 的城市重建主要关注捕捉稠密几何,很少在路径规划阶段考虑最终纹理贴图的质量,导致代理模型(proxy model)在复杂颜色重映射后出现明显视觉瑕疵。
方法的输入信息非常有限:只有目标区域的 2D 建筑轮廓地图(每条折线段对应一个 3D 建筑立面)以及一个保证无人机能安全飞行于所有建筑之上的安全飞行高度 \(H\)。输出是一条安全的航拍路径,引导单架无人机低成本地协同采集图像,用于重建结构化几何代理与高质量纹理贴图。
问题动机与挑战
一个直接的思路是分两轮飞行,分别针对高质量纹理和精细几何采集照片。但两轮采集之间往往在标定坐标系或相机参数上存在差异,导致重建几何与纹理之间严重错位,事后对齐既费时又繁琐。
单次飞行协同采集面临几何与纹理需求的根本冲突:
- 视角差异(angular disparity):几何重建需要视角方向上的差异,而这种角度变化会引入透视不一致,损害纹理保真度。
- 覆盖需求(coverage requirements):高质量纹理映射通常每个表面区域只需要一张构图良好的视图,而几何重建依赖更密集的多视图覆盖;用多张不一致的照片贴立面反而降低纹理质量。
- 拍摄时序(shooting time):拍摄顺序对几何影响很小,却显著影响纹理的光度质量。非连续采集会导致光照条件(阴影、阳光)不一致,在拼接纹理中形成瑕疵。
因此需要在照片数量、空间位置、视角以及采集顺序之间做出精心权衡。
纹理质量评估系统
在获得任何纹理贴图之前,本文提出一套评估系统来衡量给定一组 2D 视图 \(\{v\}_{f_i}\) 时立面 \(f_i\) 的纹理质量,包含四个方面:
- 透视质量 \(Q_s\):评估视图的方向一致性与正面性(frontality)。
- 光度质量 \(Q_d\):评估纹理贴图的锐利度与分辨率一致性;由于视图到目标立面的距离直接影响图像分辨率,因此偏好距离目标立面较小且相近的视图。
- 结构质量 \(Q_u\):衡量纹理贴图中立面的结构一致性。由于标定误差,纹理重映射时使用照片越多越容易引入结构扭曲,因此鼓励较少的照片、较低的纹素覆盖。
- 完整性 \(Q_c\):衡量立面 \(f_i\) 被 \(\{v\}_{f_i}\) 观测到的比例。
基于该系统引入两个指标。立面质量将四项组合:
\[Q(\{v\}_{f_i}, f_i) = Q_s(\{v\}_{f_i}, f_i) + Q_d(\{v\}_{f_i}, f_i) + Q_u(\{v\}_{f_i}, f_i) + Q_c(\{v\}_{f_i}, f_i)\]
视图-立面质量用于评估单个视图 \(v_j\) 对立面 \(f_i\) 纹理质量的贡献:
\[Q(v_j, f_i) = \lambda_1 Q_s(v_j, f_i) + \lambda_2 Q_d(v_j, f_i) + \lambda_3 Q_u(v_j, f_i) + \lambda_4 Q_c(v_j, f_i)\]
其中平衡系数取 \(\lambda_1 = 0.1\),\(\lambda_2 = 0.85\),\(\lambda_3 = 0.3\),\(\lambda_4 = 0.1\)。
俯冲视图(Dipping Views)
俯冲视图专门用于捕捉高质量立面纹理。与几何导向方法鼓励视角方向变化不同,本文采用纹理导向策略:无人机从安全高度 \(H\) 垂直下降,沿轨迹以一致的视角方向连续拍摄。这样问题被简化为在 2D 地图上生成 2D 俯冲视图 \(\{v = (p, s)\}\),其中 \(p\) 为 2D 俯冲位置、\(s\) 为 2D 视角方向。照片只在 3D 视图处拍摄,而不在 2D 视图处拍摄。
初始化流程:
- 在目标 2D 区域上生成规则的稠密采样点 \(\{p\}\),剔除位于禁俯冲区(no-dipping zone)内的点,得到候选俯冲点子集。对每个候选点做可见性检查,获取可见立面及可见区域;反过来对每个立面得到能观测它的候选点集合。
- 视角方向初始化:将观测同一立面 \(f_i\) 的候选点赋予相同的视角方向 \(s_i\),从而将透视一致性项简化为正面性项。在立面法线反方向附近以小步长搜索采样方向,取立面质量最高者作为 \(s_i\)。
- 俯冲点选择:采用迭代方法选取一小组能共同覆盖整个场景的点。第 \(t\) 次迭代计算点 \(p_j\) 相对所有可见立面的 2D 视图质量:
\[\tilde{Q}(p_j, \{f\}_{p_j}) = \sum_{f_i \in \{f\}_{p_j}} Q((p_j, s_i), f_i)\]
迭代移除质量 \(\tilde{Q}\) 最低的点,直到任何移除都会降低立面的完整性 \(Q_c\) 为止。
3D 俯冲视图生成:对捕捉目标立面 \(f_i\) 的 2D 俯冲点 \(p_j\),从高度 \(H\) 起以 \(k_d \cdot h_{pic}\) 的间隔生成一列垂直的 3D 视图,所有视图沿方向 \(s_i\),与立面保持一致距离以最大化光度一致性。取 \(k_d = 0.8\) 以保证纹理完整性和相邻视图投影区域的重叠。投影传感器高度定义为 \(h_{pic}(V_a, f_i) = h_{sensor} \cdot d(V_a, f_i) / f\),其中 \(h_{sensor}\) 和 \(f\) 分别为相机传感器高度与焦距。受最低飞行高度约束,靠近地面的立面区域可能无俯冲视图覆盖,因此在最低视点处额外引入一个视角方向以保证立面全高覆盖。
俯冲视图优化
为降低飞行成本,本文用悬停位置数量来量化成本。允许多个视图共享同一位置可减少悬停点。俯冲点 \(p_j\) 的悬停成本 \(C(p_j)\) 定义为由它提升出的所有 3D 悬停位置总数,场景总悬停成本为各点之和。
复杂场景中同一俯冲点常提升出多列视图捕捉不同立面。对于源自同一俯冲点、分别捕捉立面 \(f_o\) 与 \(f_m\) 的两个视图 \(V_a\)、\(V_b\),若其距离小于投影重叠阈值 \(\tau_d = (1 - k_d) \cdot \min\{h_{pic}(V_a, f_o), h_{pic}(V_b, f_m)\}\),则可合并到中点,形成一个具有双视角方向的共享悬停点。合并带来的成本节省为:
\[\delta(d) = \begin{cases} \frac{1}{2} Gauss(d), & d \le \tau_d \\ 0, & others \end{cases}\]
其中 \(Gauss(\cdot)\) 是均值 \(\mu = 0\)、标准差 \(\sigma = \tau_d / 3\) 的高斯函数。于是全场景悬停成本为:
\[C = \sum_{p_j \in \{p\}''} \left( C(p_j) - \sum_{V_a} \sum_{V_b} \delta(d(V_a, V_b)) \right)\]
优化被表述为多目标优化,对每个 2D 俯冲点最小化目标向量:
\[G = \left( C, -Q(\{v\}_{f_i}, f_i), \dots, -Q(\{v\}_{f_n}, f_n) \right)\]
采用支配关系(dominance)定义,属于难解的 NP 问题。本文提出逐个迭代优化每个 2D 俯冲视图的方法,每次迭代依次执行三步操作:俯冲点位置调整(以步长 \(\tau_p\) 在周边采样,取 \(G^*\) 最小者)、立面方向调整(以步长 \(\tau_s\) 在邻域采样调整 \(s_i\))、冗余俯冲视图移除。当所有俯冲视图不再变化时收敛,实验表明通常 5 次迭代即可收敛。优化后的 2D 俯冲视图被提升为 3D 视图并在后续步骤中固定。
平面视图(Planar Views)
俯冲视图缺乏视角变化和多视图覆盖,不足以重建场景几何。因此再生成一组 3D 平面视图 \(\{\hat{V} = (\hat{P}, \hat{S})\}\),用于重建场景几何以及屋顶和地面的纹理。
将所有规则 2D 采样点提升到高度 \(H\),在每个位置拍摄五张照片:一张垂直视角加四张倾斜视角。该策略节能且已被证明足以精确重建场景几何。垂直视图为屋顶和地面提供极高透视质量与光度质量的纹理,因此地面的纹理质量可简化为 \(Q = Q_u + Q_c\)。
为减少悬停位置,需要在不损害几何与纹理质量的前提下精简 \(\{\hat{V}\}\)。为评估视图集合质量,根据输入生成 2.5D 模型并对其表面稠密采样。几何重建方面计算所有表面采样点的可重建性 \(Q_r\),并将每个平面位置的冗余度 \(r(\hat{V})\) 定义为其五个共位视图的冗余之和;纹理重建方面仅用每个平面位置的垂直视图计算地面/屋顶的立面质量。多目标优化目标为:
\[Y(\hat{V}) = \left( -Q(\{\hat{V}\}', f_g), -Q_r, H(\{\hat{V}\}) \right)\]
这是 NP-难问题,本文用贪心启发式逐步最小化目标,每次迭代包含两个操作:视图位置调整(以步长 \(\tau_p\) 搜索邻域平面空间,取 \(Y^*\) 最小的位置)、视图移除(逐个全局移除最冗余的平面视图 \(\hat{V}_j = \arg\max_j r(\{\hat{V}\})\),直到任何移除会产生未覆盖区域,或使某采样点可重建性低于阈值 \(\tau_r\))。所有平面视图不再变化时收敛。
场景采集与重建
路径规划:确定俯冲视图与平面视图后,将它们连成一条连续路径,建模为标准的旅行商问题(TSP)。每个视图是图中的一个节点,构建全连通图并在安全区内求各视图对之间的最短路径。为避免非连续拍摄导致的光照变化,连接视图对 \((V_i, V_j)\) 的边代价定义为:
\[e(V_i, V_j) = w_p l(P_i, P_j) exp\left( \frac{\alpha}{l(P_i, P_j)} \right)\]
其中 \(l(P_i, P_j)\) 是安全飞行空间内从 \(P_i\) 到 \(P_j\) 的最短直线距离,\(\alpha\) 是 \(V_i\) 与 \(V_j\) 视线方向之间的夹角,\(w_p\) 是拓扑系数,用于保证捕捉相同立面和相邻立面的视图在短时间内拍摄:同一平面取 \(w_p = 0.5\),相邻平面取 \(w_p = 0.75\),其它情况取 \(w_p = 1\)。该图的最小代价路径对应一个交替的视图序列,可通过求解 TSP 高效得到。
重建:沿规划路径用无人机采集 RGB 照片,用商业软件标定并重建高精度 3D 模型(特征匹配、SfM、MVS、表面重建),再输入结构感知重建算法生成抽象代理,最后用 TwinTex 生成高质量纹理贴图。由于标定照片、稠密模型与抽象模型都对齐在同一坐标系,用户可在单一工作流中生成高质量纹理场景,无需多轮采集、标定和手动对齐。
实验结果
方法用 C++ 实现,运行于配备 Intel i9-10900k(3.0 GHz)和 128 GB 内存的台式机。固定参数包括焦距 12.67mm、\(d_{SGD} = 4cm\)、重叠比 (0.8, 0.8),最小安全距离 \(d_{min} = 10m\),\(H\) 设为最高建筑高度加 \(d_{min}\)。数据集包含四个真实场景(Polytech、SEng、Hitech、ArtSci)、三个公开虚拟场景(Concave、C-1、Bridge-1)以及四个由建模师新建的虚拟场景(SN-1、SN-2、Asia-1、Asia-2)。对比基线为倾斜摄影(OP)和 DroneScan(DS)。
主要结果:
- 悬停位置的影响:在相同路径长度和视图数量下,将悬停位置数量翻倍会使飞行时间增加 81%、电池消耗增加 51%,说明减少视图数量不仅间接缩短航迹,也直接降低能耗。
- 几何阶段结果:本文方法与 DS 在较低高度规划视图,因此稠密模型在低层建筑上精度和完整性更高,优于 OP。DS 每栋建筑拍更多照片,稠密几何细节略高,但抽象过程会简化细节,代理模型误差反而略大。
- 虚拟场景对比:OP 和 DS 未约束透视质量,无法一致捕捉正面平行图像,产生拉伸和透视不一致瑕疵;本文方法兼顾正面平行与透视一致性,纹理分辨率略高于 DS、明显高于 OP,且结构扭曲最少。多数情况下本文重建纹理在 SSIM 和 LPIPS 上均取得更优分数。视图数量上,DS 比本文多规划 156%-380% 的悬停位置、长 68%-105% 的航迹。
- 真实场景对比:真实场景用 DJI MAVIC 3E 无人机加广角镜头采集,同一天最佳光照下拍摄并随机化各方法执行顺序以消除偏差。本文方法在保证质量的同时相比 DS 只需 61%-94% 的图像、减少 15%-25% 悬停位置、缩短 37%-48% 航迹、降低 24%-40% 能耗。总体优势包括:更高的正面平行与透视一致性、更高光度质量(分辨率)、最小扭曲/模糊/接缝瑕疵、以及低能耗的高质量采集。
- 学习式重建:用各方法采集的图像重建 2DGS。COLMAP 对 DS 规划的图像常常标定失败(尤其虚拟场景),因为 DS 强调立面近景拍摄,产生重复相似模式不利标定;而 OP 和本文方法标定可靠。OP 浮点噪声(floaters)最少,本文次之,二者均优于 DS。整体上本文方法在全场景范围内提供最一致的重建质量。
结论与局限
本文首次显式提出并解决几何-纹理协同采集问题。给定有限输入(2D 地图和安全飞行高度),提出的航拍路径规划算法能同时重建几何代理模型和逼真纹理贴图,在重建质量与一致光照、受限空间作业、飞行安全、采集速度、有限输入信息等自动化目标之间取得良好平衡。
局限与未来工作:优化占用大部分运行时间,计划用并行处理加速;当前所有俯冲序列共享同一最低高度,若能获得精确高程信息,可动态调整垂直俯冲范围,尤其利于不平坦地形;由于输入仅为近似 2D 轮廓,高度凹陷的上部/内部立面可能得到低分辨率纹理和更斜的视角,可通过多高度分析更详细的 2D 轮廓来改进;TwinTex 在代理精度超出容差时会在立面边界出现接缝,高质量照片可缓解;视角相关反射、可重光照和材质估计(PBR)超出当前范围,留待未来。