UrbanBIS: a Large-scale Benchmark for Fine-grained Urban Building Instance Segmentation
Shenzhen University
一句话总结
本文提出 UrbanBIS——目前规模最大的真实城市级 3D 点云基准(25 亿点、10.78 km²、六个真实场景、3370 栋建筑),首次同时提供城市语义标注、建筑实例标注和细粒度建筑子类别,并配套一个无聚类、端到端的高效建筑实例分割方法 B-Seg。
研究背景
- 领域现状:3D 机器学习此前集中在物体级(分类、部件分割)、室内场景级(ScanNet、S3DIS)和室外道路级(自动驾驶)任务上。真实城市级数据集稀缺,因为无人机采集、三维重建与标注成本极高。已有的 SensatUrban、STPLS3D 等只覆盖一到三个较小场景。
- 核心痛点:现有城市数据集大多只有语义级标注,缺乏真实场景的实例级标注(仅少数虚拟场景数据集含实例标签);且没有细粒度的建筑功能类别信息,限制了下游应用。此外,主流 3D 实例分割方法多为室内小物体设计,依赖逐点聚类,在大规模城市点云上效率低、效果差。
- 本文 idea:构建一个既大又全的真实城市数据集——同时覆盖城市语义、建筑实例与细粒度建筑子类别;并针对大规模点云设计一个避开逐点聚类的实例分割方法,用特征相似度关系矩阵直接分组,提升精度的同时大幅加速推理。
方法
B-Seg 是一个端到端、无聚类(clustering-free)的建筑实例分割框架,整体分三步:先用稀疏卷积主干提取逐点特征并做多任务预测,再基于候选点与关系矩阵直接生成并合并建筑提案,最后用打分网络过滤低质量提案。核心思路是用”少量候选点 + 关系矩阵”替代主流方法昂贵的逐点聚类。
flowchart LR
A["城市点云"] --> B["稀疏卷积主干 + 逐点特征"]
B --> C["三分支: 语义 / 中心偏移 / 实例感知特征"]
C --> D["候选点选择 + 关系矩阵分组 + 提案合并"]
D --> E["ScoreNet 打分过滤"]
E --> F["建筑实例"]
关键设计:
-
主干与多任务特征学习:采用子流形稀疏卷积网络(submanifold sparse conv)提取 3D 点特征,并行三个分支——语义分支做语义分割、中心偏移分支预测每点到其所属实例中心的偏移、实例感知分支增强实例可分性。这三路特征共同支撑后续的提案生成。
-
关系矩阵建筑分组(核心):先用最远点采样选出前景候选点(每 3000 个前景点动态选 1 个,每块最多 100 个)。构造一个关系矩阵,第 \(i\) 行第 \(j\) 列表示第 \(i\) 个前景点与第 \(j\) 个候选点的学习特征距离,距离越小越可能属于同一建筑。对每个前景点取 \(\arg\min\) 直接得到其建筑提案标签。这一步用矩阵运算替代逐点聚类,是加速的关键。
-
提案合并:由于候选点数量仍较多,同一建筑可能被多个候选覆盖。将每个候选点朝其预测的实例中心偏移后,再合并指向同一建筑的候选点与提案,消除重复。
-
打分过滤与联合训练:用 ScoreNet(带实例感知池化的小型稀疏卷积 U-Net)为每个提案预测质量分,过滤掉分数低于 0.1 的错误提案。整个框架从零端到端训练,优化目标含四项损失:语义分割损失 \(\mathcal{L}_{sem}\)、中心偏移损失 \(\mathcal{L}_{offset}\)、实例感知特征损失 \(\mathcal{L}_{dis}\) 与提案打分损失 \(\mathcal{L}_{score}\)。
数据集本身也是核心贡献:无人机航拍 113346 张照片(0.5 TB)→ 三维重建 → 网格语义标注(7 类城市语义 + 建筑实例)→ 按每平方米 80 点在网格上采样得到 25 亿个带 RGB 的 6D 点。建筑进一步细分为 7 个功能子类别(商业、住宅、办公、文化、交通、市政、临时)以及低层/高层/超高层三档高度,共约 1600 人时标注。
实验结果
在”同场景训练/测试”设置下,B-Seg 在全部场景、全部指标上一致超越主流 3D 实例分割方法,且推理速度最快(下表 T 为推理耗时,秒)。主流方法多为基于聚类的逐点分组,耗时高;B-Seg 靠关系矩阵聚合 + 少量候选合并,兼顾精度与速度。
| 方法 | Qingdao AP↑ | Qingdao T(s)↓ | Longhua AP↑ | Campus AP↑ |
|---|---|---|---|---|
| PointGroup | 0.364 | 9.80 | 0.318 | 0.117 |
| HAIS | 0.320 | 7.11 | 0.159 | 0.002 |
| SoftGroup | 0.383 | 6.55 | 0.151 | 0.253 |
| DyCo3D | 0.285 | 5.20 | 0.020 | 0.029 |
| DKNet | 0.383 | 2.15 | 0.077 | 0.044 |
| B-Seg (本文) | 0.453 | 1.19 | 0.402 | 0.261 |
其余实验用文字概述:在细粒度建筑子类别分割上,B-Seg 在多数子类上表现最佳,仅在 Campus 的少数难分类别上略逊于 PointGroup;在跨场景泛化(用部分场景训练、其他场景测试)中 B-Seg 在各组合下 AP/AP50/AP25 普遍领先,展现更强的泛化能力;在全场景联合训练下 B-Seg 平均性能满意且速度最快;迁移到 InstanceBuilding 网格数据集上也无明显劣势,部分场景甚至更优。
亮点与局限
- 亮点:
- 规模与标注完整度空前——真实城市 25 亿点、10.78 km²、六场景,首个同时提供语义 + 实例 + 细粒度建筑子类别的大规模真实城市数据集。
- B-Seg 的无聚类关系矩阵设计在大规模点云上同时取得更高精度和数倍推理加速。
- 数据形态丰富(点云/网格/航拍图),可支撑语义分割、实例分割、多视图立体、城市 LOD、路径规划等多种下游任务。
- 场景间相关性与长尾统计分析细致,并指出可用小场景 Yingrenshi 作测试集研究域间差异。
- 局限:
- 数据主要采集自中国城市,建筑风格与地域分布有偏,跨地域泛化未充分验证。
- 长尾问题明显——三大类占绝大多数点,小类别(如舟船、交通建筑)识别仍困难。
- B-Seg 在个别难分子类别上仍不及基于聚类的方法,暗示特征提取器还有提升空间。
- 点云由重建网格采样得到而非直接扫描,采样密度与重建质量会传导误差。
延伸思考
- 关系矩阵替代聚类的思路,本质是把”分组”转化为可微的相似度检索,这与后续基于 Transformer/查询的实例分割(如 Mask3D、query-based 方法)思路相通,值得对比其在城市尺度上的效率-精度权衡。
- 城市尺度的细粒度建筑语义 + 高度信息,天然适合驱动 LOD 生成、程序化城市建模与数字孪生,是连接”感知”与”生成”的良好基座。
- 长尾与跨城市域差异是城市级 3D 理解的真正瓶颈,后续可结合合成数据(如 STPLS3D 虚拟场景)做域自适应或半监督,以缓解标注成本与类别不均衡。