Conference

Instance Segmentation of Scene Sketches Using Natural Image Priors

Mia Tang, Yael Vinker, Chuan Yan, Lvmin Zhang, Maneesh Agrawala

Stanford University; MIT

一句话总结

InkLayer 借助在自然图像上预训练的检测与分割模型(Grounding DINO 与 SAM),通过类别无关微调与深度线索精修,实现对光栅场景草图的实例分割,并进一步把草图分解为可编辑的有序图层。

研究背景

  • 领域现状:草图是视觉构思与规划的重要工具。艺术家往往先在单一画布图层上快速起稿,之后若要调整构图或透视,就得手工把不同元素拆分成可独立编辑的图层,过程繁琐。已有的场景级草图分割方法大多依赖在标注草图数据集上训练的专用模型。
  • 核心痛点:现有草图数据集普遍局限于特定绘制风格与有限的物体类别,导致模型泛化能力差;同时草图本身稀疏、抽象,人类绘制风格差异极大,进一步加剧了分割难度。已有方法多被限制在训练时固定的类别集合内,难以处理开放词表与多样风格。
  • 本文 idea:与其从零训练草图专用模型,不如把在海量自然图像上训练出的强分割/检测先验迁移到草图域。作者分析发现,SAM 对草图有意外的泛化能力,而 Grounding DINO 因真实图像与草图之间的域差异表现受限;于是提出针对检测器的类别无关微调,配合基于深度的掩码精修与图层修复,构成完整的实例分割与编辑流程。

方法

整体框架

InkLayer 以 Grounded SAM 为基座。给定一张光栅草图,先用微调后的 Grounding DINO 检测出候选物体包围框,再用预训练 SAM 依据这些框生成初始掩码;随后进入精修阶段,利用掩码计算更细粒度的重叠度来过滤冗余框,并借助深度图解决重叠区域的像素归属;最后把分割结果分解为按深度排序的图层,用预训练 SDXL 修复模型补全被遮挡区域,从而支持平移、缩放等编辑操作。

flowchart LR
    A[输入草图] --> B[微调 Grounding DINO 检测]
    B --> C[候选包围框]
    C --> D[SAM 生成初始掩码]
    D --> E[掩码级细粒度 IoU 过滤冗余框]
    E --> F[深度线索解决重叠像素归属]
    F --> G[分水岭传播补全标签]
    G --> H[分层 + SDXL 修复遮挡区域]
    H --> I[分割结果与有序图层]

关键设计

  1. 类别无关的检测器微调:原始 Grounding DINO 在草图上泛化很差,而直接用 SketchyScene 的类别标签朴素微调又会严重过拟合到 45 个预定义类别。作者的做法是把所有类别标签统一合并为一个词 “object”,仅用 5000 张 SketchyScene 草图微调检测头,训练时保留 Focal Loss、L1 Loss 与 GIoU Loss,去掉类别识别损失。这样迫使模型依靠格式塔特性(闭合、连续、涌现)把属于同一物体的笔画组合起来。推理时以图像加 “object” 提示检测所有潜在实例。该策略把检测的平均精度(AP)从 26% 提升到 74%。

  2. 掩码级细粒度重叠过滤:草图比真实图像稀疏,物体常常填不满包围框,导致基于框 IoU 的非极大值抑制不可靠。作者改用初始掩码与草图相交的区域来计算重叠分数 \(O(i, j) = \mathrm{IoU}(M_i * S, M_j * S)\) ,当 \(O(i, j) > 0.5\) 时判定两框指向同一物体,只保留置信度更高者,得到过滤后的框集与掩码集。

  3. 基于深度的重叠消歧:过滤后的掩码仍可能存在像素归属不明的重叠区。作者用 DepthAnythingV2 提取草图深度图,在草图像素上等间距采样点并按所属掩码分组,为每个掩码计算深度分数 \(ds(M_i) = \arg\max_{D(p)} \mathrm{count}(\{D(p) \mid p \in P_i\})\) ,即以采样点深度值的众数作为该物体的深度,然后把模糊像素分配给深度分数最高(更靠前景)的掩码。随后用基于分水岭的精修把已有标签传播到未标注的草图像素,保证完整覆盖。

  4. 图层修复与可编辑分解:为支持编辑,作者把每个物体按其掩码从草图中抠出 \(M_i * S\) ,找出与之相交的掩码集合 \(H(M_i)\) ,并把该集合与物体包围框的交集定义为修复区域 \(C_i = H(M_i) \cap B_i\) ,交给预训练 SDXL 修复模型补全被遮挡的部分,得到完整、可自由拖动缩放的物体图层。

  5. InkScenes 基准数据集:为覆盖多样草图,作者构建了合成标注数据集 InkScenes,沿绘制风格、笔触风格、物体类别三个维度扩展。一条流水线基于 SketchyScene 布局,用 CLIPasso(高保真)与 SketchAgent(类似儿童画的符号化风格)生成矢量草图,并通过 Adobe Illustrator 脚本以书法笔、炭笔、毛笔三种笔触重渲染;另一条流水线基于 Visual Genome,用 InstantStyle 风格迁移生成自然感草图,涵盖 72 个类别(含 53 个 SketchyScene 未有的新类)。整套数据集共 20,542 张标注场景草图。

实验结果

评测覆盖 8076 个样本,横跨 SketchyScene、Zhang et al.、SketchAgent、CLIPasso 的四种笔触变体、以及 InstantStyle 等多种风格。下表为实例分割主实验在全部数据集聚合(All)上的对比,指标为像素准确率与掩码 IoU(数值取自原文聚合行)。

方法 准确率 Acc↑ IoU↑
SketchyScene 0.58 0.50
Grounded SAM 0.53 0.32
Automatic SAM 0.13 0.08
InkLayer(本文) 0.87 0.82

InkLayer 在两项指标上全面领先,尤其相较 Grounded SAM 优势明显,并在 Zhang et al. 与 SketchAgent 这类高难度风格上表现稳健。在物体检测评测(IoU、AR、AP)中,本文相对未适配的 Grounding DINO 基线,IoU 提升约 38%、AR 提升约 48%、AP 提升约 48%,聚合 AR 达到 0.79;即便只在 SketchyScene 上微调,模型仍能很好泛化到差异极大的草图风格与新类别。与面向语义分割的 Bourouis et al. 与 SketchSeger 在单实例过滤子集上的单独对比中,InkLayer 的聚合准确率与 IoU(0.89 / 0.85)同样优于两者。全流程在单张 NVIDIA 4090 上训练约四小时即可完成。

亮点与局限

亮点

  • 以”迁移自然图像先验”替代”从零训练草图专用模型”,用类别无关微调把 Grounding DINO 从 26% AP 提升到 74%,并保持对开放类别与多样风格的泛化。
  • 掩码级细粒度重叠度与深度消歧针对草图稀疏、遮挡的特点定制,比基于框 IoU 的常规 NMS 更可靠。
  • 不止于分割:把结果分解为深度排序图层并用 SDXL 修复遮挡区域,直接服务于拖拽、缩放等草图编辑。
  • 构建并开放 InkScenes 基准(20,542 张,72 类,多笔触多风格),弥补了现有数据集风格单一的空白。

局限

  • 包围框过滤仍可能保留多余框,在合成最终分割时引入伪影。
  • 掩码生成依赖 SAM,对占据大面积区域的物体偶尔会漏掉边界或产生网格状掩码,即便经过精修仍可能残留伪影;作者建议未来针对草图微调 SAM 或引入可学习的精修阶段。

延伸思考

这篇工作是”基础模型迁移到稀疏/抽象视觉域”的一个清晰范例:面对缺乏大规模标注的草图领域,作者没有硬训专用模型,而是分别诊断检测器与分割器在域迁移中的短板(Grounding DINO 差、SAM 意外能用),只对薄弱环节做最小代价的类别无关微调。这种”先诊断各组件的域鲁棒性、再定点适配”的思路,对其他数据稀缺领域(如医学图示、工程图、矢量图标)同样有借鉴意义。其把深度先验用于二维草图重叠消歧的做法,也提示单目深度估计模型可以作为通用的”前后景排序”工具服务于分层与编辑任务。值得追问的是:图层修复目前依赖通用 SDXL,与草图风格未必完全一致;若能引入风格感知的草图修复,或把整条流水线端到端可微化,或许能进一步减少伪影并提升编辑质量。