Conference

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments

Zhenyang Li, Lutao Jiang, Yizhou Zhao, Ying-Cong Chen, Xin Wang, Weikai Chen, Yifan Peng

The University of Hong Kong; The Hong Kong University of Science and Technology (Guangzhou); Carnegie Mellon University; LIGHTSPEED

SIGGRAPH 2026Neural & Generative

一句话总结

PatternGSL 把服装缝纫图纸设计成一种模板无关、可学习的”结构化规范语言”,并训练一个视觉-语言模型从单张图像直接预测这份规范,经确定性解码后即可送入布料仿真器,得到高保真且可仿真的 3D 服装。

研究背景

  • 领域现状:单图重建服装主要有两条路线。一是模板无关的隐式几何方法(如 PIFu、implicit shape),能捕捉多样外形但输出的是融合在一起的曲面几何;二是程序化系统(如 GarmentCode),用组合式程序显式定义面片与缝合关系,天然可仿真。
  • 核心痛点:隐式几何方法缺少显式缝纫结构(面片边界、缝线、拼接拓扑),会把尖锐接缝和边界抹平,无法直接进布料仿真;程序化系统虽可仿真,却依赖手工编写的程序和预定义组件,拓扑空间受限,难以从图像推断出任意新拓扑。两者之间存在一道”几何重建”与”结构化构造”的表征鸿沟。
  • 本文 idea:提出一种同时具备”图纸方法的物理严谨性”和”模板无关方法的灵活性”,又对学习系统友好的表征。把缝纫图纸拆解为面片、参数化边、缝线三类一等公民,几何与拓扑分离但用索引引用保持对应,形成一种标准化、可扩展、可学习的规范语言 PatternGSL,从而把”缝纫结构”本身提升为生成建模的直接预测目标。

方法

整体框架分两块:一是表征本身(PatternGSL 语言与其确定性编解码),二是预测框架(视觉-语言模型从单图生成这份规范)。图像先经辅助后视图合成补全被遮挡区域,VLM 自回归生成 GSL token 序列,再由确定性解码器还原成完整缝纫图纸并送仿真。

flowchart LR
  A["前视图 RGB"] --> B["NanoBanana 合成后视图"]
  A --> C["共享权重 ViT 编码"]
  B --> C
  C --> D["Qwen3-VL 语言解码器"]
  D --> E["PatternGSL token 序列"]
  E --> F["确定性解码 + 有效性修复"]
  F --> G["布料仿真 (NVIDIA Warp)"]
  G --> H["3D 悬垂服装"]

关键设计:

  1. 分层的 GSL 表征:以层次化 JSON 组织服装。meta 块存缩放因子 \(\sigma_{scale}\)、面片数与边界采样数 \(N_s\);panels 数组存每个面片的 2D 边界(有序顶点多边形)与 3D 摆放(平移、旋转、front/back 侧属性);stitches 数组存拓扑。局部坐标按 \(v_{gsl} = \sigma_{scale} \cdot v_{local}\) 归一化,使数值 token 在不同服装尺寸下保持稳定。

  2. 边与曲线的相对参数化:支持直线、二次/三次 Bézier、圆弧四种边类型。为避免随尺寸变化的绝对控制点坐标,曲线参数相对边端点表达,例如二次 Bézier 存 \((c_0, c_1)\),控制点还原为 \(p_c = p_0 + (c_0, c_1) \cdot L\)(\(L\) 为边长)。直线不存额外参数。对曲线边还额外存 \(N_s\) 个均匀采样点提供显式几何监督,而直线边完全省略采样,大幅压缩 token(多数边是直线,颈口、袖窿、下摆等关键曲线边仍获得丰富监督)。

  3. 显式缝合拓扑:每条缝线是带唯一 stitch_id 的 JSON 对象,用 (from_panel_id, from_edge_index) 与 (to_panel_id, to_edge_index) 精确指明哪两条边相连。相比”靠几何邻近推断缝合”的隐式做法,显式引用避免了几何上靠近但分属不同面片(如前后颈口)的歧义,能精确恢复拓扑。

  4. 规范化编码与确定性解码:编码前先做 canonicalize——面片名排序得到确定的 1 到 \(P\) 的 ID、面片内顶点顺序用索引数组保留、缝线改写成显式 (panel_id, edge_index) 引用,数值字段量化到两位小数,从而给 VLM 一个稳定训练目标。解码器做逆归一化 \(v_{local} = v_{gsl}/\sigma_{scale}\),并做轻量确定性有效性处理:合并过短共线边、剔除无效面片、校验缝线引用;曲线参数缺失时用边界采样点闭式回退。全程是规则化清理,不做基于优化的精修或人工修正。量化误差被约束到 \(\epsilon < 0.01/\sigma_{scale} \approx 0.04\) mm,低于典型仿真容差(约 0.1 mm)。

  5. VLM 预测与数据集:将单图缝纫图纸预测建模为条件序列生成 \(P(J \mid I) = \prod_{t=1}^{T} P(j_t \mid j_{\lt t}, I; \theta)\)。采用 Qwen3-VL,前视图与合成后视图用共享权重 ViT 独立编码,只在语言解码器阶段拼接融合,让跨视图推理留给结构化生成过程。配套构建 PatternGSLData——首个大规模图像到 GSL 配对数据集,30 万样本(25 万来自 GarmentCodeData 规范的合成渲染 + 5 万经 NanoBanana 转换的照片级图像做域适配),采用两阶段训练(先在合成/FAKE 上预训练,再在 REAL 上微调),用标准交叉熵损失做全监督。REAL 子集并非从真实照片人工标注,而是把已知图纸的服装渲染后再做真实化转换,标注继承自原始结构规范;真正的野外照片留作评测。

实验结果

数据集含约 25.8 万件服装、284 万面片、817 万缝线,平均每面片 6.91 条边、每件 31.66 条缝线,验证集包含训练未见的新拓扑。仿真用统一固定布料协议(sim_fps=60、substeps=10、max_steps=2400),不逐样本调参。主实验为验证集上 2D 图纸精度对比:

方法 2D Chamfer (mm)↓ 2D IoU (%)↑ Stitch Acc (%)↑
SewFormer 108.22 20.70 0.04
GarmentX 35.07 58.30 38.81
GarmentImage 29.07 58.50 N/A
Ours 5.78 86.34 98.48

本文在 2D Chamfer(5.78 mm,次优为 29.07 mm)和 2D IoU(86.34%)上大幅领先,98.48% 的缝合准确率印证了显式拓扑编码能保留隐式表征无法捕捉的连接信息。3D 仿真质量上,本文悬垂成功率 99.2%、仿真后 3D Chamfer 6.31 mm,而 GarmentImage 成功率仅 4.7%。生成可靠性方面:原始 JSON 有效率 100%,严格不修复的可仿真率 95.31%,经确定性校验后升到 99.2%(失败主要是接缝/拓扑不一致与退化三角形,而非语法错误)。

鲁棒性上,在后视图不可用/不可靠时仍达 12.23 mm、85.14%、97.78%;后视图与前视图严重不一致时退化为 31.35 mm、50.57%、66.18%,属可控退化。消融显示:曲线边采样 \(N_s=8\) 最优且”只采样曲线边”优于”采样所有边”,说明直线边的额外采样是噪声而非有用信号;训练配置上 8B 模型全量微调+解冻视觉编码器最好(2D IoU 85.14),LoRA 与冻结视觉编码器都明显更差。编辑方面实现面片缩放、曲线调整、组件移除、袖长扩展四种操作,40 个编辑样本 100% 通过仿真。

亮点与局限

  • 亮点:
    • 用一种标准化、可学习的规范语言弥合了”几何重建”与”结构化可仿真构造”的鸿沟,把缝纫结构提升为一等生成目标,兼顾模板无关的灵活性与图纸方法的物理严谨。
    • 显式存储缝合拓扑(索引对而非几何邻近推断),配合两位小数量化带来亚毫米精度,使预测结果无需优化精修或人工清理即可高成功率进仿真。
    • 贡献了首个 30 万规模的图像到 GSL 配对数据集,覆盖 2 到 37 个面片的多样拓扑,并展示了直接在 JSON 上做语义化编辑的能力。
  • 局限:
    • 依赖 NanoBanana 合成后视图与真实化渲染来构造 REAL 数据,当合成后视图与前视图在图纸/颜色/风格上严重不一致时性能明显下降,暴露了对被遮挡区域的强依赖。
    • REAL 训练子集并非真实照片人工标注,标注继承自结构规范,真实分布覆盖有限;确定性修复虽将成功率补到 99.2%,说明约 5% 的原始预测仍存在接缝/拓扑不一致。
    • 表征与仿真采用统一固定布料协议,未针对材质多样性(不同面料力学、多层服装)做深入验证。

延伸思考

这项工作把”结构化序列生成”范式引入服装建模,与近期把布局、网格、运动等结构化对象作为生成目标的趋势一脉相承——关键在于设计一个既紧凑又可解码、对 VLM 友好的规范语言。相较 GarmentX 的自回归生成或 Dress-1-to-3 的扩散先验+可微物理,本文选择直接预测 2D 缝纫图纸作为主输出,换来了拓扑感知监督、可编辑性与直接仿真三重收益,也提示”表征设计”往往比”更大模型”更能决定结构化任务的上限。值得追问的方向包括:能否把材质/面料属性也纳入 GSL 成为可预测字段;能否用真实带标注照片替代合成域适配以缩小 sim-to-real 差距;以及这套”规范语言 + VLM 预测 + 确定性解码”的思路是否可迁移到家具、鞋类等其他需要”可制造、可仿真”结构化输出的领域。