GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
University of Toronto
一句话总结
GimmBO 把”给若干扩散模型适配器(LoRA)挑选线性融合系数”这件靠手动拉滑块试错的事,转化为一个由用户偏好驱动的高维贝叶斯优化问题,并用两阶段搜索策略在 20–30 维系数空间里高效收敛到用户满意的图像风格。
研究背景
- 领域现状:基于微调的扩散模型定制(DreamBooth、LoRA 等)催生了大量社区适配器,每个捕捉一种主体或风格。同一基座模型上的适配器可以线性融合(\(W_{\text{merged}} = W_0 + \sum_{i=1}^{n} \alpha_i \Delta W_i\)),从而在一个巨大的连续设计空间里合成全新视觉效果。Civitai 上 69% 的适配器生成都用到了多适配器融合。
- 核心痛点:目前用户只能靠手动拉滑块逐个调 \(\alpha_i\),看一张、改一次、再等生成,反复试错。这种方式在 5–10 个滑块以上就急剧退化,而实际候选集常有 20–30 个适配器。已有的交互式设计优化方法(含此前的贝叶斯优化交互系统)大多只适用于 3–12 维低维空间,直接放到 20–30 维会提出被截断(clamp)或质量崩坏的样本。
- 本文 idea:把系数选择建模为人在回路的偏好式贝叶斯优化(Preferential BO),并从真实使用数据中提炼两条结构先验——融合往往是稀疏的(多数只激活 2–9 个适配器),且系数总和偏小(多落在 1.0–3.0)——用这两条先验设计一个两阶段 BO 后端,专门对付高维带来的采样低效问题。
方法
整体框架:GimmBO 迭代进行。每轮由代理模型(高斯过程)配合采集函数提出一批候选系数向量,为每个向量生成图像展示给用户排序,用户的成对偏好反过来更新代理模型和采集函数,逐步逼近用户心中的效用函数 \(f\)。
flowchart LR
A["候选适配器集 (20-30 个)"] --> B["从 B-capped 单纯形采样系数"]
B --> C["生成图像批次"]
C --> D["用户排序 top-k"]
D --> E["更新偏好高斯过程代理 f_hat"]
E --> F["UCB 采集函数提议新批次"]
F --> C
E --> G["阶段一收敛后固定稀疏模式"]
G --> H["阶段二在激活子集上精修"]
关键设计:
-
偏好式代理模型。用户无法给出数值效用,只能表达”图 A 比图 B 好”。方法把展示的 \(N\) 张图让用户排出前 \(k\),转成一批成对不等式 \(\boldsymbol{\alpha}_i \succ \boldsymbol{\alpha}_j\),再用 Chu 与 Ghahramani 的偏好学习把不等式转成潜在效用值,最后用稀疏轴对齐子空间(SAAS)先验拟合高斯过程后验。SAAS 先验天然偏好”只有少数维度重要”,正好契合稀疏观察。
-
B-capped 单纯形搜索空间。当候选集大时,直接在整个单位超立方 \([0,1]^n\) 采样会得到大量无意义图像,浪费用户反馈。方法据”系数总和偏小”的观察,把搜索空间收紧成一个受帽约束的单纯形 \(\Delta_B = \lbrace \boldsymbol{\alpha} \in [0,1]^n \mid \sum_{i=1}^{n} \alpha_i \le B \rbrace\)。这个几何体的体积随维度急剧缩小(如 \(\mathrm{Vol}(30; 2) < 10^{-21}\%\)),默认取 \(B=2\),把采样集中到”有意义”的区域。
-
单纯形上的高效采样与采集。因为 \(\Delta_B\) 体积极小,从超立方拒绝采样不可行。方法改用一个修正的 Dirichlet”折棍”过程:\(\alpha_i = \min(x_i R_{i-1}, 1)\)、\(R_i = R_{i-1} - \alpha_i\)、\(R_0 = B\),并对每个样本随机打乱坐标顺序以缓解坐标偏置,再用阈值 \(\tau\) 把小项清零进一步稀疏化。采集函数用批量 UCB,\(\phi(\boldsymbol{\alpha} \mid \hat f) = \mu(\boldsymbol{\alpha}) + \lambda \sqrt{k(\boldsymbol{\alpha}, \boldsymbol{\alpha})}\),通过把折棍过程当作参数化、对超立方点 \(x\) 做多重启的 L-BFGS-B 上升来在单纯形内求批量极大。
-
两阶段优化。假设候选集大但最终激活集小。阶段一在 \(\Delta_B\) 上搜索全部系数、鼓励稀疏且有意义的组合(默认 \(T_1=10\) 轮);随后提取当前最优向量的稀疏模式,固定只保留少数非零项 \(z < n\),阶段二在 \([0,1]^z\) 上无约束精修(\(T_2=9\) 轮),并复用已有的同稀疏模式样本。此外用 SDEdit 做轻量内容控制,用无适配器基座生成的参考图约束内容,让用户专注调风格。
实验结果
主实验为 20 维模拟用户匹配任务:给定目标图(仅模拟用户可见),用 DreamSim 感知相似度作为偏好判据,5 张初始 + 20 轮迭代、每轮 8 次推理,对比线搜索类(坐标下降、方向下降)与既有 BO 交互方法。GimmBO 在收敛速度、成功率(相似度阈值 0.9 / 0.95)与稀疏模式恢复(F1)上全面领先,且在 30D、40D 压力测试中优雅退化、持续优于 Sequential Gallery。
下表取 12 人用户研究中”计入 60 秒推理时间”设定下的中位相似度对比(该设定最能反映真实算力受限场景):
| 方法 | 中位相似度↑ | 说明 |
|---|---|---|
| GimmBO(本文) | 0.956 / 0.926 | 分别对 slider / gallery 的配对比较,均有统计显著性 |
| User Slider | 0.898 | 手动拉滑块基线 |
| Sequential Gallery | 0.854 | 设计画廊式 BO 基线 |
消融显示默认配置(\(B=2\)、top-5、含历史样本)最优:受帽单纯形约束(\(B\lt n\))、top-5 排序、纳入历史样本各自都带来增益;即便在与 Sequential Gallery 对齐交互预算的配置(\(B=2\)、top-1、不含历史)下,GimmBO 仍大幅胜出,说明优势来自方法设计而非增加用户工作量。扩展实验进一步验证:与 Stylus 粗检索结合可端到端自动组集并交互探索;从风格推广到内容(发型、眼镜、表情等 25 维属性)匹配成功率 67%;找到的融合配置还可经 SDEdit 复用到新图做一致风格化。
亮点与局限
- 亮点:
- 把”高维、黑箱、评估昂贵”的适配器融合系数选择,干净地落到人在回路偏好式 BO 框架里,并用真实使用统计(稀疏性、系数总和小)提炼出可直接编码进搜索空间的结构先验。
- 两阶段”先在受帽单纯形上找稀疏骨架、再在激活子集上精修”的设计针对性强,配合折棍采样解决了单纯形体积极小带来的采样难题。
- 评估扎实:模拟用户 + 12 人真实用户研究 + 30D/40D 压力测试 + 消融,且诚实区分”仅算交互时间”与”计入推理时间”两种预算下的结论。
- 局限:
- 仅在线性融合上评估(方法本身不依赖线性),其他融合方式留作未来工作。
- 默认超参下 GimmBO 的每步交互时间明显高于基线(50.5s vs 滑块 34.7s、画廊 10.6s),需靠减小 top-\(k\)、去历史样本等换取时间;论文也承认在仅按交互时间对齐预算时,对 gallery 的优势不显著(\(p=0.397\))。
- 折棍过程引入已知的坐标顺序偏置(虽疑似在此设定下”歪打正着”有益,但缺乏系统理解);DreamSim 作为效用度量衡量的是感知相似度而非风格本身,可能混淆内容与风格。
- 偏好可传递性假设是否常被违反、以及如何应对,未作检验。
延伸思考
这项工作的价值不在于新的生成模型,而在于把”人在回路的高维主观优化”这一通用难题,通过领域结构先验(稀疏 + 小幅度)压回到 BO 能高效工作的范围——这套”用真实使用数据反推搜索空间几何”的思路,对其它高维创意参数调控(材质、光照、动画风格)同样有借鉴意义。论文也点出几个值得追问的方向:如何把偏好搜索、稀疏结构、分阶段探索迁移到参考图条件、风格注入等在隐空间而非显式参数上操作的定制范式;以及在单用户、低反馈预算下如何让 RLHF 变得可用。另外文中对 Civitai 上适配器被用于非自愿性化真实人物的伦理风险给出了直白的讨论,提醒此类交互式融合工具的双刃剑属性。