谷歌研究院发布Diffusion Controller:冻结主干模型也能精确调控图像生成

来源:互联网 时间:2026-09-30

A5站长网9月30日消息,谷歌研究院在官方博客介绍了一套名为Diffusion Controller的图像生成控制框架。它把图像生成当成一个可以连续调节的控制问题来处理,而不是一堆互不相干的技巧。目标也不是再造一个模型,而是解决一个长期存在的麻烦:想让图像生成模型精确满足用户意图,往往是件顾此失彼的事。

麻烦出在方法太碎。工程师手上有一堆互不相关的工具:推理期用的无分类器引导,靠调文字提示的影响强度来左右生成;LoRA这类轻量适配器,靠改一部分权重来贴合风格;还有一批基于奖励的微调手段。它们各自有效,却没有统一的语言来描述、比较和组合。结果就是在平衡听指令和画得好看这两件事时,很大程度靠经验试错,引导一强,画质就容易崩。

Diffusion Controller换了个视角。扩散模型的反向去噪过程,可以看成一个连续的随机控制问题,控制的作用方式是重新给预训练的转移核加权,同时用一个f-散度惩罚项约束偏离原来模型有多远,让优化目标与画面稳定性之间有个可算的平衡点。在这套框架下,作者推导出两类能落地的微调算法:一类是f-散度正则化的策略梯度更新,包含PPO风格的做法;另一类是奖励加权回归。

更有工程价值的是参数化方式。按这套框架推导出的最优解,可以拆成固定不动的预训练基座,加一个轻量的控制修正,于是实现上只需要在中间去噪结果上接一个小的控制网络,主干模型全程冻结。论文里这个附加网络大约一千二百万参数。好处是对不开放权重的闭源模型也能用——接入方拿不到模型内部,照样可以在外面挂一层控制。

实验在Stable Diffusion v1.4上完成。在只暴露部分中间输出的灰盒设定下,这套方法在监督微调与奖励加权损失两条线上都超过LoRA,HPS-v2指标上的胜率为0.6815,对比LoRA的0.6109;在可以改动内部权重的白盒设定下,对基线模型取得90%的胜率。需要说明的是,这些是论文里的实验结果,属于研究进展,并不是可以直接上线的产品工具。

作者列出的后续方向包括个性化、安全机制与视频生成。论文与代码已经公开,在Stable Diffusion v1.4上的实验可以复现。真正值得观察的,是这套控制层在Flux等更新架构上的表现,以及独立复现能不能给出同样的结论。

相关文章

标签:

A5创业网 版权所有