生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

两种合理结果,平均起来可能哪一种都不像

题目没有固定椅子在画面里的位置,因此左侧一把完整椅子成立,右侧一把完整椅子也成立。现在逐像素平均这两幅图:左边保留一半椅子的颜色,右边也保留一半,结果是两份半透明重影。它在数字上做了折中,却没有选择一把完整椅子的位置。

这解释了为什么“接近所有参考答案”与“交出一个合理样本”可能冲突。平均图不是把一把椅子平稳移到中间,而是在每个像素上折中两幅图。图像里的对象结构不一定在这种平均运算下保持。

平均:两份重影选择:一把完整椅子同样尺度,比较结果本身
像素平均留下两份半透明轮廓,取一个完整样本则保留一把结构完整的椅子。

一个更小的数值例子可以看清评分的作用。假设答案等概率为 −1 或 +1,只允许模型输出一个数,并用平方误差评分。输出 0 时,两种情况下误差都为 1;输出 +1 时,一半误差为 0,另一半为 4,平均误差为 2。于是这套单点评分偏好 0,但若任务要求从两个合法答案中给出一个样本,0 恰好都不是。

“所以均值预测是错误的方法吗?” 不是。若任务就是估计平均数量或最小化平方误差,均值可能正是合适答案;问题出在把这个答案直接当作完整候选。当多种可能路线分别绕过障碍,而平均路线穿过障碍时,也会出现相同区别:算术折中不保证保留可行性。

在固定方差高斯观测模型等条件下,像素平方误差会鼓励相应的均值行为;换观测模型、条件或生成过程,结论可以改变。不能据此断言所有 VAE 必定模糊,也不能看到扩散训练里的均值预测,就断言最终采样只能是一幅重影。N31 会专门区分预测器在当前状态给出的信息,与整个迭代过程交付的完整样本。

这里的要点是把目标说清:要一个平均估计,还是要一个满足结构的具体实现?改为从不同潜变量取完整样本后,我们还需要检查这些起点是否广泛可用。下一页看为什么一条漂亮插值路径回答不了这个问题。

画面怎样推进

第1步

位置未被条件固定,左侧与右侧的完整椅子都是允许答案。

打开这一停点

第2步

逐像素平均产生两份半透明重影,没有交付一把完整椅子。

打开这一停点

第3步

某种评分偏爱的平均估计未必是结构成立的样本;结论须保留相应评分与输出假设。

打开这一停点

学习材料

与当前画面直接相关

平均误差最小,为什么仍不是一个合法样本?

让结果以相同概率取 −1 或 +1。确定地输出 0,平方误差总为 1;输出 +1,一半误差为 0、一半为 4,平均是 2。因此均值 0 确实优化了这项评分,却不属于真实结果集合。两把不同位置的椅子逐像素平均,可能得到重影,也是“数值折中没有保留样本结构”的例子。

自检:这是否证明均值预测都错误?不。若任务是最小化平方误差,0 正是答案;若任务是交付一次可能发生的结果,需要进一步组织分布与采样。解码器显示的均值或概率图,也应与最终观测抽样区分。不能从这个小例子推出所有 VAE 必然模糊,或扩散最后只能交付平均图。

继续读:均值目标与独立样本评分 · 解码器的观测分布

连续阅读

CLS 03 · 潜变量:从重建到生成

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第3章,从对象和问题开始

阅读与实践

LAB 07 · 图像 VAE:重建与可用起点

先比较原图与重建,再看同一先验起点。只改变 KL 权重,读取重建与编码区域的权衡。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

LAB 02 · VAE:ELBO 缺口与重参数化

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Variational Autoencoder

寻找高斯观测假设和平方误差的对应条件;说明为什么这一结论不能概括所有VAE或完整扩散采样。

先看:第23–28页:观测模型与重建评分