生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

旧方法怎样成为新系统的部件?

上一路径从已有图像出发:编码器产生表示,解码器把它还原成图像。下一条路径拿掉已有图像,让表示生成器从随机起点产生新的表示,再交给同一个解码器。末端部件没变,表示的来源变了。

这种替换成立有条件。新表示不能只是长度碰巧相同,还要在类型、尺度、空间组织和分布上与解码器所学接口相容。否则,解码器可能收到自己不会解释的输入;一个训练良好的图像解码器并不能保证任意上游输出都合理。

表示从哪里来?同一解码器接口保持兼容图像输出随机起点表示生成器生成兼容的表示
表示来源可以改变;同一解码器复用的前提是新表示仍与接口相容。

“系统用了 VAE 的解码器,为什么不直接叫它 VAE?” 因为部件身份没有说明整套样本如何产生。若新表示由自回归模型按序产生,整体生成组织就包含自回归;若它由扩散过程逐步更新而来,系统还包含扩散。自动编码器或 VAE 学到的表示与解码能力,可以作为这些系统共享的基础。

这与 N13 的两项检查相连:表示与解码决定哪些细节能够被恢复,上游生成决定怎样在这个空间里产生新组合。它们可以分工,也必须一起接受端到端检验。某个部件可靠,不代表整个接口组合已经可靠。

因此,四种模型不宜理解成轮流淘汰前一代的名单。它们可能改变数据表示、训练反馈、概率组织或使用时的计算过程,回答的层次并不总相同。分析新系统时,先定位它到底换了哪一项、保留了哪一项,比只凭一个缩写归类更有用。

现在已经能把一个新表示变成可见椅子。但若没有一张与它逐一对应的标准答案,怎样告诉生成器哪些地方不像真实样本?下一章让反馈本身也成为一个可学习的部件。

画面怎样推进

第1步

真实输入经编码提供表示,同一解码器负责将兼容表示还原为图像。

打开这一停点

第2步

表示来源改成生成器后,解码器可继续使用,但类型、尺度与分布等接口仍须相容。

打开这一停点

第3步

能解码出结果之后仍要评价它与真实样本的关系,下一章让反馈也成为可学习部件。

打开这一停点

学习材料

与当前画面直接相关

保留解码器,换掉上游,需要守住什么接口?

先从原图编码的潜网格检查重建,再让新生成器提供潜网格。即使两者形状相同,若上游把数值尺度放大一百倍,或交换了空间位置,解码器收到的也可能是训练中很少见的输入。这个构造干预说明,接口相容还包括类型、尺度、空间组织与分布,不只是数组长度。

自检:系统用了 VAE 解码器,整套系统是否都叫 VAE?还要看新潜变量怎样产生:AR 按序构造代码,扩散反复更新潜状态,可以共用同一解码器。部件提供像素恢复能力,上游负责新组合的联合结构;两项要分别观察,再检验完整任务。方法的部件复用没有取消生成入口的检查。

继续读:潜表示怎样成为后续生成接口

连续阅读

CLS 03 · 潜变量:从重建到生成

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第3章,从对象和问题开始

阅读与实践

LAB 07 · 图像 VAE:重建与可用起点

先比较原图与重建,再看同一先验起点。只改变 KL 权重,读取重建与编码区域的权衡。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

LAB 02 · VAE:ELBO 缺口与重参数化

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Variational Autoencoder

沿表示来源到解码器追踪一次生成,判断系统改了上游先验、表示还是解码部件。

先看:第79–81页:表示在生成系统中的复用

Autoregressive Models

用同一接口比较“编码真实输入”和“生成新表示”,核对复用解码器需要的条件。

先看:第17–19页:生成表示