生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

能还原这把椅子,能否从零造一把新椅子?

先把一张已有椅图送进编码器,取得紧凑表示,再由解码器还原。若输出保住了椅背、材质和朝向,这说明从这张输入出发的一条重建路径有效。起点并非凭空选的,而是编码器根据真实椅图提供的。

输入来源同一解码器输出样本解码器参数不变已有椅图表示还原这把椅子
已有椅图经编码器给出起点,重建检验的是这条往返路径。

现在拿走原图,只给同一个解码器一个新起点。解码器参数没有改变,输入的来源却变了:这次没有编码器把我们送到一个已经会解释的位置。若随手取的数落在训练少见甚至没见过的区域,输出可能不成椅子。

“解码器已经会画椅子,为什么不能随便给它一串数?” 能处理一些输入,与能处理任意输入不是同一个承诺。生成系统还需要规定从哪里、按什么分布抽起点,并让这些起点与解码器训练过的表示相容。只观察到一把好椅子,也不足以验证这个抽取规则的整个范围。

输入来源同一解码器输出样本解码器参数不变z1z2z3独立的小起点样本 1样本 2样本 3哪些起点可用?材质、方向可以不同
新起点不再由当前原图提供;同一解码器能否处理规定采样范围,要另外检查。

这种紧凑起点通常叫潜变量。它可以承载外观、形状或布局等变化,但不必每个坐标都对应一个人类命名的属性:改变一个方向,可能同时影响材质与角度。潜变量首先是组织可见结果的内部变量,是否易解释需要另查。

用潜变量模型描述一个可见结果的可能性时,也不能只检查“最像”的一个起点,而要考虑不同起点生成该结果的贡献。训练阶段的编码器帮助推断哪些起点能够解释当前图像;生成阶段则从规定的先验分布抽起点,不再需要一张待编码的原图。

普通自动编码器的重建能力没有自动解决这个新入口问题。VAE 试图把数据解释与可采样的潜在空间放到同一个训练任务里。这还不是“从任意数字都能生成好图”的保证;下一页把需要兼顾的两项检验并排展开。

画面怎样推进

第1步

真实椅图经编码与解码重建,首先检验已有输入的往返路径。

打开这一停点

第2步

从独立小起点调用同一解码器改变了起点来源,没有原图提供编码。

打开这一停点

第3步

需要检查规定采样范围里的新起点是否可用,而不是只展示一个好样本。

打开这一停点

学习材料

与当前画面直接相关

解码器会重建,新的数字为什么仍可能无效?

重建的起点来自输入图像,编码器把它送到有利于还原的位置;无输入生成的起点来自另行规定的分布。两条路虽然共用解码器,访问区域却可能不同。把“能解释训练覆盖的代码”扩大成“任意代码都有效”,多加了一项没有检查的承诺。

LAB07 给出真实反例:仅保留随机编码重建目标的 β=0 模型,测试重建 NLL 降到 16.061,但测试编码均值平均离原点约 12.32;标准正态起点主要访问更小尺度。自检:十张重建清楚,能否接受标准先验生成已成功?先把输入图拿走,固定先验起点看同一解码器的输出,才是在检查新的入口。

继续读:重建区域与先验入口的实际差异

连续阅读

CLS 03 · 潜变量:从重建到生成

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第3章,从对象和问题开始

阅读与实践

LAB 07 · 图像 VAE:重建与可用起点

先比较原图与重建,再看同一先验起点。只改变 KL 权重,读取重建与编码区域的权衡。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

LAB 02 · VAE:ELBO 缺口与重参数化

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Variational Autoencoder

沿真实输入编码与先验采样两条路径读,检查没有原图时起点从哪里来;积分式放在路径理解之后。

先看:第4–23页:潜变量与生成模型