生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

视觉词汇:编号怎样查回表示?

局部图块被编码为编号 B。B 本身不画出椅背,也不直接告诉解码器它应该是什么形状;它首先是字典地址。沿 B 查到一份学到的表示 E,后续部件实际使用的是这份表示,再将它解码成局部图像。

局部图块当前编号B小字典ABC取出的表示局部重建表示 E沿编号查表,送入的是表示
B是地址;真正进入后续解码的是字典查回的表示E。

在向量量化中,模型学习有限的码本,把连续局部表示指派给其中较接近的一项。于是图像可以写成一组索引,另一个模型再学习这些索引之间怎样搭配。量化使接口离散化,也会把原来不同的细节合并到同一项,带来压缩取舍。

现在同时把索引 B 和字典里那一行的名字都改成 Q。查到的表示没有改变,送进同一个解码器的内容也没有改变,所以输出可以完全相同。若只把输入索引 B 换成已有的 C,而字典不动,就会查到另一份表示;这次真正改变了后续输入。

局部图块当前编号Q小字典AQC取出的表示局部重建同步改名 B → Q:表示与重建不变只改索引:B → C字典仍按原行查取到另一份表示
同步重命名保留表示内容,只换索引却可能查到另一份表示。

“编号相近,图像也应相近吗?” 不一定。编号用于标识,不能仅凭数值差判断视觉差异;一致重命名不应改变其含义。表示向量之间可以有模型定义的几何关系,但那是被查出的内容的关系,不是任意编号天然具有的关系。

可以把一个更简单的生成器想成“随机选一个类别,输出它的代表图”。它有起点和选择,但若只输出有限模板,变化能力也就受限。VQ 码本中的条目则常是局部表示,整幅图来自许多位置的组合与解码,不能把每个编号都误认为一张固定的完整图片。组合仍须学习相容关系,不是任意排索引都成立。

离散化还涉及码本利用、量化误差和训练时怎样处理离散选择,细节放在相关材料。它是有用选择,但不是自回归的必要定义:连续视觉表示也可以通过合适的条件生成器来建模。

分清地址和内容后,下一页就能看懂系统复用:即使产生表示的方式变了,只要交给后端的是相容表示,同一个解码器仍可能继续使用。

画面怎样推进

第1步

B是字典地址,不是椅背形状本身。

打开这一停点

第2步

沿B查到表示E,后续解码使用的是表示内容。

打开这一停点

第3步

同步把B改名为Q不改变查出内容;只换成C会取到另一份表示。

打开这一停点

学习材料

与当前画面直接相关

编号相近,为什么不代表图块相近?

假设地址 B 查出向量 eB,地址 C 查出 eC。解码器真正收到的是向量,而非字母外观。把地址 B 一致重命名为 Q,仍查出 eB,输出可以不变;只把输入换成 C、字典不动,才改变了实际送入内容。若上游模型也预测这些地址,它的输入与输出编号同样需要同步置换。

所以编号 3 与 7 的平均 5 没有可靠图像意义:任意重编号即可改掉这个运算,表示内容却未变。自检:每个编号都在码本里,随机排满网格是否合法?局部可查表不保证相邻笔画和整体布局相容;量化保留了有限表示,代码联合先验还须学习它们如何组合。

继续读:离散码本的地址、向量与训练规则

连续阅读

CLS 03 · 潜变量:从重建到生成

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第3章,从对象和问题开始

阅读与实践

LAB 07 · 图像 VAE:重建与可用起点

先比较原图与重建,再看同一先验起点。只改变 KL 权重,读取重建与编码区域的权衡。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

LAB 02 · VAE:ELBO 缺口与重参数化

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Variational Autoencoder

比较有限完整模板与局部码本,沿索引、码向量、解码结果逐层辨认;梯度更新细节在认清对象后再读。

先看:第50–67页:有限表示;第69–78页:向量量化