生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

四条路线,都在把可能性变成一个完整结果

四行结果可能都很像真实对象,但辨认方法时,应先看它从哪里开始、怎样得到完整结果。终图本身通常不足以告诉我们用了哪一种生成模型。

自回归把结果拆成有顺序的部分:先作一个选择,再把已有结果作为下一步条件。VAE 建立潜变量与图像之间的联系:生成时从规定的起点分布取值,再由解码器产生可见结果。GAN 用一个学到的评价者参与训练,让生成器逐渐缩小生成样本与真实样本的差别;常见使用路径是从随机起点经生成器直接出图。扩散则从受扰状态出发,利用预测与更新规则反复改动同一份状态,逐渐形成样本。

AR已有部分红左鞋选择下一部分成对VAE小起点同一解码器整体GAN随机输入生成器候选扩散同一状态连续更新
沿各行的起点和生成过程比较;相似终图不能代替生成过程的区别。

这张地图比较的是常见的组织方式,不是四个完全不相交的盒子。VAE 和 GAN 都可以从紧凑的随机起点出发,区别还涉及训练关系;自回归和扩散也可以在潜在表示里工作,共享同一个图像解码器。只看到“随机数→神经网络→图片”,还无法分清整套方法。

“GAN 有评价者,每次生成都要让它挑图吗?” 通常不用。评价者主要在训练时提供反馈,使生成器参数发生改变;训练好之后,生成器可以直接产生样本。训练时需要什么,与使用时实际走哪条路径,要分开追踪。

比较一个方法时,可以按五件事理解:任务要求什么,结果用什么表示,训练反馈来自哪里,参数怎样更新,使用时怎样取出样本。网络结构只是其中一环。Transformer 不是自回归的同义词,U-Net 也不是扩散的定义;相同网络可以服务不同目标和采样过程。

下面先从最容易亲自做出的过程开始:既然要交付一双同色鞋,选完左鞋后,右鞋该怎样决定?这次我们不只检查组合,而是用依赖关系真正组织一次生成。

画面怎样推进

第1步

观察起点与中间状态:逐步追加、从紧凑起点解码、生成器出图和反复更新有不同组织。

打开这一停点

第2步

四种路线区别涉及表示、学习反馈与采样过程,不能只由终图或网络名字区分。

打开这一停点

第3步

GAN评价者主要在训练中改变生成器,通常不是每次使用时的必经关口;部件与系统可组合。

打开这一停点

学习材料

与当前画面直接相关

只看“随机数进、图片出”,能认出模型路线吗?

VAE 与 GAN 都可能在使用时把随机潜变量交给一个网络直接出图;只看这条箭头,无法区分二者。还需读训练:VAE 怎样用输入推断潜分布并兼顾重建与先验,GAN 怎样让判别器反馈改变生成器。两套训练关系可以产生外表相似的使用接口。

自回归要追踪已提交部分如何成为下一步条件;扩散要追踪同一带噪状态怎样反复更新。自检:图中用了 Transformer,能否认定是自回归?不能,网络结构决定怎样计算,目标与采样规则决定它在做哪种生成。比较方法时把表示、反馈、参数更新与使用路径分别写清。

继续读:四条路线的训练与使用分工

连续阅读

CLS 01 · 从条件多解到生成目标

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第1章,从对象和问题开始

阅读与实践

LAB 01 · 自回归:联合概率、贪心与温度

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Introduction

用这组拆分重新标注四条路线,分清生成组织、网络结构和训练反馈。

先看:第29–36页:建模、表示、目标与采样