生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

它要同时记住任务,以及自己已经说了什么

原条件是一张红杯照片,草稿却已经写成“桌上是一只蓝色的……”。继续接“杯子”完全通顺,但句子会把先前的颜色错误延续下去。局部语言关系正确,没有补救它与图像条件的冲突。

图像条件始终保留已写前缀桌上是一只蓝色的杯子回看条件:这里是红杯
杯子一词接得顺,却延续了蓝色与红杯照片之间的冲突。

这里有两类来源不同的信息。照片、用户问题和格式要求是外部条件,规定这次要完成什么;已写前缀记录本次生成已经作出的选择。后续既要读懂已有句子,也要遵守原任务。照片始终在上下文里,只说明模型可以访问它,不证明它实际用对了颜色线索;是否使用仍要从输出与受控对照检查。当两者冲突时,不能仅因为蓝色已经写下,就把它升级为事实。

“下一词只能往后接,怎样把蓝色改掉?” 单纯追加“杯子”确实改不了前面的词。修订需要一个能回看并修改草稿的过程:发现颜色与照片不符,定位到“蓝色”,再将它改成“红色”。这可以由生成系统的另一轮检查或编辑步骤完成;不能把画面中的修订当成普通逐词追加自动具备的能力。

图像条件始终保留已写前缀桌上是一只红色的杯子回看条件:这里是红杯修订“蓝色” → “红色”L05:怎样找回需要的上下文?
纠正蓝色需要回看原条件并修改草稿,这是一项明确的修订过程。

一个最小对照能帮助分清两类条件:保留同样的蓝色前缀,只把输入照片换成蓝杯,句子就不再违反这一颜色要求。任务输入变了,应该改变评价;反过来,保持红杯照片不变,仅让草稿更流畅,不会改变最初的颜色证据。

这也引出生成目标与网络结构的分工。自回归规定按已有部分预测后续;RNN、卷积或注意力等结构则决定怎样保存和访问上下文。相同目标可以由不同结构实现,架构名本身不保证模型找到了正确线索。L05 会继续讨论相关信息怎样被找到、如何受干扰,以及生成系统怎样管理上下文。

至此,我们看过一条逐步接龙的路线。接下来换一种出发方式:先给一个紧凑起点,再整体解码出对象。会还原一把已有椅子,是否足以证明这种生成入口已经成立?

画面怎样推进

第1步

红杯照片与前缀中的蓝色冲突,任务依据仍应参与判断。

打开这一停点

第2步

继续接杯子可以局部通顺,却沿用了颜色错误。

打开这一停点

第3步

回看条件并把蓝色修订为红色,需要能修改草稿的过程;普通追加不会自动完成修订。

打开这一停点

学习材料

与当前画面直接相关

接住前缀,与服从照片,怎样分别检验?

固定草稿“桌上是一只蓝色的”,先配红杯照片,再配蓝杯照片。接上“杯子”在两组里都通顺,颜色条件却只有第二组成立。这个对照把语言接续与图像条件区分开:同一前缀可以是生成进度,也可能含有应被纠正的早期错误。

在红杯组里,继续追加词语不能改掉已写的“蓝色”;需要一轮能定位并修改草稿的检查。自检:照片始终在上下文中,能否说模型已经正确使用它?只能说允许访问;还要从受控变化和结果判断是否用对。保持任务条件可见,是使用证据的前提,不是成功证明。

继续读:外部条件与前缀的不同作用

连续阅读

CLS 02 · 自回归:学习条件与产生序列

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第2章,从对象和问题开始

阅读与实践

LAB 01 · 自回归:联合概率、贪心与温度

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Autoregressive Models

先分清外部条件和已生成历史,再选读架构怎样组织这些信息;后者是L05的预备阅读。

先看:第53–57页:条件;第67页起:序列架构