生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

只记录了一张图,怎样学会补出其他可能?

每条记录只提供一次具体结果,但训练并不是为每张照片另造一个模型。同一套参数在许多杯型、角度、遮挡和背景中反复更新:共同的结构被共享,变化与条件之间的关系也被学习。因此,新输入可以组合已经学到的结构并配合采样得到新结果;不是要求这一张照片独自列出全部答案。 上一页让我们看见,生成要学习完整结果中的关系。但训练资料通常没有列出一个条件下的全部可能答案:一张照片只有当时的杯柄,一句话只有实际接下去的下文。这样的记录怎样提供练习?

把红杯照片的杯柄区域遮住,可见部分就成为输入,被遮住的原始区域成为比对依据。模型先根据可见部分预测,再把预测与记录中的杯柄比较,用差异更新参数。答案来自照片自身,所以不需要有人逐张额外写出杯柄标签;这就是一种自监督造题方式。目标用于评分,并不因此成为这一次作答时的可见输入。

作答,再与记录比较遮挡输入共享计算预测补全预测已知答案比较反馈只修改计算
原记录提供比对目标;模型作答只读取允许输入,预测后的比较才形成训练反馈。

“照片里是弯柄,方柄补全是不是一定错?” 对“还原这张记录”这道训练题,弯柄是监督答案;对“给出满足可见条件的合理补全”这个任务,单张照片没有证明方柄绝不可能。训练记录提供了一次发生的结果,没有枚举完整可能性。如何学习并表达这些可能性,还取决于训练目标和模型。

模型不是为每张照片孤立地记一套规则。很多杯型、视角和背景的记录共享同一套参数,杯身与杯柄如何连接、某种光照怎样影响表面等规律可以跨样本积累。这使新组合成为可能,却不是保证:缺少某类结构的记录时,模型仍可能补错;把一张图遮一千次,也没有新增一千种杯型。

预测过程还可能形成能复用的表示。例如,为了补上杯柄,模型需要保留边界与几何关系;这些信息可能帮助新的识别任务。但“可能有帮助”必须由新任务检验,不能从预训练目标直接推出迁移成功。

在这里可以区分三个问题:生成描述要交付怎样的结果;自监督描述训练答案来自哪里;基础模型描述同一底座能否支持多种任务。遮挡预测得到的表示可以用来分类,生成模型也可以使用人工配对资料;这三个名称并不是互相替代的标签。

自监督也没有使原记录自动为真。错误描述和失真的记录一样可以被用来造题,模型可能学会它们的错误;自动获得目标,不等于自动获得可信事实。无需逐张标注扩大了可用学习信号,却没有取消数据筛选、覆盖和质量问题。接下来,我们把同一红杯交给不同任务,看看共享模型入口之后,哪些成功标准仍然不能共享。

画面怎样推进

第1步

遮住杯柄使一张记录同时提供输入和比对答案,但这次记录没有枚举所有合理补全。

打开这一停点

第2步

预测与被藏起的记录比较,反馈更新参数;目标留在评分端,不进入本次输入。

打开这一停点

第3步

同一套学到的计算可以用于新照片;参数可复用不等于这次迁移已通过检验。

打开这一停点

学习材料

与当前画面直接相关

训练答案在记录里,为什么不能提前给模型看?

遮住照片里的杯柄后,可见部分是输入,原杯柄是评分目标。模型先预测,再比较;若把原杯柄也放入作答输入,就不再检验从可见部分恢复缺失信息的能力。目标属于训练程序掌握的信息,并不自动属于模型这道题允许读取的信息。

一张记录只给出一种曾发生的杯柄;许多记录共享参数,才能逐渐学习不同视角、杯型与连接关系。把一张照片遮一百次增加了练习题,却没有新增一百种杯型。自检:生成一个不同但相容的柄,是否必定不合法?对还原这张记录,它偏离了目标;对合理补全任务,单张目标没有排除全部其他可能。

继续读:一条记录怎样成为学习信号

连续阅读

CLS 01 · 从条件多解到生成目标

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第1章,从对象和问题开始

阅读与实践

LAB 01 · 自回归:联合概率、贪心与温度

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Language Models are Unsupervised Multitask Learners

看文本记录如何提供学习目标、不同任务如何进入上下文;区分训练目标与迁移证据。

先看:第2–3页:语言建模与任务表达

Deduplicating Training Data Makes Language Models Better

理解自动取得大量文本之后,为什么重复、数据质量与评测独立性仍会影响学习。

先看:摘要与第1–3页