生成模型:一个要求,怎样产生多个合理结果?
上一讲讨论表示与多模态:模型怎样从观察中保留有用信息。这一讲把问题向前推进一步:给定一个要求,模型怎样构造原先没有给出的结果?为什么同一要求可能有多个好答案,而一个漂亮答案仍可能不能用?
我们先用红杯、椅子和成对鞋把问题说清,再比较自回归、VAE、GAN 与扩散如何组织生成。最后把生成的对象从图片和文字扩展到未来状态:如果模型预测了一个动作的后果,什么证据能让我们相信它?
阅读时先沿课堂顺序看对象与变化;某个例子没想通,就打开“本页说明”;想改变条件、核对算例,再进入“学习材料”推荐的阅读或实验。说明里的基础解释不依赖你先完成 Notebook。与同学或 AI 讨论时,直接分享当前页网址,就能定位到这一个问题。
课前请从阅读问卷记录自己的初步判断。读完本讲后可以再回看:哪些判断改变了,改变它的是哪一个例子或哪一条证据?
先从一张普通桌面开始:找到红杯,与补出杯柄,究竟差在哪里?
画面怎样推进
第1步
一个要求可以容纳多个完整结果;本讲比较它们怎样产生,以及哪些证据支持使用。
打开这一停点学习材料
与当前画面直接相关
把一个要求拆成四个可检查的问题
先用“在原桌面上补出红杯杯柄”练习:条件是可见杯身和桌面,输出是缺失区域的像素,允许变化的是没有被观察到的柄形,检验对象是连接、视角和遮挡关系。把这四项写清,才知道两个不同答案为什么可能都成立,悬空的杯柄又错在哪里。
之后读每种方法,都沿同样的问题追踪:训练时拿什么作反馈,生成时从哪里开始,哪项参数真的学了,结果还要怎样验证。能画出候选,与能确认这只实物没有裂纹,需要不同证据。这条区分会贯穿图片、代码和行动。
连续阅读
CLS 01 · 从条件多解到生成目标
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第1章,从对象和问题开始
阅读与实践
LAB 01 · 自回归:联合概率、贪心与温度
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Introduction
用一组不同却都合理的结果建立本讲问题。先看例子,不必从概率推导开始。
先看:第11–27页:条件多解与分布建模
