生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

一张照片,怎样自动变成很多道训练题?

上一页区分了两件事:训练时,可以拿一张已知照片主动加噪;生成时,却没有一张指定原图等着从噪声中找回来。这一页接着回答:既然没有人逐张手写答案,模型的训练题和批改依据从哪里来?

从那张红杯照片出发,我们主动加入扰动。扰动较轻时,杯子还容易辨认;扰动较重时,可见的信息更少。同一张照片可以在不同难度、不同扰动下,形成许多道题。难度标记也要送给模型:同样一片模糊颜色,在轻度受损时可能值得保留,在重度受损时则可能主要来自扰动。训练时可以直接抽一个噪声等级来造题,不必每次从头逐步损坏到这一等级。时刻标签必须与实际采用的噪声日程匹配;错贴难度会让模型用错误前提解释输入。

关键是把出题者掌握的信息与作答模型可以看到的信息分开。出题者保留原图,也知道这次加入了什么扰动。这里训练的是预测扰动的模型:它收到的是受损图与难度,给出对扰动的预测。之后,训练过程把预测与已知扰动比较,并用差异调整模型参数。

出题仅供出题模型输入受损图难度预测器预测比较监督:已知扰动反馈改参数
原图和已知扰动用于出题、批改;模型的合法输入只有受损图与难度,反馈回到同一套参数。

干净照片没有因此变成这次作答的输入。它参与了造题;知道答案的批改者也没有把答案提前塞给模型。无需逐张人工标注,不等于没有训练答案或目标:这里的目标来自我们已知的造题过程。许多照片、许多难度下的题目,训练的是同一套模型,而不是每张照片单独配一个模型。

学生:“既然已经知道加了什么噪声,为什么还要让模型猜?”

教师:“我们知道,是因为这道训练题由我们制造。让模型在不知道这次扰动答案的情况下作答,再给反馈,是为了让它学会从受损输入与难度中提取可用规律。使用时会面对新的状态,出题时保存的答案不会跟着交给它。”

学生:“把干净图也递进去,训练误差不就小了吗?”

教师:“这样改变了任务:模型拿到了正常生成时没有的额外信息。误差小不能替代任务成立;我们要检查的是在合法输入条件下能做什么。”

学生:“那一张照片出很多题,是不是就等于有了很多不同的训练照片?”

教师:“增加了这张照片上的扰动与难度组合,却没有凭空增加新的杯型、场景或结构。造题能扩展练习方式,不能自动补足原始数据未覆盖的内容。”

这一页先选“预测扰动”把监督关系讲清。后面还会比较预测干净图或其他变化信息的做法;不要把这里的一种训练表达当成所有扩散模型只能使用的答案形式。同样,训练时拿到可批改的目标,不等于模型能从任意严重受损输入精确找回唯一原图。信息丢失后,不同原图可能都与眼前输入相容。

现在可以用一句话串起图中的回路:我们知道怎样损坏一张图,所以知道怎样给预测提供反馈;模型学会的是在规定输入下作预测,反馈更新的仍是同一套参数。

接下来:如果受损图容得下多个合理来处,会不会最后只得到它们的模糊平均?下一页用杯柄的两个可能位置区分“预测中要处理的不确定性”与“最后交付一个完整候选”。再下一页会把预测器与更新规则接起来,看到一次生成怎样由多次更新组成。

画面怎样推进

第1步

一张照片可形成不同扰动和难度的许多训练题,但没有新增真实场景。

打开这一停点

第2步

模型输入只有受损图与难度;原图和已知扰动留在出题、批改端。

打开这一停点

第3步

预测扰动与已知扰动比较后调整同一模型参数,无人工逐图标签仍有训练目标。

打开这一停点

学习材料

与当前画面直接相关

无人工标注的训练题,答案从哪里来?

把图缩成一个数:x₀=2,累计信号系数0.64,抽到ε=−0.5。受损值是xₜ=0.8×2+0.6×(−0.5)=1.3。预测器只读1.3与时间,不读2或−0.5;训练过程保存ε来批改。若预测−0.3,噪声平方误差为(−0.3+0.5)²=0.04,误差用于更新共享参数。

由预测反推的干净估计为(1.3+0.18)/0.8=1.85,仍不等于原值2。已知造题规则提供了监督答案,没有让受损观察变成可唯一求逆的方程。换不同照片、时间和噪声,是同一网络反复学习的不同练习题。

接着读:这一完整一维算例与输入和监督的分界。

连续阅读

CLS 05 · 扩散:训练、采样与少步生成

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第5章,从对象和问题开始

阅读与实践

LAB 09 · 学得去噪器与完整采样

固定初始噪声,仅改采样步数;把网络近似误差与数值步进误差分开。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

LAB 05 · 扩散的条件均值与流积分

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Diffusion Models

把原图、受损图、难度与扰动目标对应到训练算法,检查目标是否误入作答输入。

先看:第21–23、44–45、55–57页

相关材料

LAB 05|条件均值、噪声预测与流积分

比较解析最优预测、零预测和偏置预测,检查训练目标从何而来;这里不训练网络。

先看:第2节“降低噪声时,相同xₜ会提供更多还是更少信息?”