生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

视频需要每一帧都像,还要前后接得上

编辑要求局部内容与整张图相容;视频还要求此刻与之前发生的事情相容。看这只红杯:它从挡板左侧向右移动,先只剩一部分可见,随后被完全遮住。此时画面没有杯子,并不意味着杯子已经从这段事件里消失。

我们要续接的是“同一个杯子经过挡板”的事件。因而杯口、杯柄和颜色仍是识别它的线索。当挡板右侧出现一只蓝杯,单看这一帧可能很像真实照片,但它没有解释红杯怎样变成了蓝杯。缺失的是与此前事件的联系,而不只是这一帧的画面质量。换回与首帧相同的红杯,才恢复了本题要求保留的身份线索。

时刻 1时刻 2时刻 3时刻 4颜色变了
蓝杯单帧可以自然,但在“同一红杯穿过挡板”的条件下丢失了身份联系。

“完全看不见时,为什么不允许换成蓝杯?”若故事明确给出了换杯、染色或特殊照明等条件,就要据新条件判断。本例没有这些事件,课堂要求也是同一只杯子穿过挡板。遮挡减少了观察者的信息,没有自动授予生成器改写对象身份的自由。这并不是说所有视频中的颜色永远不能改变。

“只要把同一只红杯复制到每一帧,不就满足了吗?”也不够。它还要出现在合理的位置,按事件顺序移动,并在经过挡板时受到正确遮挡。身份、空间关系和运动需要一起成立;固定外观只是其中一项。视频生成要学习的因此不是一张张互不相干的照片,而是跨时间的联合关系。时空网络和时间注意力是组织这类联系的方法,具体方法怎样做可以在学习材料中继续看。

同一段历史还可能有多种合理后续,例如杯子继续前进或减速;本页只固定了要检查的身份条件,没有要求唯一未来。给生成器相同随机种子也不是跨帧一致的保证,仍要检查实际事件关系。

这组分镜是用于暴露判断差别的课堂示意,不是某个视频模型连续采样的结果;它说明该检验什么,没有给出任何模型已经通过的证据。

现在先留住一个更强的问题:能接着播放一个未来,是否意味着模型知道我改用另一种动作以后会发生什么?接下来先看语言、图像和声音如何互相提供条件,再看文字怎样生成。到 N47,我们会把这个问题放回杯子与真实反馈之间,区分续播、行动预测和任务完成。

画面怎样推进

第1步

红杯依次部分遮挡、完全遮挡。当前事件仍要求追踪同一杯子,暂时不可见没有改变身份条件。

打开这一停点

第2步

蓝杯单帧可以自然,却没有说明原来的红杯如何改变;错误来自这段既定事件中的时间联系。

打开这一停点

第3步

红杯恢复所需身份线索,但续播能力还没有证明换动作后的预测,N47将接回这一问题。

打开这一停点

学习材料

与当前画面直接相关

视频中的两条“时间轴”怎样分开?

红杯经过挡板时,画面一度看不见它;后面仍应续接同一对象的事件。若重新出现蓝杯而没有换杯或变色条件,单帧可以自然,跨帧身份却不相容。把红杯复制到每帧也不够:位置、运动和遮挡必须一起成立。

帧编号表示事件先后,扩散时间表示整个视频张量的受损程度。同一轮可以在一个噪声等级上共同预测多帧,因此“第5帧”不等于“比第1帧更有噪声”。空间模块组织帧内关系,时间模块把历史联系带入预测。

自检:后级上采样把蓝杯画得更清楚,是否修好了前级身份错误?没有;还需核对各级结果。读视频机制与级联。

连续阅读

CLS 06 · 条件图像、编辑与多模态

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第6章,从对象和问题开始

阅读与实践

LAB 06 · 真实文生图与编辑

先看同起点的真实保存图,再选择一个参数重算;失败结果与全部条件一起保留。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Video Diffusion Models

看视频中的时间联系怎样进入建模,以及已有帧如何作为条件;把结构机制与模型效果分开。

先看:第2–4页:时空模型与部分帧条件

Imagen Video: High Definition Video Generation with Diffusion Models

追踪不同阶段负责什么,区分提高画面分辨率与保证长时身份一致。

先看:第2–5页:基础生成与时空超分辨率