生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

同一个场景,可以从不同入口给条件

刚才的视频任务给定几帧图像,再生成后续画面。条件也可以来自语言。例如一句“桌面上,红杯在梨的左边”,就给出了对象、颜色和相对位置;杯口多圆、杯柄多弯、桌面光照多亮,还没有被完全指定。

因此,两张图采用不同杯形,并不必然说明模型没听懂。先看它们是否都保持了红杯与梨的左右关系,再问杯形是否属于本次允许变化的部分。这回到了开篇的多解问题:条件可以排除一些结果,却不一定选定唯一结果。

共同场景条件:红杯在梨左边,蓝书在后。另一守约样本还允许不同杯形
同一文字条件容许不同杯形;未规定的细节保留自由度。

把方向反过来,同一张照片也可以成为输入,模型输出文字。“红杯在梨左边”和“梨的左边放着一个红杯”可以描述同一关系。图像里具体的反光、阴影没有全部进入文字,说明描述本身也在选择哪些信息与当前问题有关。图生文与文生图交换了条件和结果的角色,并不因此成为互相精确可逆的操作。

“先看图写一句话,再由这句话生成图,为什么不能恢复原图?”因为那句话通常丢掉了许多原图细节。另一张符合文字的图可能是合格生成,却不是原图的重建。若任务要求恢复同一张图,就需要更多条件,并使用相应证据检查。

文字还可以继续作为声音生成的条件。例如“杯子放到桌上的清脆碰撞声”规定了声音事件,却没有指定唯一波形。但这里应分清研究对象:UniDiffuser 探索图像和文字之间的联合及条件生成;AudioLDM 是文字到音频的另一条研究路线。把两种入口放在同一页,是比较条件关系,不是宣称一篇论文中的同一个系统已经完成图像、文字、声音的一切转换。

统一网络和训练接口,不保证每个方向的能力或质量相同,仍需分别评价。

不同模态甚至可以处于不同的信息完整度:图像条件很清楚,文字部分尚待恢复;或文字给定,图像从不确定状态生成。此处的扰动等级表示信息受损程度,不是图像、文字或声音在现实中发生的先后时间。理解多模态首先要问“哪一部分已知、哪一部分要生成”,再研究具体网络。接下来只保留语言一端:既然图像能通过破坏再恢复学习,能不能把词藏起来,主动制造语言训练题?

画面怎样推进

第1步

一句描述规定对象和位置,未规定的杯形仍可变化,文生图因此可能保留多解。

打开这一停点

第2步

同一照片可以有不同但相容的描述。交换条件和输出,不代表两次转换能精确还原原图。

打开这一停点

第3步

文字还可以约束声音生成。音频与图文研究在这里作接口比较,不合并成同一系统的能力证据。

打开这一停点

学习材料

与当前画面直接相关

图像、文字和声音为何不能任意倒转还原?

“红杯在梨左边”固定了颜色与关系,却没指定杯形、纹理和光照。图像变成这句描述时,许多细节已被舍去;再由文字生成另一张合条件的图,是一次条件生成,不能据此称为原图重建。

声音也有自己的接口。AudioLDM 的语义条件来自文本/音频对齐表示,待生成对象则是频谱潜变量,最终还要解码频谱并还原波形。条件嵌入与声音潜变量不是同一个量。UniDiffuser 的图文研究与 AudioLDM 的音频研究也应分别识别。

自检:生成了杯子碰撞和说话两类声音,但顺序颠倒,任务是否完成?若要求先碰撞再说话,尚未完成。读条件与联合生成。

连续阅读

CLS 06 · 条件图像、编辑与多模态

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第6章,从对象和问题开始

阅读与实践

LAB 06 · 真实文生图与编辑

先看同起点的真实保存图,再选择一个参数重算;失败结果与全部条件一起保留。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale

对照图生文、文生图的已知与未知部分,检查不同模态扰动等级如何表达任务。

先看:第3–6页:联合与条件生成设置

AudioLDM: Text-to-Audio Generation with Latent Diffusion Models

看文字条件如何接入音频生成;用于与图文接口比较,不把两篇当作同一模型。

先看:第2–4页:音频表示与语言条件