
<a id="n43-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-title)


# 同一个场景，可以从不同入口给条件

王德泉 · Coding with AI · Lecture 04


<a id="n43-574006e5c91e"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-574006e5c91e)

刚才的视频任务给定几帧图像，再生成后续画面。条件也可以来自语言。例如一句“桌面上，红杯在梨的左边”，就给出了对象、颜色和相对位置；杯口多圆、杯柄多弯、桌面光照多亮，还没有被完全指定。


<a id="n43-ba4569d57ac2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-ba4569d57ac2)

因此，两张图采用不同杯形，并不必然说明模型没听懂。先看它们是否都保持了红杯与梨的左右关系，再问杯形是否属于本次允许变化的部分。这回到了开篇的多解问题：条件可以排除一些结果，却不一定选定唯一结果。


[课程图解] 同一文字条件容许不同杯形；未规定的细节保留自由度。；图中标签与关系：共同场景 条件： 红杯在梨左边， 蓝书在后。 另一守约样本 还允许不同杯形
同一文字条件容许不同杯形；未规定的细节保留自由度。


<a id="n43-04bc28d264a9"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-04bc28d264a9)

把方向反过来，同一张照片也可以成为输入，模型输出文字。“红杯在梨左边”和“梨的左边放着一个红杯”可以描述同一关系。图像里具体的反光、阴影没有全部进入文字，说明描述本身也在选择哪些信息与当前问题有关。图生文与文生图交换了条件和结果的角色，并不因此成为互相精确可逆的操作。


<a id="n43-7d5fd5c99b14"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-7d5fd5c99b14)

**“先看图写一句话，再由这句话生成图，为什么不能恢复原图？”**因为那句话通常丢掉了许多原图细节。另一张符合文字的图可能是合格生成，却不是原图的重建。若任务要求恢复同一张图，就需要更多条件，并使用相应证据检查。


<a id="n43-1f57f9168c31"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-1f57f9168c31)

文字还可以继续作为声音生成的条件。例如“杯子放到桌上的清脆碰撞声”规定了声音事件，却没有指定唯一波形。但这里应分清研究对象：UniDiffuser 探索图像和文字之间的联合及条件生成；AudioLDM 是文字到音频的另一条研究路线。把两种入口放在同一页，是比较条件关系，不是宣称一篇论文中的同一个系统已经完成图像、文字、声音的一切转换。


<a id="n43-dbd27997df01"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-dbd27997df01)

统一网络和训练接口，不保证每个方向的能力或质量相同，仍需分别评价。


<a id="n43-ecb31d09e75a"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-ecb31d09e75a)

不同模态甚至可以处于不同的信息完整度：图像条件很清楚，文字部分尚待恢复；或文字给定，图像从不确定状态生成。此处的扰动等级表示信息受损程度，不是图像、文字或声音在现实中发生的先后时间。理解多模态首先要问“哪一部分已知、哪一部分要生成”，再研究具体网络。接下来只保留语言一端：既然图像能通过破坏再恢复学习，能不能把词藏起来，主动制造语言训练题？


<a id="n43-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-states)


## 画面怎样推进


<a id="n43-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-b0)

一句描述规定对象和位置，未规定的杯形仍可变化，文生图因此可能保留多解。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N43.html?step=b0)


<a id="n43-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-b1)

同一照片可以有不同但相容的描述。交换条件和输出，不代表两次转换能精确还原原图。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N43.html?step=b1)


<a id="n43-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-b2)

文字还可以约束声音生成。音频与图文研究在这里作接口比较，不合并成同一系统的能力证据。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N43.html?step=b2)


<a id="n43-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-materials)


## 继续阅读与实验


<a id="n43-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-learning-unit-001)


## 图像、文字和声音为何不能任意倒转还原？


<a id="n43-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-learning-unit-002)

“红杯在梨左边”固定了颜色与关系，却没指定杯形、纹理和光照。图像变成这句描述时，许多细节已被舍去；再由文字生成另一张合条件的图，是一次条件生成，不能据此称为原图重建。


<a id="n43-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-learning-unit-003)

声音也有自己的接口。AudioLDM 的语义条件来自文本/音频对齐表示，待生成对象则是频谱潜变量，最终还要解码频谱并还原波形。条件嵌入与声音潜变量不是同一个量。UniDiffuser 的图文研究与 AudioLDM 的音频研究也应分别识别。


<a id="n43-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-learning-unit-004)

自检：生成了杯子碰撞和说话两类声音，但顺序颠倒，任务是否完成？若要求先碰撞再说话，尚未完成。[读条件与联合生成](https://codingai-lec04.pages.dev/lecture.html#ch06-multimodal)。


<a id="n43-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-chapter-reading)


### [CLS 06 · 条件图像、编辑与多模态](https://codingai-lec04.pages.dev/lecture.html#ch06)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第6章，从对象和问题开始


<a id="n43-lab06-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-lab06-practice)


### [LAB 06 · 真实文生图与编辑](https://codingai-lec04.pages.dev/course/notebooks/aa278b6be88e4114bdfea0de5b8aee33.html)

先看同起点的真实保存图，再选择一个参数重算；失败结果与全部条件一起保留。

先看：先看保存结果与读图解释


<a id="n43-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-material-1)


### [One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale](https://arxiv.org/pdf/2303.06555v2)

对照图生文、文生图的已知与未知部分，检查不同模态扰动等级如何表达任务。

先看：第3–6页：联合与条件生成设置


<a id="n43-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N43.html#n43-material-2)


### [AudioLDM: Text-to-Audio Generation with Latent Diffusion Models](https://arxiv.org/pdf/2301.12503v3)

看文字条件如何接入音频生成；用于与图文接口比较，不把两篇当作同一模型。

先看：第2–4页：音频表示与语言条件

