
<a id="n42-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-title)


# 视频需要每一帧都像，还要前后接得上

王德泉 · Coding with AI · Lecture 04


<a id="n42-eb11f193eae8"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-eb11f193eae8)

编辑要求局部内容与整张图相容；视频还要求此刻与之前发生的事情相容。看这只红杯：它从挡板左侧向右移动，先只剩一部分可见，随后被完全遮住。此时画面没有杯子，并不意味着杯子已经从这段事件里消失。


<a id="n42-293f876f4585"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-293f876f4585)

我们要续接的是“同一个杯子经过挡板”的事件。因而杯口、杯柄和颜色仍是识别它的线索。当挡板右侧出现一只蓝杯，单看这一帧可能很像真实照片，但它没有解释红杯怎样变成了蓝杯。缺失的是与此前事件的联系，而不只是这一帧的画面质量。换回与首帧相同的红杯，才恢复了本题要求保留的身份线索。


[课程图解] 蓝杯单帧可以自然，但在“同一红杯穿过挡板”的条件下丢失了身份联系。；图中标签与关系：时刻 1 时刻 2 时刻 3 时刻 4 颜色变了
蓝杯单帧可以自然，但在“同一红杯穿过挡板”的条件下丢失了身份联系。


<a id="n42-4d2c92c64c0e"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-4d2c92c64c0e)

**“完全看不见时，为什么不允许换成蓝杯？”**若故事明确给出了换杯、染色或特殊照明等条件，就要据新条件判断。本例没有这些事件，课堂要求也是同一只杯子穿过挡板。遮挡减少了观察者的信息，没有自动授予生成器改写对象身份的自由。这并不是说所有视频中的颜色永远不能改变。


<a id="n42-cb311a6d620c"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-cb311a6d620c)

**“只要把同一只红杯复制到每一帧，不就满足了吗？”**也不够。它还要出现在合理的位置，按事件顺序移动，并在经过挡板时受到正确遮挡。身份、空间关系和运动需要一起成立；固定外观只是其中一项。视频生成要学习的因此不是一张张互不相干的照片，而是跨时间的联合关系。时空网络和时间注意力是组织这类联系的方法，具体方法怎样做可以在学习材料中继续看。


<a id="n42-bf7773e0fb3a"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-bf7773e0fb3a)

同一段历史还可能有多种合理后续，例如杯子继续前进或减速；本页只固定了要检查的身份条件，没有要求唯一未来。给生成器相同随机种子也不是跨帧一致的保证，仍要检查实际事件关系。


<a id="n42-e01795c079ba"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-e01795c079ba)

这组分镜是用于暴露判断差别的课堂示意，不是某个视频模型连续采样的结果；它说明该检验什么，没有给出任何模型已经通过的证据。


<a id="n42-56bc1717bc3a"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-56bc1717bc3a)

现在先留住一个更强的问题：**能接着播放一个未来，是否意味着模型知道我改用另一种动作以后会发生什么？**接下来先看语言、图像和声音如何互相提供条件，再看文字怎样生成。到 N47，我们会把这个问题放回杯子与真实反馈之间，区分续播、行动预测和任务完成。


<a id="n42-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-states)


## 画面怎样推进


<a id="n42-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-b0)

红杯依次部分遮挡、完全遮挡。当前事件仍要求追踪同一杯子，暂时不可见没有改变身份条件。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N42.html?step=b0)


<a id="n42-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-b1)

蓝杯单帧可以自然，却没有说明原来的红杯如何改变；错误来自这段既定事件中的时间联系。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N42.html?step=b1)


<a id="n42-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-b2)

红杯恢复所需身份线索，但续播能力还没有证明换动作后的预测，N47将接回这一问题。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N42.html?step=b2)


<a id="n42-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-materials)


## 继续阅读与实验


<a id="n42-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-learning-unit-001)


## 视频中的两条“时间轴”怎样分开？


<a id="n42-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-learning-unit-002)

红杯经过挡板时，画面一度看不见它；后面仍应续接同一对象的事件。若重新出现蓝杯而没有换杯或变色条件，单帧可以自然，跨帧身份却不相容。把红杯复制到每帧也不够：位置、运动和遮挡必须一起成立。


<a id="n42-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-learning-unit-003)

帧编号表示事件先后，扩散时间表示整个视频张量的受损程度。同一轮可以在一个噪声等级上共同预测多帧，因此“第5帧”不等于“比第1帧更有噪声”。空间模块组织帧内关系，时间模块把历史联系带入预测。


<a id="n42-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-learning-unit-004)

自检：后级上采样把蓝杯画得更清楚，是否修好了前级身份错误？没有；还需核对各级结果。[读视频机制与级联](https://codingai-lec04.pages.dev/lecture.html#ch06-video-mechanism)。


<a id="n42-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-chapter-reading)


### [CLS 06 · 条件图像、编辑与多模态](https://codingai-lec04.pages.dev/lecture.html#ch06)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第6章，从对象和问题开始


<a id="n42-lab06-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-lab06-practice)


### [LAB 06 · 真实文生图与编辑](https://codingai-lec04.pages.dev/course/notebooks/aa278b6be88e4114bdfea0de5b8aee33.html)

先看同起点的真实保存图，再选择一个参数重算；失败结果与全部条件一起保留。

先看：先看保存结果与读图解释


<a id="n42-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-material-1)


### [Video Diffusion Models](https://arxiv.org/pdf/2204.03458v2)

看视频中的时间联系怎样进入建模，以及已有帧如何作为条件；把结构机制与模型效果分开。

先看：第2–4页：时空模型与部分帧条件


<a id="n42-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N42.html#n42-material-2)


### [Imagen Video: High Definition Video Generation with Diffusion Models](https://arxiv.org/pdf/2210.02303v1)

追踪不同阶段负责什么，区分提高画面分辨率与保证长时身份一致。

先看：第2–5页：基础生成与时空超分辨率

