视频需要每一帧都像,还要前后接得上
编辑要求局部内容与整张图相容;视频还要求此刻与之前发生的事情相容。看这只红杯:它从挡板左侧向右移动,先只剩一部分可见,随后被完全遮住。此时画面没有杯子,并不意味着杯子已经从这段事件里消失。
我们要续接的是“同一个杯子经过挡板”的事件。因而杯口、杯柄和颜色仍是识别它的线索。当挡板右侧出现一只蓝杯,单看这一帧可能很像真实照片,但它没有解释红杯怎样变成了蓝杯。缺失的是与此前事件的联系,而不只是这一帧的画面质量。换回与首帧相同的红杯,才恢复了本题要求保留的身份线索。
“完全看不见时,为什么不允许换成蓝杯?”若故事明确给出了换杯、染色或特殊照明等条件,就要据新条件判断。本例没有这些事件,课堂要求也是同一只杯子穿过挡板。遮挡减少了观察者的信息,没有自动授予生成器改写对象身份的自由。这并不是说所有视频中的颜色永远不能改变。
“只要把同一只红杯复制到每一帧,不就满足了吗?”也不够。它还要出现在合理的位置,按事件顺序移动,并在经过挡板时受到正确遮挡。身份、空间关系和运动需要一起成立;固定外观只是其中一项。视频生成要学习的因此不是一张张互不相干的照片,而是跨时间的联合关系。时空网络和时间注意力是组织这类联系的方法,具体方法怎样做可以在学习材料中继续看。
同一段历史还可能有多种合理后续,例如杯子继续前进或减速;本页只固定了要检查的身份条件,没有要求唯一未来。给生成器相同随机种子也不是跨帧一致的保证,仍要检查实际事件关系。
这组分镜是用于暴露判断差别的课堂示意,不是某个视频模型连续采样的结果;它说明该检验什么,没有给出任何模型已经通过的证据。
现在先留住一个更强的问题:能接着播放一个未来,是否意味着模型知道我改用另一种动作以后会发生什么?接下来先看语言、图像和声音如何互相提供条件,再看文字怎样生成。到 N47,我们会把这个问题放回杯子与真实反馈之间,区分续播、行动预测和任务完成。
画面怎样推进
第1步
红杯依次部分遮挡、完全遮挡。当前事件仍要求追踪同一杯子,暂时不可见没有改变身份条件。
打开这一停点第2步
蓝杯单帧可以自然,却没有说明原来的红杯如何改变;错误来自这段既定事件中的时间联系。
打开这一停点第3步
红杯恢复所需身份线索,但续播能力还没有证明换动作后的预测,N47将接回这一问题。
打开这一停点学习材料
与当前画面直接相关
视频中的两条“时间轴”怎样分开?
红杯经过挡板时,画面一度看不见它;后面仍应续接同一对象的事件。若重新出现蓝杯而没有换杯或变色条件,单帧可以自然,跨帧身份却不相容。把红杯复制到每帧也不够:位置、运动和遮挡必须一起成立。
帧编号表示事件先后,扩散时间表示整个视频张量的受损程度。同一轮可以在一个噪声等级上共同预测多帧,因此“第5帧”不等于“比第1帧更有噪声”。空间模块组织帧内关系,时间模块把历史联系带入预测。
自检:后级上采样把蓝杯画得更清楚,是否修好了前级身份错误?没有;还需核对各级结果。读视频机制与级联。
连续阅读
CLS 06 · 条件图像、编辑与多模态
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第6章,从对象和问题开始
阅读与实践
LAB 06 · 真实文生图与编辑
先看同起点的真实保存图,再选择一个参数重算;失败结果与全部条件一起保留。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Video Diffusion Models
看视频中的时间联系怎样进入建模,以及已有帧如何作为条件;把结构机制与模型效果分开。
先看:第2–4页:时空模型与部分帧条件
Imagen Video: High Definition Video Generation with Diffusion Models
追踪不同阶段负责什么,区分提高画面分辨率与保证长时身份一致。
先看:第2–5页:基础生成与时空超分辨率
