生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

能播放的未来,怎样变成能操作的环境?

在一段杯子移动的视频里,杯子每帧都很清楚,画面也顺畅,却可能连桌边都逐渐漂移。对于欣赏一小段画面,这种变化未必第一眼就显眼;对于要规划位置与动作的人,桌边却是判断安全范围的参照。参照无故变化,后面的距离与通行判断就失去共同基础。

先稳定环境,再增加动作条件。把初始状态固定为同一只杯子、同一张桌子、同一处挡板:若选择向左或向右,未来应随着动作发生相应变化。能操作意味着参与者的选择进入了后续生成条件,而不是在两次点击后播放一段与选择无关的录像。不同动作是否应产生不同结果也取决于场景;本例选择的两种移动正是应当有所区别的条件。

播放记录帧 1帧 2帧 3桌边也发生漂移选择动作同一初态向左会怎样?向右会怎样?向左向右
先检查持续不变的桌边,再固定初态比较两种动作条件。

“只要两个按钮播出不同视频,就能拿来替机器人试动作吗?”仍不够。两段视频可能响应了按钮,却不符合该环境真实的动态。要作为行动预测,需要将这些差异与独立环境结果核对;要作为一个自洽的生成环境,也需要更长时间检查对象持续存在、回到旧地点是否一致,以及动作响应是否及时。

交互生成把观众变成参与者,因此增加了几项普通短片没有承担的要求。用户可以等待、转身、返回,也可以连续做出新的选择;系统需要接住这些分支,并让刚才的经历继续影响后面。延迟太长会打断交互,延迟很低也不能补偿世界状态漂移,两者应分开评价。

方向键、图像或语言描述的控制条件、从视频学到的潜在动作,以及机器人执行器的控制量,不是同一种接口。一个接口能影响生成结果,不能直接推出它可接到另一种设备上执行。要接入具体系统,还应说明动作由谁执行、单位和范围是什么、作用多长时间。

Genie 一类工作把可交互环境作为研究对象,为这条路线提供了具体实例。本页的左右动作与杯子示意只解释检验思路,不复现其模型,也不把交互画面直接等同于通用物理模拟器。

即使把所有当前可见物体都画稳了,行动仍可能需要知道画面外的信息。杯子里是否有水,遮挡后停在什么位置,单凭眼前一帧都未必能看出来。下一页看历史怎样进入状态估计,又怎样被新观察修正。

画面怎样推进

第1步

连续画面播放流畅仍可能让桌边漂移;环境参照的持续性会影响后续行动判断。

打开这一停点

第2步

保持同一初态,分别加入左右动作,可以隔离“行动是否影响后果”这项要求。

打开这一停点

第3步

左右动作得到相应未来只是可交互性的一项条件,物理正确性与长时一致仍需额外检验。

打开这一停点

学习材料

与当前画面直接相关

能响应按钮的视频,怎样才成为可操作环境?

先固定同一杯子、桌面和挡板,再改变向左或向右的动作,后续应接住这个选择。还要等待、转身、返回:对象身份与过去经历是否继续有效?低延迟帮助操作,状态漂移却会破坏后续距离和安全判断。

两按钮播放不同短片只说明接口有响应。若要用它替现实系统试动作,还需固定起点和动作条件,与独立环境后果核对。方向键、语言指令与机器人控制量也不是同一接口;后者需要单位、幅度、时长与执行约束。

自检:交互世界可以自洽但不符合现实物理吗?可以,作为现实预测器的主张还需要额外检验。读交互的三层要求。

连续阅读

CLS 08 · 世界模型:状态、行动与反馈

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第8章,从对象和问题开始

阅读与实践

LAB 10 · 一次行动怎样改变判断

先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

相关材料

CLS 00 · 第四讲材料导读

沿动作接口、时间持续性和真实执行三个问题选择扩展阅读,不用漂亮视频替代动态证据。

先看:视频、交互与空间:需要保住哪些关系

来源与进一步阅读

Genie: Generative Interactive Environments

查明生成环境收到的动作究竟是什么,以及哪些信息来自视频;不要自动替换成机器人控制量。

先看:动作表示、动态模型与交互部分