
<a id="n48-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-title)


# 能播放的未来，怎样变成能操作的环境？

王德泉 · Coding with AI · Lecture 04


<a id="n48-1755e588faa6"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-1755e588faa6)

在一段杯子移动的视频里，杯子每帧都很清楚，画面也顺畅，却可能连桌边都逐渐漂移。对于欣赏一小段画面，这种变化未必第一眼就显眼；对于要规划位置与动作的人，桌边却是判断安全范围的参照。参照无故变化，后面的距离与通行判断就失去共同基础。


<a id="n48-290d3406a625"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-290d3406a625)

先稳定环境，再增加动作条件。把初始状态固定为同一只杯子、同一张桌子、同一处挡板：若选择向左或向右，未来应随着动作发生相应变化。**能操作意味着参与者的选择进入了后续生成条件，而不是在两次点击后播放一段与选择无关的录像。**不同动作是否应产生不同结果也取决于场景；本例选择的两种移动正是应当有所区别的条件。


[课程图解] 先检查持续不变的桌边，再固定初态比较两种动作条件。；图中标签与关系：播放记录 帧 1 帧 2 帧 3 桌边也发生漂移 选择动作 同一初态 向左会怎样？ 向右会怎样？ 向左 向右
先检查持续不变的桌边，再固定初态比较两种动作条件。


<a id="n48-a5d50b852313"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-a5d50b852313)

**“只要两个按钮播出不同视频，就能拿来替机器人试动作吗？”**仍不够。两段视频可能响应了按钮，却不符合该环境真实的动态。要作为行动预测，需要将这些差异与独立环境结果核对；要作为一个自洽的生成环境，也需要更长时间检查对象持续存在、回到旧地点是否一致，以及动作响应是否及时。


<a id="n48-ee1b7562b1ec"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-ee1b7562b1ec)

交互生成把观众变成参与者，因此增加了几项普通短片没有承担的要求。用户可以等待、转身、返回，也可以连续做出新的选择；系统需要接住这些分支，并让刚才的经历继续影响后面。延迟太长会打断交互，延迟很低也不能补偿世界状态漂移，两者应分开评价。


<a id="n48-f6202415e256"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-f6202415e256)

方向键、图像或语言描述的控制条件、从视频学到的潜在动作，以及机器人执行器的控制量，不是同一种接口。一个接口能影响生成结果，不能直接推出它可接到另一种设备上执行。要接入具体系统，还应说明动作由谁执行、单位和范围是什么、作用多长时间。


<a id="n48-a727bb779a2b"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-a727bb779a2b)

Genie 一类工作把可交互环境作为研究对象，为这条路线提供了具体实例。本页的左右动作与杯子示意只解释检验思路，不复现其模型，也不把交互画面直接等同于通用物理模拟器。


<a id="n48-50f66324f5fe"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-50f66324f5fe)

即使把所有当前可见物体都画稳了，行动仍可能需要知道画面外的信息。杯子里是否有水，遮挡后停在什么位置，单凭眼前一帧都未必能看出来。下一页看历史怎样进入状态估计，又怎样被新观察修正。


<a id="n48-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-states)


## 画面怎样推进


<a id="n48-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-b0)

连续画面播放流畅仍可能让桌边漂移；环境参照的持续性会影响后续行动判断。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N48.html?step=b0)


<a id="n48-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-b1)

保持同一初态，分别加入左右动作，可以隔离“行动是否影响后果”这项要求。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N48.html?step=b1)


<a id="n48-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-b2)

左右动作得到相应未来只是可交互性的一项条件，物理正确性与长时一致仍需额外检验。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N48.html?step=b2)


<a id="n48-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-materials)


## 继续阅读与实验


<a id="n48-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-learning-unit-001)


## 能响应按钮的视频，怎样才成为可操作环境？


<a id="n48-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-learning-unit-002)

先固定同一杯子、桌面和挡板，再改变向左或向右的动作，后续应接住这个选择。还要等待、转身、返回：对象身份与过去经历是否继续有效？低延迟帮助操作，状态漂移却会破坏后续距离和安全判断。


<a id="n48-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-learning-unit-003)

两按钮播放不同短片只说明接口有响应。若要用它替现实系统试动作，还需固定起点和动作条件，与独立环境后果核对。方向键、语言指令与机器人控制量也不是同一接口；后者需要单位、幅度、时长与执行约束。


<a id="n48-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-learning-unit-004)

自检：交互世界可以自洽但不符合现实物理吗？可以，作为现实预测器的主张还需要额外检验。[读交互的三层要求](https://codingai-lec04.pages.dev/lecture.html#ch08-interactive-world)。


<a id="n48-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-chapter-reading)


### [CLS 08 · 世界模型：状态、行动与反馈](https://codingai-lec04.pages.dev/lecture.html#ch08)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第8章，从对象和问题开始


<a id="n48-lab10-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-lab10-practice)


### [LAB 10 · 一次行动怎样改变判断](https://codingai-lec04.pages.dev/course/notebooks/cc09b0442e194df5b0dd09251ac79985.html)

先写候选对同一动作的不同预测，再读独立环境返回的观察；用历史更新下一步选择。

先看：先看保存结果与读图解释


<a id="n48-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-material-1)


### [CLS 00 · 第四讲材料导读](https://deepnote.com/workspace/ise3309jingao-5ba66b0a-4283-4f5a-ae06-3f68d3201e99/project/6f83a923-d155-47be-be58-680db701ff7f/notebook/62c6951f1e554169bdb91fb9d216e160?utm_source=openai&utm_medium=mcp&utm_campaign=openaimcp&utm_content=62c6951f1e554169bdb91fb9d216e160&utm_term=get_notebook)

沿动作接口、时间持续性和真实执行三个问题选择扩展阅读，不用漂亮视频替代动态证据。

先看：视频、交互与空间：需要保住哪些关系


<a id="n48-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N48.html#n48-material-2)


### [Genie: Generative Interactive Environments](https://arxiv.org/abs/2402.15391)

查明生成环境收到的动作究竟是什么，以及哪些信息来自视频；不要自动替换成机器人控制量。

先看：动作表示、动态模型与交互部分

