
<a id="n54-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-title)


# 多拍一些视频，补上的是哪一种经验？

王德泉 · Coding with AI · Lecture 04


<a id="n54-e4ae9a078d02"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-e4ae9a078d02)

一段视频显示杯子从起点滑到了另一处。它记录了可见变化，却未必完整记录施加的动作：推的方向、持续多久、用了多大力，都可能没有直接出现在画面里。若想学习“给定这个动作会有什么后果”，需要把动作记录与前后观察对齐，才能知道要学习哪一项对应关系。


<a id="n54-5cb6ced1d92b"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-5cb6ced1d92b)

**“既然看到了滑动距离，倒推用力大小不就行了吗？”**单凭距离通常还混着表面、杯子质量、接触方式等条件。不同条件可能产生相似距离，同样动作也可能在不同表面产生不同结果。本页标出的动作量是课程设定的记录示例，不是从照片中测得的物理推力。真实任务还需说明控制量的单位和定义，并把额外动作记录与画面对齐。


[课程图解] 动作记录与前后观察对齐，才能把后果关联到具体动作条件。；图中标签与关系：帧 1 帧 2 帧 3 把动作记录贴回发生的时刻 接触 / 向右推 / t₁ 结果：离开桌面 动作记录示例：u = 0.25（控制量），持续 0.3 秒
动作记录与前后观察对齐，才能把后果关联到具体动作条件。


<a id="n54-c2d2bfbb0f0c"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-c2d2bfbb0f0c)

即使每段都记录得很细，覆盖仍可能不足。干桌面上的许多成功轻推，可以更充分地观察这一类经历，却没有自动增加湿桌面、强推或挡板换位的结果。N06 讲过，一万张相似照片未必新增关于当前杯子的关键事实；这里把这个判断推进到行动数据：文件大小、记录精度和条件覆盖，是三项不同的问题。


<a id="n54-36310c87313c"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-36310c87313c)

观察视频可以帮助学习对象、运动和事件规律；带动作的经历进一步把主动输入与后果联系起来；有针对性的干预可以让原先纠缠的解释产生分歧。它们不是互相取代的同一种数据，也不能只按时长或 GB 直接比较价值。新数据究竟值不值，应看它补上了当前预测缺少的哪一个条件。失败记录同样可能揭示边界；采集、动作对齐、模拟和独立评估也都有成本，不能只记训练算力。


<a id="n54-cc485440e678"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-cc485440e678)

V-JEPA 2 将大规模无动作视频预训练与动作条件的机器人后训练区分开，为“观察如何接向行动”提供了一条具体研究路线。它不意味着随便增加一批无动作视频，就已经等价获得任意机器人任务的经验。模拟中改变光照、材质或布局也可用来扩大训练条件，但能否迁移到现实，还要用真实结果检查。


<a id="n54-9a0f3a3511b3"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-9a0f3a3511b3)

下一页把“补什么数据”改写成更可执行的问题：如果只允许再做一次测试，哪一次最可能暴露当前主张中的错误？


<a id="n54-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-states)


## 画面怎样推进


<a id="n54-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-b0)

视频记录可见运动，却未必记录施力的方向、时刻和大小。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N54.html?step=b0)


<a id="n54-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-b1)

用课堂设定的动作记录示例，把动作和结果对齐；这些控制量不是从照片中测出的物理推力。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N54.html?step=b1)


<a id="n54-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-b2)

一段细致记录仍未覆盖湿桌、不同力度与新布局，数据量不能替代相关经验覆盖。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N54.html?step=b2)


<a id="n54-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-materials)


## 继续阅读与实验


<a id="n54-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-learning-unit-001)


## 更多视频，是补条件还是重复熟悉经验？


<a id="n54-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-learning-unit-002)

滑动距离同时受动作、表面、质量和接触影响。没有施力方向、时长与控制量记录，仅凭视频不一定能恢复给定动作的后果。动作条件学习需要把执行记录与前后观察对齐。


<a id="n54-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-learning-unit-003)

干桌面轻推视频再多，也没有自动覆盖湿桌面强推或挡板换位。数据数量、记录精度、条件覆盖因此要分别看；失败记录也可能揭示边界。V-JEPA2 的无动作视频预训练与动作条件机器人后训练，正好让我们识别这两种经验的不同作用。


<a id="n54-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-learning-unit-004)

自检：图更清楚但动作仍未记录，新增的是哪项信息？提高观察精度，未必补上动作对应。[读经验与覆盖](https://codingai-lec04.pages.dev/lecture.html#ch08-data-experience)。


<a id="n54-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-chapter-reading)


### [CLS 08 · 世界模型：状态、行动与反馈](https://codingai-lec04.pages.dev/lecture.html#ch08)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第8章，从对象和问题开始


<a id="n54-lab10-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-lab10-practice)


### [LAB 10 · 一次行动怎样改变判断](https://codingai-lec04.pages.dev/course/notebooks/cc09b0442e194df5b0dd09251ac79985.html)

先写候选对同一动作的不同预测，再读独立环境返回的观察；用历史更新下一步选择。

先看：先看保存结果与读图解释


<a id="n54-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-material-1)


### [The Sensorimotor Road to Artificial Intelligence · Official Transcript](https://news.berkeley.edu/2023/03/24/berkeley-talks-transcript-jitendra-malik/)

寻找网络观察遗漏了哪些身体与动作信息，再检查自己的数据是否包含这些信息。

先看：关于感觉运动经验与学习数据的讨论


<a id="n54-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-material-2)


### [V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning](https://arxiv.org/abs/2506.09985)

分清两阶段提供的经验，以及特定机器人结果能支持多大范围的结论。

先看：视频预训练与动作条件后训练部分


<a id="n54-material-3"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N54.html#n54-material-3)


### [Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World](https://arxiv.org/abs/1703.06907)

看改变模拟条件怎样服务迁移；同时保留现实测试作为独立检查。

先看：随机化训练条件与现实评估部分

