
<a id="n55-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-title)


# 漂亮之外，用哪一次测试拆穿它？

王德泉 · Coding with AI · Lecture 04


<a id="n55-a3d397acfc35"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-a3d397acfc35)

假设有人主张：这个模型知道对杯子轻推与强推会产生不同后果。最直接的检查，不是先换个镜头看视频更漂亮，而是固定初始位置、物体和表面，改变动作，让模型分别预测，再与环境实际结果比较。测试应当让所声称的能力成为结果必须依赖的因素。


<a id="n55-997c63edeb28"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-997c63edeb28)

课堂故意设置了一个忽略动作的预测器：轻推与强推时，它给出相同终点；预先设定的环境规则却返回不同终点。在这个受控例子里，差别直接暴露了它没有在预测中体现我们正在检验的动作影响。这里不是某个真实模型的性能报告，而是帮助我们理解怎样构造有针对性的反例。


[课程图解] 相同初态下只改动作，用独立结果检验模型是否真的响应了动作差异。；图中标签与关系：待检主张：它知道轻推与强推的后果不同 轻推 模型预测 独立环境反馈 强推 模型预测 独立环境反馈 动作不同，预测却相同；反馈直接否定这条主张。
相同初态下只改动作，用独立结果检验模型是否真的响应了动作差异。


<a id="n55-6e9e41727577"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-6e9e41727577)

**“把镜头换一下，模型仍能生成漂亮视频，能否证明它理解推力？”**这可能说明某种视角变化下的画面能力，却没有隔离轻推与强推的作用。若一次同时换镜头、杯子、桌面与动作，成功或失败也更难归因。测试不是越复杂越强，而是应清楚说明什么结果会支持或推翻哪项主张。


<a id="n55-2972de82e54f"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-2972de82e54f)

其他主张需要其他测试。重访一个地方，检查持续状态是否保持；延长展开时间，检查误差怎样累积；更换布局，检查原有判断能否迁移。生成画面质量、动作条件下的动态预测、借助模型获得的控制收益、陌生情境中的适应性，也不能互相替代。画得好不自动证明预测准，预测准也不自动证明策略利用得好。


<a id="n55-033bf07c0645"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-033bf07c0645)

**“这一次测对了，是否就足够采用它？”**这条证据支持的是所覆盖的任务和条件。是否足够使用取决于应用要求，但不能把一次成功写成所有表面、动作与布局都成立。后续测试应针对仍未覆盖且会改变结论的部分，而不是只重复展示最容易成功的场景。


<a id="n55-0f6edef24c74"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-0f6edef24c74)

这种分清主张与证据的习惯也适用于语言。下一页回到早先的木球计数：答对一个跟踪状态的问题，究竟说明了行为成功，还是已经揭示内部机制与现实理解？


<a id="n55-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-states)


## 画面怎样推进


<a id="n55-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-b0)

当前主张涉及动作敏感性，保持初态只换力度，比同时换镜头更直接。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N55.html?step=b0)


<a id="n55-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-b1)

忽略动作的预测器给出同一终点，而固定环境规则返回不同结果，形成针对该主张的反例。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N55.html?step=b1)


<a id="n55-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-b2)

重访、动作变化、延长时间和新布局分别检查不同能力，一次成功不能替其他项作答。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N55.html?step=b2)


<a id="n55-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-materials)


## 继续阅读与实验


<a id="n55-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-learning-unit-001)


## 怎样让一项主张承担会失败的测试？


<a id="n55-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-learning-unit-002)

要检查“模型利用了推力强弱”，先固定物体、表面和起点，分别给轻推与强推，让模型预测，再与环境后果核对。若预测始终同终点，受控环境却不同，就暴露了正在检验的动作差别未进入预测。本页是规则反例，不是真实模型成绩。


<a id="n55-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-learning-unit-003)

换镜头仍漂亮主要检查另一种画面能力。长期展开、返回旧地点、换布局也各有不同目的：分别检验误差累积、持续状态与迁移。一次同时改所有条件，会让成功与失败都难归因。


<a id="n55-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-learning-unit-004)

自检：画得好、预测准、策略收益高是否同一种证据？三者要分别观察。[读测试与主张的对应](https://codingai-lec04.pages.dev/lecture.html#ch08-u0038)。


<a id="n55-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-chapter-reading)


### [CLS 08 · 世界模型：状态、行动与反馈](https://codingai-lec04.pages.dev/lecture.html#ch08)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第8章，从对象和问题开始


<a id="n55-lab10-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-lab10-practice)


### [LAB 10 · 一次行动怎样改变判断](https://codingai-lec04.pages.dev/course/notebooks/cc09b0442e194df5b0dd09251ac79985.html)

先写候选对同一动作的不同预测，再读独立环境返回的观察；用历史更新下一步选择。

先看：先看保存结果与读图解释


<a id="n55-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-material-1)


### [CLS 00 · 第四讲材料导读](https://deepnote.com/workspace/ise3309jingao-5ba66b0a-4283-4f5a-ae06-3f68d3201e99/project/6f83a923-d155-47be-be58-680db701ff7f/notebook/62c6951f1e554169bdb91fb9d216e160?utm_source=openai&utm_medium=mcp&utm_campaign=openaimcp&utm_content=62c6951f1e554169bdb91fb9d216e160&utm_term=get_notebook)

比较只看预测视频与把模型接入策略后检验留出环境收益，两种设计分别评价什么。

先看：想象的两种用途：当前选路与训练策略


<a id="n55-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N55.html#n55-material-2)


### [V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning](https://arxiv.org/abs/2506.09985)

把理解、预测和控制结果分开读，检查每项结论对应了什么任务与环境。

先看：评估与机器人规划实验部分

