漂亮之外,用哪一次测试拆穿它?
假设有人主张:这个模型知道对杯子轻推与强推会产生不同后果。最直接的检查,不是先换个镜头看视频更漂亮,而是固定初始位置、物体和表面,改变动作,让模型分别预测,再与环境实际结果比较。测试应当让所声称的能力成为结果必须依赖的因素。
课堂故意设置了一个忽略动作的预测器:轻推与强推时,它给出相同终点;预先设定的环境规则却返回不同终点。在这个受控例子里,差别直接暴露了它没有在预测中体现我们正在检验的动作影响。这里不是某个真实模型的性能报告,而是帮助我们理解怎样构造有针对性的反例。
“把镜头换一下,模型仍能生成漂亮视频,能否证明它理解推力?”这可能说明某种视角变化下的画面能力,却没有隔离轻推与强推的作用。若一次同时换镜头、杯子、桌面与动作,成功或失败也更难归因。测试不是越复杂越强,而是应清楚说明什么结果会支持或推翻哪项主张。
其他主张需要其他测试。重访一个地方,检查持续状态是否保持;延长展开时间,检查误差怎样累积;更换布局,检查原有判断能否迁移。生成画面质量、动作条件下的动态预测、借助模型获得的控制收益、陌生情境中的适应性,也不能互相替代。画得好不自动证明预测准,预测准也不自动证明策略利用得好。
“这一次测对了,是否就足够采用它?”这条证据支持的是所覆盖的任务和条件。是否足够使用取决于应用要求,但不能把一次成功写成所有表面、动作与布局都成立。后续测试应针对仍未覆盖且会改变结论的部分,而不是只重复展示最容易成功的场景。
这种分清主张与证据的习惯也适用于语言。下一页回到早先的木球计数:答对一个跟踪状态的问题,究竟说明了行为成功,还是已经揭示内部机制与现实理解?
画面怎样推进
第1步
当前主张涉及动作敏感性,保持初态只换力度,比同时换镜头更直接。
打开这一停点第2步
忽略动作的预测器给出同一终点,而固定环境规则返回不同结果,形成针对该主张的反例。
打开这一停点第3步
重访、动作变化、延长时间和新布局分别检查不同能力,一次成功不能替其他项作答。
打开这一停点学习材料
与当前画面直接相关
怎样让一项主张承担会失败的测试?
要检查“模型利用了推力强弱”,先固定物体、表面和起点,分别给轻推与强推,让模型预测,再与环境后果核对。若预测始终同终点,受控环境却不同,就暴露了正在检验的动作差别未进入预测。本页是规则反例,不是真实模型成绩。
换镜头仍漂亮主要检查另一种画面能力。长期展开、返回旧地点、换布局也各有不同目的:分别检验误差累积、持续状态与迁移。一次同时改所有条件,会让成功与失败都难归因。
自检:画得好、预测准、策略收益高是否同一种证据?三者要分别观察。读测试与主张的对应。
连续阅读
CLS 08 · 世界模型:状态、行动与反馈
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第8章,从对象和问题开始
阅读与实践
LAB 10 · 一次行动怎样改变判断
先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行相关材料
CLS 00 · 第四讲材料导读
比较只看预测视频与把模型接入策略后检验留出环境收益,两种设计分别评价什么。
先看:想象的两种用途:当前选路与训练策略
来源与进一步阅读
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
把理解、预测和控制结果分开读,检查每项结论对应了什么任务与环境。
先看:评估与机器人规划实验部分
