多拍一些视频,补上的是哪一种经验?
一段视频显示杯子从起点滑到了另一处。它记录了可见变化,却未必完整记录施加的动作:推的方向、持续多久、用了多大力,都可能没有直接出现在画面里。若想学习“给定这个动作会有什么后果”,需要把动作记录与前后观察对齐,才能知道要学习哪一项对应关系。
“既然看到了滑动距离,倒推用力大小不就行了吗?”单凭距离通常还混着表面、杯子质量、接触方式等条件。不同条件可能产生相似距离,同样动作也可能在不同表面产生不同结果。本页标出的动作量是课程设定的记录示例,不是从照片中测得的物理推力。真实任务还需说明控制量的单位和定义,并把额外动作记录与画面对齐。
即使每段都记录得很细,覆盖仍可能不足。干桌面上的许多成功轻推,可以更充分地观察这一类经历,却没有自动增加湿桌面、强推或挡板换位的结果。N06 讲过,一万张相似照片未必新增关于当前杯子的关键事实;这里把这个判断推进到行动数据:文件大小、记录精度和条件覆盖,是三项不同的问题。
观察视频可以帮助学习对象、运动和事件规律;带动作的经历进一步把主动输入与后果联系起来;有针对性的干预可以让原先纠缠的解释产生分歧。它们不是互相取代的同一种数据,也不能只按时长或 GB 直接比较价值。新数据究竟值不值,应看它补上了当前预测缺少的哪一个条件。失败记录同样可能揭示边界;采集、动作对齐、模拟和独立评估也都有成本,不能只记训练算力。
V-JEPA 2 将大规模无动作视频预训练与动作条件的机器人后训练区分开,为“观察如何接向行动”提供了一条具体研究路线。它不意味着随便增加一批无动作视频,就已经等价获得任意机器人任务的经验。模拟中改变光照、材质或布局也可用来扩大训练条件,但能否迁移到现实,还要用真实结果检查。
下一页把“补什么数据”改写成更可执行的问题:如果只允许再做一次测试,哪一次最可能暴露当前主张中的错误?
画面怎样推进
第1步
视频记录可见运动,却未必记录施力的方向、时刻和大小。
打开这一停点第2步
用课堂设定的动作记录示例,把动作和结果对齐;这些控制量不是从照片中测出的物理推力。
打开这一停点第3步
一段细致记录仍未覆盖湿桌、不同力度与新布局,数据量不能替代相关经验覆盖。
打开这一停点学习材料
与当前画面直接相关
更多视频,是补条件还是重复熟悉经验?
滑动距离同时受动作、表面、质量和接触影响。没有施力方向、时长与控制量记录,仅凭视频不一定能恢复给定动作的后果。动作条件学习需要把执行记录与前后观察对齐。
干桌面轻推视频再多,也没有自动覆盖湿桌面强推或挡板换位。数据数量、记录精度、条件覆盖因此要分别看;失败记录也可能揭示边界。V-JEPA2 的无动作视频预训练与动作条件机器人后训练,正好让我们识别这两种经验的不同作用。
自检:图更清楚但动作仍未记录,新增的是哪项信息?提高观察精度,未必补上动作对应。读经验与覆盖。
连续阅读
CLS 08 · 世界模型:状态、行动与反馈
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第8章,从对象和问题开始
阅读与实践
LAB 10 · 一次行动怎样改变判断
先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
The Sensorimotor Road to Artificial Intelligence · Official Transcript
寻找网络观察遗漏了哪些身体与动作信息,再检查自己的数据是否包含这些信息。
先看:关于感觉运动经验与学习数据的讨论
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
分清两阶段提供的经验,以及特定机器人结果能支持多大范围的结论。
先看:视频预训练与动作条件后训练部分
Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World
看改变模拟条件怎样服务迁移;同时保留现实测试作为独立检查。
先看:随机化训练条件与现实评估部分
