五个判断,落在同一个陌生情境里
把杯子放到一张没见过的桌上:挡板间距变了,桌面有水迹,目标在另一边。此时先认出五位研究者的名字,并不能告诉我们下一步该做什么。更有用的是逐项指出:当前不知道什么,哪一种信息可能改变行动选择。
本课把相关研究方向概括成五个判断。以下是课程对问题的整理,不是五位学者的逐字引语,也不是他们共同提出的一套统一理论。
Ilya Sutskever 对预测的讨论,提示我们思考:为了预测接下来发生什么,模型是否需要学习数据背后的过程?在这里,仅记住一张杯子照片不够,位置与运动之间的关系才帮助预测。这个判断提出学习的可能性,本身不保证任意预测任务都会学出所需机制。
Jitendra Malik 对感知运动经验的强调,追问已有材料遗漏了什么。网络视频可能展示杯子移动,却没有记录本次施力,也未覆盖这张湿桌面。更多熟悉画面与补上缺少的经验,不是同一个动作。
Richard Sutton 的互动视角提醒我们:选择会改变后续观察。沿这一互动框架,本课进一步提出:若几种摩擦或触发机制都解释旧记录,一次有区分力的试探可能比重复观看更有信息。它也带来现实取舍——动作有代价,不是交互越多就必然越好。
Fei-Fei Li 强调的空间结构,在这里具体落到杯柄、通道、遮挡与接触。知道“要移过去”不能替代知道整个物体能否通过。Yann LeCun 所推动的表示预测路线,则让我们追问哪些细节需要保留:避碰可以省去部分纹理,却不能把通道边缘一并删掉。
“那我们到底选谁的路线?”先选要解决的缺口。通道尺寸未知,先补空间信息;表面动态不确定,需要相关经验或反馈;表示已经把决定碰撞的边缘丢掉,就要修正表示或任务接口。名字不能替我们判断本次缺了什么。
这些观点可以互相提出要求,也存在真实张力:规模化观察能走多远,行动数据在哪个阶段不可少,压缩到何种程度还能应对任务变化,都不能靠本页宣布争论结束。共同留下的问题是:面对没有熟悉模板的情境,什么让智能体仍能有效行动?下一页把语言的目标表达接入这个问题,看看计划如何随本次观察改变。
画面怎样推进
第1步
陌生桌面先暴露具体缺口:通道、表面和动作后果尚未明确,不用姓名代替诊断。
打开这一停点第2步
预测过程、空间结构和任务相关表示,分别对眼前的杯子与通道提出不同要求。
打开这一停点第3步
具身经验和有区分力的互动补充数据与反馈问题;五项为课程概括,并未消除研究张力。
打开这一停点学习材料
与当前画面直接相关
五个判断各补哪种缺口,反馈又补了什么?
先把湿桌面移杯的问题拆开:模型是否学到位置变化的过程;记录有没有动作量与表面经验;旧历史是否把几种机制纠缠在一起;杯柄与通道是否几何可达;压缩表示有没有丢掉决定碰撞的边缘。五个问题分别接住 Ilya、Jitendra、Richard、Fei-Fei 与 Yann 的课程概括,不是逐字引语或共同理论。
知道缺口,才能选新信息。通道未知先补空间测量;表面规律未知补相关动作经验;机制都解释旧记录则寻找不同预测。LAB10 中,两候选对“走近并按键”都说开;“只走近”才让开/关预测分开,独立环境返回后再更新判断与下一动作。这项信息试探是课程沿互动框架的推演。
自检:动作次数更多就一定更了解吗?若始终只重复两者同时做,门会开,机制权重仍各0.5。信息价值还要与代价、当前任务比较。回到五判断的信息缺口。
连续阅读
CLS 08 · 世界模型:状态、行动与反馈
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第8章,从对象和问题开始
阅读与实践
LAB 10 · 一次行动怎样改变判断
先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行相关材料
CLS 00 · 第四讲材料导读
沿五项课程概括查原始研究入口,选择一个信息缺口,再写出会改变判断的测试。
先看:五种判断怎样变成一个可检验问题
来源与进一步阅读
The Sensorimotor Road to Artificial Intelligence · Official Transcript
核对经验缺口这一问题由什么例子支撑,比较观察数据与行动经验。
先看:问答中 Audience 2:可搜索“the road from linguistic data”,接着读 Malik 对具身经验的回答
The Quest for a Common Model of the Intelligent Decision Maker
将互动观点落实为观察、行动与后果,追问哪项反馈会改变判断。
先看:§2 Interface Terminology:互动与后续观察;§5 的 transition model 与 planning;§6 的 exploration 边界
