
<a id="n57-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-title)


# 五个判断，落在同一个陌生情境里

王德泉 · Coding with AI · Lecture 04


<a id="n57-6b128eab0b24"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-6b128eab0b24)

把杯子放到一张没见过的桌上：挡板间距变了，桌面有水迹，目标在另一边。此时先认出五位研究者的名字，并不能告诉我们下一步该做什么。更有用的是逐项指出：当前不知道什么，哪一种信息可能改变行动选择。


<a id="n57-72898bd67b4a"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-72898bd67b4a)

本课把相关研究方向概括成五个判断。以下是课程对问题的整理，不是五位学者的逐字引语，也不是他们共同提出的一套统一理论。


<a id="n57-2c306cc4367e"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-2c306cc4367e)

Ilya Sutskever 对预测的讨论，提示我们思考：为了预测接下来发生什么，模型是否需要学习数据背后的过程？在这里，仅记住一张杯子照片不够，位置与运动之间的关系才帮助预测。这个判断提出学习的可能性，本身不保证任意预测任务都会学出所需机制。


<a id="n57-528dac9d0b6e"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-528dac9d0b6e)

Jitendra Malik 对感知运动经验的强调，追问已有材料遗漏了什么。网络视频可能展示杯子移动，却没有记录本次施力，也未覆盖这张湿桌面。更多熟悉画面与补上缺少的经验，不是同一个动作。


<a id="n57-67cf2897bf16"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-67cf2897bf16)

Richard Sutton 的互动视角提醒我们：选择会改变后续观察。沿这一互动框架，本课进一步提出：若几种摩擦或触发机制都解释旧记录，一次有区分力的试探可能比重复观看更有信息。它也带来现实取舍——动作有代价，不是交互越多就必然越好。


[课程图解] 同一陌生场景中，空间、表示、经验与交互补充的是不同信息缺口。；图中标签与关系：预测动作后的状态 Ilya · 预测结构 空间决定可行通路 Fei-Fei · 空间 表示保留任务信息 Yann · 表示 交互补充新证据 Richard · 交互 经验覆盖新接触 Jitendra · 经验缺口 什么让智能体超越熟悉情境行动？
同一陌生场景中，空间、表示、经验与交互补充的是不同信息缺口。


<a id="n57-d3999dbb843b"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-d3999dbb843b)

Fei-Fei Li 强调的空间结构，在这里具体落到杯柄、通道、遮挡与接触。知道“要移过去”不能替代知道整个物体能否通过。Yann LeCun 所推动的表示预测路线，则让我们追问哪些细节需要保留：避碰可以省去部分纹理，却不能把通道边缘一并删掉。


<a id="n57-38cf2e10bb08"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-38cf2e10bb08)

**“那我们到底选谁的路线？”**先选要解决的缺口。通道尺寸未知，先补空间信息；表面动态不确定，需要相关经验或反馈；表示已经把决定碰撞的边缘丢掉，就要修正表示或任务接口。名字不能替我们判断本次缺了什么。


<a id="n57-d6b681417c02"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-d6b681417c02)

这些观点可以互相提出要求，也存在真实张力：规模化观察能走多远，行动数据在哪个阶段不可少，压缩到何种程度还能应对任务变化，都不能靠本页宣布争论结束。共同留下的问题是：**面对没有熟悉模板的情境，什么让智能体仍能有效行动？**下一页把语言的目标表达接入这个问题，看看计划如何随本次观察改变。


<a id="n57-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-states)


## 画面怎样推进


<a id="n57-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-b0)

陌生桌面先暴露具体缺口：通道、表面和动作后果尚未明确，不用姓名代替诊断。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N57.html?step=b0)


<a id="n57-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-b1)

预测过程、空间结构和任务相关表示，分别对眼前的杯子与通道提出不同要求。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N57.html?step=b1)


<a id="n57-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-b2)

具身经验和有区分力的互动补充数据与反馈问题；五项为课程概括，并未消除研究张力。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N57.html?step=b2)


<a id="n57-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-materials)


## 继续阅读与实验


<a id="n57-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-learning-unit-001)


## 五个判断各补哪种缺口，反馈又补了什么？


<a id="n57-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-learning-unit-002)

先把湿桌面移杯的问题拆开：模型是否学到位置变化的过程；记录有没有动作量与表面经验；旧历史是否把几种机制纠缠在一起；杯柄与通道是否几何可达；压缩表示有没有丢掉决定碰撞的边缘。五个问题分别接住 Ilya、Jitendra、Richard、Fei-Fei 与 Yann 的课程概括，不是逐字引语或共同理论。


<a id="n57-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-learning-unit-003)

知道缺口，才能选新信息。通道未知先补空间测量；表面规律未知补相关动作经验；机制都解释旧记录则寻找不同预测。LAB10 中，两候选对“走近并按键”都说开；“只走近”才让开/关预测分开，独立环境返回后再更新判断与下一动作。这项信息试探是课程沿互动框架的推演。


<a id="n57-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-learning-unit-004)

自检：动作次数更多就一定更了解吗？若始终只重复两者同时做，门会开，机制权重仍各0.5。信息价值还要与代价、当前任务比较。[回到五判断的信息缺口](https://codingai-lec04.pages.dev/lecture.html#ch08-five-judgments)。


<a id="n57-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-chapter-reading)


### [CLS 08 · 世界模型：状态、行动与反馈](https://codingai-lec04.pages.dev/lecture.html#ch08)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第8章，从对象和问题开始


<a id="n57-lab10-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-lab10-practice)


### [LAB 10 · 一次行动怎样改变判断](https://codingai-lec04.pages.dev/course/notebooks/cc09b0442e194df5b0dd09251ac79985.html)

先写候选对同一动作的不同预测，再读独立环境返回的观察；用历史更新下一步选择。

先看：先看保存结果与读图解释


<a id="n57-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-material-1)


### [CLS 00 · 第四讲材料导读](https://deepnote.com/workspace/ise3309jingao-5ba66b0a-4283-4f5a-ae06-3f68d3201e99/project/6f83a923-d155-47be-be58-680db701ff7f/notebook/62c6951f1e554169bdb91fb9d216e160?utm_source=openai&utm_medium=mcp&utm_campaign=openaimcp&utm_content=62c6951f1e554169bdb91fb9d216e160&utm_term=get_notebook)

沿五项课程概括查原始研究入口，选择一个信息缺口，再写出会改变判断的测试。

先看：五种判断怎样变成一个可检验问题


<a id="n57-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-material-2)


### [The Sensorimotor Road to Artificial Intelligence · Official Transcript](https://news.berkeley.edu/2023/03/24/berkeley-talks-transcript-jitendra-malik/)

核对经验缺口这一问题由什么例子支撑，比较观察数据与行动经验。

先看：问答中 Audience 2：可搜索“the road from linguistic data”，接着读 Malik 对具身经验的回答


<a id="n57-material-3"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N57.html#n57-material-3)


### [The Quest for a Common Model of the Intelligent Decision Maker](https://arxiv.org/abs/2202.13252)

将互动观点落实为观察、行动与后果，追问哪项反馈会改变判断。

先看：§2 Interface Terminology：互动与后续观察；§5 的 transition model 与 planning；§6 的 exploration 边界

