
<a id="n56-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-title)


# 只预测词，也可能需要记住一个世界

王德泉 · Coding with AI · Lecture 04


<a id="n56-d257aedf3436"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-d257aedf3436)

N10 用盒中木球说明，最后一个词可能依赖一整段事件。现在回到同一个例子，但问题换了：模型答对之后，我们究竟可以对它作出什么判断？


<a id="n56-1762b50c0ed7"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-1762b50c0ed7)

盒子起初有三枚木球，取走一枚后剩两枚；若最后放入两枚，答案是四枚。保留前两步，只把最后一个动作换成取走两枚，答案就变成零枚。当前盒内不可见，正确回答仍可由事件变化推得。同一个末尾提问，需要接住不同历史形成的状态，不能只按照熟悉句型给固定数字。


[课程图解] 仅改变最后动作，结果从四变零；这是行为任务对状态跟踪的要求。；图中标签与关系：规则世界：同一盒木球，只换最后一个事件 初始 3 取走 1 放入 2 规则答案 4 初始 3 取走 1 取走 2 规则答案 0 两题都答对， 内部真的保留了 状态吗？
仅改变最后动作，结果从四变零；这是行为任务对状态跟踪的要求。


<a id="n56-2d48747391da"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-2d48747391da)

这支持一个正面的可能性：预测文本并不必然只是模仿表面相邻词。文本来自事件与关系，为了预测后续，模型可能学到用于追踪这些关系的内部结构。但“可能需要或受益于某种状态”与“已经证明它内部怎样表示状态”，仍有距离。


<a id="n56-f409c184fc8f"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-f409c184fc8f)

**“两道都答对，不就证明它脑中有盒子了吗？”**首先只能确认它完成了这两道行为任务。它可能使用可迁移的计数规则，也可能依赖题型模式、记忆或其他捷径。要区分解释，可以改变数值、事件长度与表述，并进一步研究内部信息；不能直接从两项输出，画出一个未经观察的内部世界。


<a id="n56-ccb2ba150028"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-ccb2ba150028)

Othello 序列研究提供了更具体的一层证据：模型只接收落子序列，研究者从内部表示探测棋盘状态，并通过干预内部表示影响后续预测。这里至少要分清三问：能否从表示中读出状态，改变相关表示是否改变预测，换到新条件后这种关系是否仍成立。读出说明信息可被获取，干预进一步触及其作用；二者也没有自动担保现实迁移。


<a id="n56-fe1d786cf017"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-fe1d786cf017)

**“棋盘证据能否证明语言模型懂现实物理？”**不能。棋盘有明确规则与可重放状态，是很有价值的受控任务；现实里的观察缺失、机制变化与行动后果需要其他证据。本页木球与棋盘用于区分证据层次，不将前者两道课堂算例冒充后者论文实验。


<a id="n56-0acaab21257c"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-0acaab21257c)

带着这些层次，下一页再看五个研究判断：预测、具身经验、互动、空间和表示各补了什么，又有哪些问题尚未由任何一个口号解决？


<a id="n56-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-states)


## 画面怎样推进


<a id="n56-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-b0)

三枚、取走一枚、放入两枚，形成四枚的状态；末词依赖整段变化。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N56.html?step=b0)


<a id="n56-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-b1)

前两步不变，末步改为取走两枚，规则答案成为零；答对两题仍只是行为证据。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N56.html?step=b1)


<a id="n56-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-b2)

Othello研究提供状态读出与内部干预证据，强于只看输出，但仍不直接证明现实世界泛化。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N56.html?step=b2)


<a id="n56-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-materials)


## 继续阅读与实验


<a id="n56-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-learning-unit-001)


## 两次答对，能说明模型内部有什么？


<a id="n56-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-learning-unit-002)

三枚木球取走一枚再放入两枚，结果是四；只把最后一步换成取走两枚，结果是零。同一句末尾提问因历史而有不同答案，说明任务要求利用事件关系，但两次正确输出还没揭示内部表示。


<a id="n56-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-learning-unit-003)

可迁移计数规则、题型记忆或捷径都可能解释有限行为。改数值、改长度、改措辞能区分一部分解释；Othello 研究进一步探测内部棋盘状态，并干预表示查看输出是否改变。能读出信息，与信息确实参与预测，是两层证据。


<a id="n56-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-learning-unit-004)

自检：受控棋盘里找到了状态表示，能否直接推出现实物理理解？仍需新条件与环境证据。[读语言状态与证据层次](https://codingai-lec04.pages.dev/lecture.html#ch08-language-state)。


<a id="n56-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-chapter-reading)


### [CLS 08 · 世界模型：状态、行动与反馈](https://codingai-lec04.pages.dev/lecture.html#ch08)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第8章，从对象和问题开始


<a id="n56-lab10-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-lab10-practice)


### [LAB 10 · 一次行动怎样改变判断](https://codingai-lec04.pages.dev/course/notebooks/cc09b0442e194df5b0dd09251ac79985.html)

先写候选对同一动作的不同预测，再读独立环境返回的观察；用历史更新下一步选择。

先看：先看保存结果与读图解释


<a id="n56-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-material-1)


### [Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task](https://arxiv.org/abs/2210.13382)

分别记录可读出什么状态、干预如何影响输出，以及合成任务的范围；不只看最终棋盘图。

先看：状态探测与干预实验部分


<a id="n56-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N56.html#n56-material-2)


### [Ilya Sutskever 访谈 · Dwarkesh Patel](https://www.dwarkesh.com/p/ilya-sutskever)

把预测可能学到过程的研究直觉，与Othello提供的有限实证分开。

先看：关于预测与世界模型的讨论

