只预测词,也可能需要记住一个世界
N10 用盒中木球说明,最后一个词可能依赖一整段事件。现在回到同一个例子,但问题换了:模型答对之后,我们究竟可以对它作出什么判断?
盒子起初有三枚木球,取走一枚后剩两枚;若最后放入两枚,答案是四枚。保留前两步,只把最后一个动作换成取走两枚,答案就变成零枚。当前盒内不可见,正确回答仍可由事件变化推得。同一个末尾提问,需要接住不同历史形成的状态,不能只按照熟悉句型给固定数字。
这支持一个正面的可能性:预测文本并不必然只是模仿表面相邻词。文本来自事件与关系,为了预测后续,模型可能学到用于追踪这些关系的内部结构。但“可能需要或受益于某种状态”与“已经证明它内部怎样表示状态”,仍有距离。
“两道都答对,不就证明它脑中有盒子了吗?”首先只能确认它完成了这两道行为任务。它可能使用可迁移的计数规则,也可能依赖题型模式、记忆或其他捷径。要区分解释,可以改变数值、事件长度与表述,并进一步研究内部信息;不能直接从两项输出,画出一个未经观察的内部世界。
Othello 序列研究提供了更具体的一层证据:模型只接收落子序列,研究者从内部表示探测棋盘状态,并通过干预内部表示影响后续预测。这里至少要分清三问:能否从表示中读出状态,改变相关表示是否改变预测,换到新条件后这种关系是否仍成立。读出说明信息可被获取,干预进一步触及其作用;二者也没有自动担保现实迁移。
“棋盘证据能否证明语言模型懂现实物理?”不能。棋盘有明确规则与可重放状态,是很有价值的受控任务;现实里的观察缺失、机制变化与行动后果需要其他证据。本页木球与棋盘用于区分证据层次,不将前者两道课堂算例冒充后者论文实验。
带着这些层次,下一页再看五个研究判断:预测、具身经验、互动、空间和表示各补了什么,又有哪些问题尚未由任何一个口号解决?
画面怎样推进
第1步
三枚、取走一枚、放入两枚,形成四枚的状态;末词依赖整段变化。
打开这一停点第2步
前两步不变,末步改为取走两枚,规则答案成为零;答对两题仍只是行为证据。
打开这一停点第3步
Othello研究提供状态读出与内部干预证据,强于只看输出,但仍不直接证明现实世界泛化。
打开这一停点学习材料
与当前画面直接相关
两次答对,能说明模型内部有什么?
三枚木球取走一枚再放入两枚,结果是四;只把最后一步换成取走两枚,结果是零。同一句末尾提问因历史而有不同答案,说明任务要求利用事件关系,但两次正确输出还没揭示内部表示。
可迁移计数规则、题型记忆或捷径都可能解释有限行为。改数值、改长度、改措辞能区分一部分解释;Othello 研究进一步探测内部棋盘状态,并干预表示查看输出是否改变。能读出信息,与信息确实参与预测,是两层证据。
自检:受控棋盘里找到了状态表示,能否直接推出现实物理理解?仍需新条件与环境证据。读语言状态与证据层次。
连续阅读
CLS 08 · 世界模型:状态、行动与反馈
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第8章,从对象和问题开始
阅读与实践
LAB 10 · 一次行动怎样改变判断
先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
分别记录可读出什么状态、干预如何影响输出,以及合成任务的范围;不只看最终棋盘图。
先看:状态探测与干预实验部分
Ilya Sutskever 访谈 · Dwarkesh Patel
把预测可能学到过程的研究直觉,与Othello提供的有限实证分开。
先看:关于预测与世界模型的讨论
