语言提出目标,世界让计划接受检验
“把杯子移到蓝书右边。”这句话提供了目标,也让我们能讨论动作、比较计划、调用工具。但它没有告诉我们杯子此刻在哪里,更没有使杯子自动到达目标。当前状态仍要从观察和已经获得的反馈中判断。
设想计划预测杯子会停在书的右侧,执行后却发现它仍在左侧。再问“它现在在哪里”,回答应当指向观察到的杯子,而不是引用计划中的未来。代词“它”关联的是同一个物体,但关于位置的最新可靠信息已经改变。语言若只沿着自己写过的成功故事继续生成,就会把愿望当成事实。
“计划里写‘已经移到右边’,为什么不能作为下一句的上下文?”它可以保留为“原先预测或打算如此”的记录,却不能被当成执行成功的观察。上下文不只是文字是否出现过,还包含这条信息来自指令、预测、工具返回还是实际观察,以及后来有没有被修正。
语言模型提供了知识与任务表达的通用接口:我们可以用同一种对话方式问机制、写程序、提出动作。世界模型与环境反馈则进一步追问,这些描述涉及的对象和后果是否成立。它们也不是前后互相淘汰的研究阶段。本讲先后讲述它们,是为了分清用途。两条路线并非只能二选一;一个系统可以用语言组织计划,用状态预测比较行动,再从工具或环境得到新证据。
“只要把工具结果贴进上下文,模型就一定会采用它吗?”也不能保证。还需要系统找到相关信息、分清身份与时效,并在后续推理和生成中正确使用。Lecture 05 会继续讨论上下文怎样被表示、找到和利用。这里先保留判断标准:新观察若推翻了原计划,下一步行为与回答应当随之改变。
到此,本讲已经从“怎样生成一张图”走到“怎样让生成进入一个可检查的任务”。最后两页把四条生成路线收回同一张过程地图,再选一个真实疑问和一条能让自己改主意的新证据。
画面怎样推进
第1步
语言规定杯子到蓝书右侧的目标,当前观察仍表明它在左侧;目标不是事实。
打开这一停点第2步
预测成功而实际未达成时,应从实际状态修订下一动作,不能用计划覆盖反馈。
打开这一停点第3步
“它”指同一只杯子,位置回答应依据新观察;L05将继续讨论上下文如何被找到和使用。
打开这一停点学习材料
与当前画面直接相关
上下文里出现了“成功”,为什么仍不能当成事实?
“把杯子移到蓝书右边”是目标;“轻推后会到右边”是预测;执行后仍在左边是新观察。三句话都能进入上下文,身份却不同。再问当前位置时,应采用执行后的观察,把原预测保留为已经被修正的记录。
语言可组织目标与工具调用,状态预测可比较动作,环境返回可纠正计划。把工具输出贴进去只是提供信息,系统还要找到它、辨认时效并真正用于后续选择。世界模型与语言接口可以配合,名字不决定哪个环节已经完成。
自检:下一步仍按原预测的右侧位置规划,哪里断了?新反馈没有进入状态更新。读语言与环境的衔接。
连续阅读
CLS 08 · 世界模型:状态、行动与反馈
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第8章,从对象和问题开始
阅读与实践
LAB 10 · 一次行动怎样改变判断
先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行相关材料
CLS 00 · 第四讲材料导读
把语言目标、状态表示与环境反馈放在同一问题中,准备进入下一讲的上下文机制。
先看:五种判断怎样变成一个可检验问题
来源与进一步阅读
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
用受控序列任务理解语言状态证据的范围,作为进入L05前的研究例子。
先看:讨论与任务限制部分
