
<a id="n58-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-title)


# 语言提出目标，世界让计划接受检验

王德泉 · Coding with AI · Lecture 04


<a id="n58-9cad00a3445c"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-9cad00a3445c)

“把杯子移到蓝书右边。”这句话提供了目标，也让我们能讨论动作、比较计划、调用工具。但它没有告诉我们杯子此刻在哪里，更没有使杯子自动到达目标。当前状态仍要从观察和已经获得的反馈中判断。


<a id="n58-40b40250821e"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-40b40250821e)

设想计划预测杯子会停在书的右侧，执行后却发现它仍在左侧。再问“它现在在哪里”，回答应当指向观察到的杯子，而不是引用计划中的未来。代词“它”关联的是同一个物体，但关于位置的最新可靠信息已经改变。语言若只沿着自己写过的成功故事继续生成，就会把愿望当成事实。


[课程图解] 目标和预测在右，实际杯子仍在左；位置判断应跟随环境反馈。；图中标签与关系：把 红杯 放到 蓝书 右侧 目标区域 预测 实际反馈 目标未达成： 仍在蓝书左侧。 从实际位置 再小步向右。
目标和预测在右，实际杯子仍在左；位置判断应跟随环境反馈。


<a id="n58-d79f70c97b40"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-d79f70c97b40)

**“计划里写‘已经移到右边’，为什么不能作为下一句的上下文？”**它可以保留为“原先预测或打算如此”的记录，却不能被当成执行成功的观察。上下文不只是文字是否出现过，还包含这条信息来自指令、预测、工具返回还是实际观察，以及后来有没有被修正。


<a id="n58-d4635d696cb1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-d4635d696cb1)

语言模型提供了知识与任务表达的通用接口：我们可以用同一种对话方式问机制、写程序、提出动作。世界模型与环境反馈则进一步追问，这些描述涉及的对象和后果是否成立。它们也不是前后互相淘汰的研究阶段。本讲先后讲述它们，是为了分清用途。两条路线并非只能二选一；一个系统可以用语言组织计划，用状态预测比较行动，再从工具或环境得到新证据。


<a id="n58-d9f1e33d5261"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-d9f1e33d5261)

**“只要把工具结果贴进上下文，模型就一定会采用它吗？”**也不能保证。还需要系统找到相关信息、分清身份与时效，并在后续推理和生成中正确使用。Lecture 05 会继续讨论上下文怎样被表示、找到和利用。这里先保留判断标准：新观察若推翻了原计划，下一步行为与回答应当随之改变。


<a id="n58-072af2133e26"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-072af2133e26)

到此，本讲已经从“怎样生成一张图”走到“怎样让生成进入一个可检查的任务”。最后两页把四条生成路线收回同一张过程地图，再选一个真实疑问和一条能让自己改主意的新证据。


<a id="n58-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-states)


## 画面怎样推进


<a id="n58-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-b0)

语言规定杯子到蓝书右侧的目标，当前观察仍表明它在左侧；目标不是事实。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N58.html?step=b0)


<a id="n58-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-b1)

预测成功而实际未达成时，应从实际状态修订下一动作，不能用计划覆盖反馈。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N58.html?step=b1)


<a id="n58-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-b2)

“它”指同一只杯子，位置回答应依据新观察；L05将继续讨论上下文如何被找到和使用。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N58.html?step=b2)


<a id="n58-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-materials)


## 继续阅读与实验


<a id="n58-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-learning-unit-001)


## 上下文里出现了“成功”，为什么仍不能当成事实？


<a id="n58-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-learning-unit-002)

“把杯子移到蓝书右边”是目标；“轻推后会到右边”是预测；执行后仍在左边是新观察。三句话都能进入上下文，身份却不同。再问当前位置时，应采用执行后的观察，把原预测保留为已经被修正的记录。


<a id="n58-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-learning-unit-003)

语言可组织目标与工具调用，状态预测可比较动作，环境返回可纠正计划。把工具输出贴进去只是提供信息，系统还要找到它、辨认时效并真正用于后续选择。世界模型与语言接口可以配合，名字不决定哪个环节已经完成。


<a id="n58-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-learning-unit-004)

自检：下一步仍按原预测的右侧位置规划，哪里断了？新反馈没有进入状态更新。[读语言与环境的衔接](https://codingai-lec04.pages.dev/lecture.html#ch08-u0042)。


<a id="n58-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-chapter-reading)


### [CLS 08 · 世界模型：状态、行动与反馈](https://codingai-lec04.pages.dev/lecture.html#ch08)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第8章，从对象和问题开始


<a id="n58-lab10-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-lab10-practice)


### [LAB 10 · 一次行动怎样改变判断](https://codingai-lec04.pages.dev/course/notebooks/cc09b0442e194df5b0dd09251ac79985.html)

先写候选对同一动作的不同预测，再读独立环境返回的观察；用历史更新下一步选择。

先看：先看保存结果与读图解释


<a id="n58-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-material-1)


### [CLS 00 · 第四讲材料导读](https://deepnote.com/workspace/ise3309jingao-5ba66b0a-4283-4f5a-ae06-3f68d3201e99/project/6f83a923-d155-47be-be58-680db701ff7f/notebook/62c6951f1e554169bdb91fb9d216e160?utm_source=openai&utm_medium=mcp&utm_campaign=openaimcp&utm_content=62c6951f1e554169bdb91fb9d216e160&utm_term=get_notebook)

把语言目标、状态表示与环境反馈放在同一问题中，准备进入下一讲的上下文机制。

先看：五种判断怎样变成一个可检验问题


<a id="n58-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N58.html#n58-material-2)


### [Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task](https://arxiv.org/abs/2210.13382)

用受控序列任务理解语言状态证据的范围，作为进入L05前的研究例子。

先看：讨论与任务限制部分

