
<a id="n49-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-title)


# 看不见的状态，怎样留在记忆里？

王德泉 · Coding with AI · Lecture 04


<a id="n49-695abd703681"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-695abd703681)

看着一只不透明杯子的外观，我们未必知道里面有没有水。如果之前看见有人向杯里倒水，这段历史就为当前判断提供了证据。眼前图片没有展示杯内，过去观察却仍然有用；用于行动的状态因此可以比当前画面包含更多相关信息。


<a id="n49-9ee2a72d4d9e"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-9ee2a72d4d9e)

但“记住历史”不等于把最后一张截图原样保存。杯子被挡板遮住期间，动作仍可能改变它的位置。如果只保存最后看见的位置，就会把曾经的位置误当成现在的位置。合理的做法是结合之前的观察与发生的动作，形成当前位置的估计；信息不足时，保留可能范围或不确定性，而不是凭空把一个不可见杯子当成已确认事实。


<a id="n49-ad568489c9f1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-ad568489c9f1)

当杯子重新出现，新观察可能与估计有偏差。此时应修正位置，继续保留仍然有效的历史，而不是为了维持原故事，忽略当前看见的结果。这是记忆服务于状态更新的作用：它帮助连起跨时刻的事件，也允许自己被纠正。


[课程图解] 旧位置估计与新观察不一致时，需要更新估计而不是忽略反馈。；图中标签与关系：当前观测 此前估计区域 已知动作：向右 记忆：过去的观察 这只杯曾被倒入水 新观察 新证据修正位置， 不抹去过去观察。
旧位置估计与新观察不一致时，需要更新估计而不是忽略反馈。


<a id="n49-1c511fc905ca"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-1c511fc905ca)

**“既然已经记得倒过水，就能一直断言杯里有水吗？”**还要看之后发生了什么。若后来倒空或漏水，当前判断需要随事件变化；若这些事件可能发生却未被观察，确定性也要降低。历史提供证据，但不会冻结世界。


<a id="n49-249b08d9104c"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-249b08d9104c)

**“记录更多帧，是否就一定有更好的记忆？”**不一定。若保存了大量纹理，却没有保留关键动作与对象身份，仍可能答不出当前问题。状态表示需要为后续预测和行动保留有用联系；它不必是一张清晰的内心照片，也不等同于全部原始记录。


<a id="n49-f42d8dd655f5"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-f42d8dd655f5)

环境的真实状态、当前可见观察和模型内部保存的状态也不能混为一谈：内部状态是一份为预测服务的表示或估计，可能遗漏事实，可能需要修正。


<a id="n49-75a62c3c4ba1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-75a62c3c4ba1)

这一页区分了三件事：曾经看见什么、现在估计什么、新观察确认什么。下一页再进一步：即使完整记住旧记录，也可能有两种机制都能解释它。门在走近、按键之后打开，到底是哪个条件起作用？这需要选择一项能让预测分开的新动作。


<a id="n49-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-states)


## 画面怎样推进


<a id="n49-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-b0)

杯外观相同并不能直接给出杯内是否有水，当前观察不是全部状态。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N49.html?step=b0)


<a id="n49-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-b1)

过去倒水的观察补充了一项证据，但后续事件仍可能改变杯内情况。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N49.html?step=b1)


<a id="n49-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-b2)

杯子不可见时，按已知动作更新位置估计并保留不确定性，不将过去位置当作当前事实。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N49.html?step=b2)


<a id="n49-b3"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-b3)

新观察修正旧估计；记忆的作用是连接和更新状态，而不是维护一张不再准确的截图。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N49.html?step=b3)


<a id="n49-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-materials)


## 继续阅读与实验


<a id="n49-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-learning-unit-001)


## 记忆保留的是截图，还是仍有用的证据？


<a id="n49-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-learning-unit-002)

眼前不透明杯子的外观不能显示水量；“之前倒入水”提供了历史证据。如果后来倒空、漏水或这些事件可能发生却没看见，当前判断也要改变。历史不会冻结世界。


<a id="n49-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-learning-unit-003)

环境真实状态、当前观察和内部状态分别是实际有什么、现在看到什么、系统根据经历估计什么。遮挡后只保存最后位置会过时，应连同期间动作维护可能位置，新观察再修正它。保留更多纹理帧不保证保留了对象与事件关系。


<a id="n49-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-learning-unit-004)

自检：LAB10 相同“远处、关门”为什么选不同动作？历史辨认了不同固定机制；这里记的是机制证据，杯水例记的是物理状态证据。[读状态与记忆](https://codingai-lec04.pages.dev/lecture.html#ch08-memory)。


<a id="n49-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-chapter-reading)


### [CLS 08 · 世界模型：状态、行动与反馈](https://codingai-lec04.pages.dev/lecture.html#ch08)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第8章，从对象和问题开始


<a id="n49-lab10-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-lab10-practice)


### [LAB 10 · 一次行动怎样改变判断](https://codingai-lec04.pages.dev/course/notebooks/cc09b0442e194df5b0dd09251ac79985.html)

先写候选对同一动作的不同预测，再读独立环境返回的观察；用历史更新下一步选择。

先看：先看保存结果与读图解释


<a id="n49-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-material-1)


### [CLS 00 · 第四讲材料导读](https://deepnote.com/workspace/ise3309jingao-5ba66b0a-4283-4f5a-ae06-3f68d3201e99/project/6f83a923-d155-47be-be58-680db701ff7f/notebook/62c6951f1e554169bdb91fb9d216e160?utm_source=openai&utm_medium=mcp&utm_campaign=openaimcp&utm_content=62c6951f1e554169bdb91fb9d216e160&utm_term=get_notebook)

比较当前观察、历史估计与新反馈，继续问保留多个候选状态怎样影响下一步。

先看：看过历史以后，怎样选择有区分力的新动作


<a id="n49-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N49.html#n49-material-2)


### [Learning Latent Dynamics for Planning from Pixels](https://arxiv.org/abs/1811.04551)

先看新观察怎样修正对隐状态的预测，分清当前观察、历史记忆与不确定性。

先看：Recurrent State-Space Model 部分

