看不见的状态,怎样留在记忆里?
看着一只不透明杯子的外观,我们未必知道里面有没有水。如果之前看见有人向杯里倒水,这段历史就为当前判断提供了证据。眼前图片没有展示杯内,过去观察却仍然有用;用于行动的状态因此可以比当前画面包含更多相关信息。
但“记住历史”不等于把最后一张截图原样保存。杯子被挡板遮住期间,动作仍可能改变它的位置。如果只保存最后看见的位置,就会把曾经的位置误当成现在的位置。合理的做法是结合之前的观察与发生的动作,形成当前位置的估计;信息不足时,保留可能范围或不确定性,而不是凭空把一个不可见杯子当成已确认事实。
当杯子重新出现,新观察可能与估计有偏差。此时应修正位置,继续保留仍然有效的历史,而不是为了维持原故事,忽略当前看见的结果。这是记忆服务于状态更新的作用:它帮助连起跨时刻的事件,也允许自己被纠正。
“既然已经记得倒过水,就能一直断言杯里有水吗?”还要看之后发生了什么。若后来倒空或漏水,当前判断需要随事件变化;若这些事件可能发生却未被观察,确定性也要降低。历史提供证据,但不会冻结世界。
“记录更多帧,是否就一定有更好的记忆?”不一定。若保存了大量纹理,却没有保留关键动作与对象身份,仍可能答不出当前问题。状态表示需要为后续预测和行动保留有用联系;它不必是一张清晰的内心照片,也不等同于全部原始记录。
环境的真实状态、当前可见观察和模型内部保存的状态也不能混为一谈:内部状态是一份为预测服务的表示或估计,可能遗漏事实,可能需要修正。
这一页区分了三件事:曾经看见什么、现在估计什么、新观察确认什么。下一页再进一步:即使完整记住旧记录,也可能有两种机制都能解释它。门在走近、按键之后打开,到底是哪个条件起作用?这需要选择一项能让预测分开的新动作。
画面怎样推进
第1步
杯外观相同并不能直接给出杯内是否有水,当前观察不是全部状态。
打开这一停点第2步
过去倒水的观察补充了一项证据,但后续事件仍可能改变杯内情况。
打开这一停点第3步
杯子不可见时,按已知动作更新位置估计并保留不确定性,不将过去位置当作当前事实。
打开这一停点第4步
新观察修正旧估计;记忆的作用是连接和更新状态,而不是维护一张不再准确的截图。
打开这一停点学习材料
与当前画面直接相关
记忆保留的是截图,还是仍有用的证据?
眼前不透明杯子的外观不能显示水量;“之前倒入水”提供了历史证据。如果后来倒空、漏水或这些事件可能发生却没看见,当前判断也要改变。历史不会冻结世界。
环境真实状态、当前观察和内部状态分别是实际有什么、现在看到什么、系统根据经历估计什么。遮挡后只保存最后位置会过时,应连同期间动作维护可能位置,新观察再修正它。保留更多纹理帧不保证保留了对象与事件关系。
自检:LAB10 相同“远处、关门”为什么选不同动作?历史辨认了不同固定机制;这里记的是机制证据,杯水例记的是物理状态证据。读状态与记忆。
连续阅读
CLS 08 · 世界模型:状态、行动与反馈
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第8章,从对象和问题开始
阅读与实践
LAB 10 · 一次行动怎样改变判断
先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行相关材料
CLS 00 · 第四讲材料导读
比较当前观察、历史估计与新反馈,继续问保留多个候选状态怎样影响下一步。
先看:看过历史以后,怎样选择有区分力的新动作
来源与进一步阅读
Learning Latent Dynamics for Planning from Pixels
先看新观察怎样修正对隐状态的预测,分清当前观察、历史记忆与不确定性。
先看:Recurrent State-Space Model 部分
