
<a id="n52-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-title)


# 不必画出一切，但哪些细节不能丢？

王德泉 · Coding with AI · Lecture 04


<a id="n52-d5eca1172137"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-d5eca1172137)

杯子要穿过挡板间的通道。若任务只是判断是否碰撞，桌面的细小纹理和某些光照变化可能不影响答案；杯柄外沿和通道边界却不能随便丢。把整幅图画得很逼真，可能在与任务无关的细节上花了很多力气；把表示压得很短，也可能恰好删掉了决定成败的边缘。


<a id="n52-f9969028c418"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-f9969028c418)

因此，“只预测重要信息”的关键不是“只”字，而是**什么使信息变得重要**。若一项差异会改变可选动作或任务结果，表示就需要保留它，或保留足以恢复这种判断的线索。对避碰而言，删掉障碍边缘会使“能过”和“会撞”混在一起；这项丢失不能靠其他部分更清楚来补救。


[课程图解] 删去边缘后，同一表示容下能过与会撞两种情况，丢失了任务所需信息。；图中标签与关系：边缘缺失 同一份抽象表示 一种补全：可以通过 另一种补全：发生碰撞 丢掉关键边缘，行动后果不再确定
删去边缘后，同一表示容下能过与会撞两种情况，丢失了任务所需信息。


<a id="n52-88acf06adf33"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-88acf06adf33)

**“那颜色和纹理就永远不需要了吗？”**换成材质判断，反光与纹理可能又是线索；换成信号灯任务，颜色甚至直接决定能否通行。同一信息是否可省，由任务和使用条件决定，不存在一份所有任务通用的无关细节清单。


<a id="n52-a22ff11de119"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-a22ff11de119)

MuZero 提供了一种任务导向的例子：它用学习到的表示与动态支持规划，关注奖励、价值和策略等与决策相关的量，并不要求把棋盘木纹或画面全部像素重建出来。这里的认识是世界模型的输出可以由用途定义，而不是“不画图就无需预测后果”。


<a id="n52-e87c1e43bce1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-e87c1e43bce1)

另一条相关问题是直接预测表示。I-JEPA 让上下文预测目标区域的表示，相关视频工作继续探索时间中的表示预测。I-JEPA 在原研究中属于非生成式自监督方法；本讲把它放在这里，是比较预测对象的选择，不能因为讨论了世界模型就把它归成一种像素生成器。


<a id="n52-cecb2bd1071d"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-cecb2bd1071d)

这两条研究线的训练目标与使用方式并不相同，共同提醒我们：预测是否有用，需要看保留了什么关系以及怎样验证。下一页回到最具体的一项关系——通道看起来有空，是否足以让整只杯子，包括杯柄，一起通过？


<a id="n52-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-states)


## 画面怎样推进


<a id="n52-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-b0)

暖冷光照不同而通道几何不变，避碰任务未必需要保留全部外观差异。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N52.html?step=b0)


<a id="n52-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-b1)

删掉关键边缘会把能过和会撞合并，压缩因此丢失了当前行动所需的信息。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N52.html?step=b1)


<a id="n52-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-b2)

任务换为材质识别，纹理可能重新有用。决策量预测与表示预测是不同研究路线，不能都当像素生成。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N52.html?step=b2)


<a id="n52-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-materials)


## 继续阅读与实验


<a id="n52-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-learning-unit-001)


## 压缩表示时，哪些区别不能合并？


<a id="n52-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-learning-unit-002)

避碰可能不需要桌面细纹，却需要杯柄和通道边缘。若两种场景只有杯柄长度不同，一种能过、一种会撞，表示却把它们压成同一状态，策略就失去了作不同选择的依据。判断信息是否重要，要看它是否改变任务结果或可用动作。


<a id="n52-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-learning-unit-003)

换成信号灯任务，颜色又不能省；换成材质判断，纹理和反光可能重要。MuZero 预测规划用的奖励、策略和价值；I-JEPA 预测图像区域的表示。二者说明输出可以按用途选择，训练与使用方式仍不同。


<a id="n52-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-learning-unit-004)

自检：不重建全部像素是否等于无需预测后果？不是。[读任务相关表示](https://codingai-lec04.pages.dev/lecture.html#ch08-task-representation)。


<a id="n52-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-chapter-reading)


### [CLS 08 · 世界模型：状态、行动与反馈](https://codingai-lec04.pages.dev/lecture.html#ch08)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第8章，从对象和问题开始


<a id="n52-lab10-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-lab10-practice)


### [LAB 10 · 一次行动怎样改变判断](https://codingai-lec04.pages.dev/course/notebooks/cc09b0442e194df5b0dd09251ac79985.html)

先写候选对同一动作的不同预测，再读独立环境返回的观察；用历史更新下一步选择。

先看：先看保存结果与读图解释


<a id="n52-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-material-1)


### [CLS 00 · 第四讲材料导读](https://deepnote.com/workspace/ise3309jingao-5ba66b0a-4283-4f5a-ae06-3f68d3201e99/project/6f83a923-d155-47be-be58-680db701ff7f/notebook/62c6951f1e554169bdb91fb9d216e160?utm_source=openai&utm_medium=mcp&utm_campaign=openaimcp&utm_content=62c6951f1e554169bdb91fb9d216e160&utm_term=get_notebook)

从MuZero与JEPA的不同预测目标继续读，检查表示省去细节后仍需承担什么任务。

先看：想象的两种用途：当前选路与训练策略；视频、交互与空间：需要保住哪些关系


<a id="n52-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-material-2)


### [Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model](https://arxiv.org/abs/1911.08265)

看支持搜索所预测的量，追问这些量为什么足够服务论文任务，而非寻找像素重建图。

先看：模型结构与训练目标部分


<a id="n52-material-3"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N52.html#n52-material-3)


### [Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture](https://arxiv.org/abs/2301.08243)

辨认被预测的是表示而非可观察像素；检查避免无用细节的同时还需保留什么。

先看：目标表示与上下文预测部分

