不必画出一切,但哪些细节不能丢?
杯子要穿过挡板间的通道。若任务只是判断是否碰撞,桌面的细小纹理和某些光照变化可能不影响答案;杯柄外沿和通道边界却不能随便丢。把整幅图画得很逼真,可能在与任务无关的细节上花了很多力气;把表示压得很短,也可能恰好删掉了决定成败的边缘。
因此,“只预测重要信息”的关键不是“只”字,而是什么使信息变得重要。若一项差异会改变可选动作或任务结果,表示就需要保留它,或保留足以恢复这种判断的线索。对避碰而言,删掉障碍边缘会使“能过”和“会撞”混在一起;这项丢失不能靠其他部分更清楚来补救。
“那颜色和纹理就永远不需要了吗?”换成材质判断,反光与纹理可能又是线索;换成信号灯任务,颜色甚至直接决定能否通行。同一信息是否可省,由任务和使用条件决定,不存在一份所有任务通用的无关细节清单。
MuZero 提供了一种任务导向的例子:它用学习到的表示与动态支持规划,关注奖励、价值和策略等与决策相关的量,并不要求把棋盘木纹或画面全部像素重建出来。这里的认识是世界模型的输出可以由用途定义,而不是“不画图就无需预测后果”。
另一条相关问题是直接预测表示。I-JEPA 让上下文预测目标区域的表示,相关视频工作继续探索时间中的表示预测。I-JEPA 在原研究中属于非生成式自监督方法;本讲把它放在这里,是比较预测对象的选择,不能因为讨论了世界模型就把它归成一种像素生成器。
这两条研究线的训练目标与使用方式并不相同,共同提醒我们:预测是否有用,需要看保留了什么关系以及怎样验证。下一页回到最具体的一项关系——通道看起来有空,是否足以让整只杯子,包括杯柄,一起通过?
画面怎样推进
第1步
暖冷光照不同而通道几何不变,避碰任务未必需要保留全部外观差异。
打开这一停点第2步
删掉关键边缘会把能过和会撞合并,压缩因此丢失了当前行动所需的信息。
打开这一停点第3步
任务换为材质识别,纹理可能重新有用。决策量预测与表示预测是不同研究路线,不能都当像素生成。
打开这一停点学习材料
与当前画面直接相关
压缩表示时,哪些区别不能合并?
避碰可能不需要桌面细纹,却需要杯柄和通道边缘。若两种场景只有杯柄长度不同,一种能过、一种会撞,表示却把它们压成同一状态,策略就失去了作不同选择的依据。判断信息是否重要,要看它是否改变任务结果或可用动作。
换成信号灯任务,颜色又不能省;换成材质判断,纹理和反光可能重要。MuZero 预测规划用的奖励、策略和价值;I-JEPA 预测图像区域的表示。二者说明输出可以按用途选择,训练与使用方式仍不同。
自检:不重建全部像素是否等于无需预测后果?不是。读任务相关表示。
连续阅读
CLS 08 · 世界模型:状态、行动与反馈
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第8章,从对象和问题开始
阅读与实践
LAB 10 · 一次行动怎样改变判断
先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行相关材料
CLS 00 · 第四讲材料导读
从MuZero与JEPA的不同预测目标继续读,检查表示省去细节后仍需承担什么任务。
先看:想象的两种用途:当前选路与训练策略;视频、交互与空间:需要保住哪些关系
来源与进一步阅读
Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model
看支持搜索所预测的量,追问这些量为什么足够服务论文任务,而非寻找像素重建图。
先看:模型结构与训练目标部分
Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
辨认被预测的是表示而非可观察像素;检查避免无用细节的同时还需保留什么。
先看:目标表示与上下文预测部分
