生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

只预测词,也可能需要记住一个世界

N10 用盒中木球说明,最后一个词可能依赖一整段事件。现在回到同一个例子,但问题换了:模型答对之后,我们究竟可以对它作出什么判断?

盒子起初有三枚木球,取走一枚后剩两枚;若最后放入两枚,答案是四枚。保留前两步,只把最后一个动作换成取走两枚,答案就变成零枚。当前盒内不可见,正确回答仍可由事件变化推得。同一个末尾提问,需要接住不同历史形成的状态,不能只按照熟悉句型给固定数字。

规则世界:同一盒木球,只换最后一个事件初始 3取走 1放入 2规则答案4初始 3取走 1取走 2规则答案0两题都答对,内部真的保留了状态吗?
仅改变最后动作,结果从四变零;这是行为任务对状态跟踪的要求。

这支持一个正面的可能性:预测文本并不必然只是模仿表面相邻词。文本来自事件与关系,为了预测后续,模型可能学到用于追踪这些关系的内部结构。但“可能需要或受益于某种状态”与“已经证明它内部怎样表示状态”,仍有距离。

“两道都答对,不就证明它脑中有盒子了吗?”首先只能确认它完成了这两道行为任务。它可能使用可迁移的计数规则,也可能依赖题型模式、记忆或其他捷径。要区分解释,可以改变数值、事件长度与表述,并进一步研究内部信息;不能直接从两项输出,画出一个未经观察的内部世界。

Othello 序列研究提供了更具体的一层证据:模型只接收落子序列,研究者从内部表示探测棋盘状态,并通过干预内部表示影响后续预测。这里至少要分清三问:能否从表示中读出状态,改变相关表示是否改变预测,换到新条件后这种关系是否仍成立。读出说明信息可被获取,干预进一步触及其作用;二者也没有自动担保现实迁移。

“棋盘证据能否证明语言模型懂现实物理?”不能。棋盘有明确规则与可重放状态,是很有价值的受控任务;现实里的观察缺失、机制变化与行动后果需要其他证据。本页木球与棋盘用于区分证据层次,不将前者两道课堂算例冒充后者论文实验。

带着这些层次,下一页再看五个研究判断:预测、具身经验、互动、空间和表示各补了什么,又有哪些问题尚未由任何一个口号解决?

画面怎样推进

第1步

三枚、取走一枚、放入两枚,形成四枚的状态;末词依赖整段变化。

打开这一停点

第2步

前两步不变,末步改为取走两枚,规则答案成为零;答对两题仍只是行为证据。

打开这一停点

第3步

Othello研究提供状态读出与内部干预证据,强于只看输出,但仍不直接证明现实世界泛化。

打开这一停点

学习材料

与当前画面直接相关

两次答对,能说明模型内部有什么?

三枚木球取走一枚再放入两枚,结果是四;只把最后一步换成取走两枚,结果是零。同一句末尾提问因历史而有不同答案,说明任务要求利用事件关系,但两次正确输出还没揭示内部表示。

可迁移计数规则、题型记忆或捷径都可能解释有限行为。改数值、改长度、改措辞能区分一部分解释;Othello 研究进一步探测内部棋盘状态,并干预表示查看输出是否改变。能读出信息,与信息确实参与预测,是两层证据。

自检:受控棋盘里找到了状态表示,能否直接推出现实物理理解?仍需新条件与环境证据。读语言状态与证据层次。

连续阅读

CLS 08 · 世界模型:状态、行动与反馈

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第8章,从对象和问题开始

阅读与实践

LAB 10 · 一次行动怎样改变判断

先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task

分别记录可读出什么状态、干预如何影响输出,以及合成任务的范围;不只看最终棋盘图。

先看:状态探测与干预实验部分

Ilya Sutskever 访谈 · Dwarkesh Patel

把预测可能学到过程的研究直觉,与Othello提供的有限实证分开。

先看:关于预测与世界模型的讨论