生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

漂亮之外,用哪一次测试拆穿它?

假设有人主张:这个模型知道对杯子轻推与强推会产生不同后果。最直接的检查,不是先换个镜头看视频更漂亮,而是固定初始位置、物体和表面,改变动作,让模型分别预测,再与环境实际结果比较。测试应当让所声称的能力成为结果必须依赖的因素。

课堂故意设置了一个忽略动作的预测器:轻推与强推时,它给出相同终点;预先设定的环境规则却返回不同终点。在这个受控例子里,差别直接暴露了它没有在预测中体现我们正在检验的动作影响。这里不是某个真实模型的性能报告,而是帮助我们理解怎样构造有针对性的反例。

待检主张:它知道轻推与强推的后果不同轻推模型预测独立环境反馈强推模型预测独立环境反馈动作不同,预测却相同;反馈直接否定这条主张。
相同初态下只改动作,用独立结果检验模型是否真的响应了动作差异。

“把镜头换一下,模型仍能生成漂亮视频,能否证明它理解推力?”这可能说明某种视角变化下的画面能力,却没有隔离轻推与强推的作用。若一次同时换镜头、杯子、桌面与动作,成功或失败也更难归因。测试不是越复杂越强,而是应清楚说明什么结果会支持或推翻哪项主张。

其他主张需要其他测试。重访一个地方,检查持续状态是否保持;延长展开时间,检查误差怎样累积;更换布局,检查原有判断能否迁移。生成画面质量、动作条件下的动态预测、借助模型获得的控制收益、陌生情境中的适应性,也不能互相替代。画得好不自动证明预测准,预测准也不自动证明策略利用得好。

“这一次测对了,是否就足够采用它?”这条证据支持的是所覆盖的任务和条件。是否足够使用取决于应用要求,但不能把一次成功写成所有表面、动作与布局都成立。后续测试应针对仍未覆盖且会改变结论的部分,而不是只重复展示最容易成功的场景。

这种分清主张与证据的习惯也适用于语言。下一页回到早先的木球计数:答对一个跟踪状态的问题,究竟说明了行为成功,还是已经揭示内部机制与现实理解?

画面怎样推进

第1步

当前主张涉及动作敏感性,保持初态只换力度,比同时换镜头更直接。

打开这一停点

第2步

忽略动作的预测器给出同一终点,而固定环境规则返回不同结果,形成针对该主张的反例。

打开这一停点

第3步

重访、动作变化、延长时间和新布局分别检查不同能力,一次成功不能替其他项作答。

打开这一停点

学习材料

与当前画面直接相关

怎样让一项主张承担会失败的测试?

要检查“模型利用了推力强弱”,先固定物体、表面和起点,分别给轻推与强推,让模型预测,再与环境后果核对。若预测始终同终点,受控环境却不同,就暴露了正在检验的动作差别未进入预测。本页是规则反例,不是真实模型成绩。

换镜头仍漂亮主要检查另一种画面能力。长期展开、返回旧地点、换布局也各有不同目的:分别检验误差累积、持续状态与迁移。一次同时改所有条件,会让成功与失败都难归因。

自检:画得好、预测准、策略收益高是否同一种证据?三者要分别观察。读测试与主张的对应。

连续阅读

CLS 08 · 世界模型:状态、行动与反馈

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第8章,从对象和问题开始

阅读与实践

LAB 10 · 一次行动怎样改变判断

先写候选对同一动作的不同预测,再读独立环境返回的观察;用历史更新下一步选择。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

相关材料

CLS 00 · 第四讲材料导读

比较只看预测视频与把模型接入策略后检验留出环境收益,两种设计分别评价什么。

先看:想象的两种用途:当前选路与训练策略

来源与进一步阅读

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning

把理解、预测和控制结果分开读,检查每项结论对应了什么任务与环境。

先看:评估与机器人规划实验部分