生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

为什么一个入口能提出多种结果?

“帮我处理这个红杯”并没有唯一指定交付物。它可以指把照片中的杯子改成另一种颜色,写一个从图片里找出杯子的程序,也可以指提出把实物推到目标处的动作。这三种任务共享同一对象,却把成功放在不同地方。

图像任务要核对改色是否完成、背景是否保留;程序任务要看代码实际运行后能否找对对象;动作任务要看执行后杯子是否真的到达目标位置。模型能写出一段通顺的推杯步骤,只完成了提出计划这一层。计划里的“已到达”,不是环境里的到达证据。

同一要求:“处理这个红杯”图像、程序与行动:出口决定检验方式改图找到红色区域→ 返回位置框生成代码并执行提出动作接受环境反馈先判断:需要什么样的交付?
图片、程序和动作是不同交付物,分别需要内容核对、运行检查与环境反馈。

为什么这些任务越来越容易从同一个入口提出?语言可以表达要求,图片与其他观测可以提供条件,输出又能是文字、代码或可交给后续系统的结构化结果。共享表示使同一底座有机会复用知识,而不是每次都从一张新标签表开始。基础模型强调这种复用范围,未必以生成内容为输出;用于表示或匹配的模型也可以成为多任务底座。但统一输入框只是接口形式,不足以证明下面所有任务都已经学会。

这条路线也不是仅靠“生成”两个字突然成立的。自监督让大量记录可以提供训练信号;数据规模与覆盖提供更多经验;表示学习让经验可复用;可扩展的网络架构和计算使大规模训练成为现实;开放的任务接口又让这些能力被更多应用调用。这些条件共同支持了变化。它们各自都有边界,更多参数或更多文本都不能单独保证任意任务成功。

“既然共用一个模型,评价为什么还要分开?” 因为评价应跟交付要求走。改图成功并不证明代码可执行;代码能通过测试,也不证明动作在真实桌面上安全有效。专用模型在某些固定任务上仍可能更准确、更省资源,共享底座的价值需要在具体使用中兑现。

类似的“在约束下构造候选”还会出现在分子、未来轨迹和研究方案里,生成因此不只服务图片与文字。应用越广,越要说清候选如何接受相应验证。下一页先追问共同前提:训练记录到底给了模型哪些经验,又漏掉了什么?

画面怎样推进

第1步

同一红杯可以进入不同任务,先要指定改图、程序还是动作等交付物。

打开这一停点

第2步

图像需内容核对,程序需执行测试,动作需环境反馈;提出结果与完成任务不同。

打开这一停点

第3步

自监督、数据规模、共享表示、架构与计算共同支持能力复用,开放接口让它们进入多种任务;成功仍按任务验证。

打开这一停点

学习材料

与当前画面直接相关

同一个输入框,为什么需要三种验收?

对同一张红杯照片,模型可以交付改色图片、定位代码或推杯计划。验收分别追问:目标颜色实现且背景保留了吗;代码执行后返回的位置准确吗;动作执行后杯子真的到达目标了吗。三种答案都流畅,不会使这三项事实同时成立。

统一入口让语言表达任务、观测提供条件,共享表示有机会复用经验;其价值要落到具体输出。自检:程序写得正确,能否支持“实物已经推到位”?不能,程序与动作之间还缺实际执行和环境反馈。生成扩大了可提出的任务,验证仍应跟着交付对象走。

继续读:生成路线怎样扩展任务接口

连续阅读

CLS 01 · 从条件多解到生成目标

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第1章,从对象和问题开始

阅读与实践

LAB 01 · 自回归:联合概率、贪心与温度

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Language Models are Unsupervised Multitask Learners

观察不同任务怎样借助同一语言建模接口表达;不要把可表达直接当成所有任务都完成。

先看:第2–3页:多任务的语言接口

Scaling Laws for Neural Language Models

先确认作者测量了什么,再思考规模规律为何支持可扩展训练、又不能替代具体应用验收。

先看:第1–3页:规模关系的研究设定