为什么一个入口能提出多种结果?
“帮我处理这个红杯”并没有唯一指定交付物。它可以指把照片中的杯子改成另一种颜色,写一个从图片里找出杯子的程序,也可以指提出把实物推到目标处的动作。这三种任务共享同一对象,却把成功放在不同地方。
图像任务要核对改色是否完成、背景是否保留;程序任务要看代码实际运行后能否找对对象;动作任务要看执行后杯子是否真的到达目标位置。模型能写出一段通顺的推杯步骤,只完成了提出计划这一层。计划里的“已到达”,不是环境里的到达证据。
为什么这些任务越来越容易从同一个入口提出?语言可以表达要求,图片与其他观测可以提供条件,输出又能是文字、代码或可交给后续系统的结构化结果。共享表示使同一底座有机会复用知识,而不是每次都从一张新标签表开始。基础模型强调这种复用范围,未必以生成内容为输出;用于表示或匹配的模型也可以成为多任务底座。但统一输入框只是接口形式,不足以证明下面所有任务都已经学会。
这条路线也不是仅靠“生成”两个字突然成立的。自监督让大量记录可以提供训练信号;数据规模与覆盖提供更多经验;表示学习让经验可复用;可扩展的网络架构和计算使大规模训练成为现实;开放的任务接口又让这些能力被更多应用调用。这些条件共同支持了变化。它们各自都有边界,更多参数或更多文本都不能单独保证任意任务成功。
“既然共用一个模型,评价为什么还要分开?” 因为评价应跟交付要求走。改图成功并不证明代码可执行;代码能通过测试,也不证明动作在真实桌面上安全有效。专用模型在某些固定任务上仍可能更准确、更省资源,共享底座的价值需要在具体使用中兑现。
类似的“在约束下构造候选”还会出现在分子、未来轨迹和研究方案里,生成因此不只服务图片与文字。应用越广,越要说清候选如何接受相应验证。下一页先追问共同前提:训练记录到底给了模型哪些经验,又漏掉了什么?
画面怎样推进
第1步
同一红杯可以进入不同任务,先要指定改图、程序还是动作等交付物。
打开这一停点第2步
图像需内容核对,程序需执行测试,动作需环境反馈;提出结果与完成任务不同。
打开这一停点第3步
自监督、数据规模、共享表示、架构与计算共同支持能力复用,开放接口让它们进入多种任务;成功仍按任务验证。
打开这一停点学习材料
与当前画面直接相关
同一个输入框,为什么需要三种验收?
对同一张红杯照片,模型可以交付改色图片、定位代码或推杯计划。验收分别追问:目标颜色实现且背景保留了吗;代码执行后返回的位置准确吗;动作执行后杯子真的到达目标了吗。三种答案都流畅,不会使这三项事实同时成立。
统一入口让语言表达任务、观测提供条件,共享表示有机会复用经验;其价值要落到具体输出。自检:程序写得正确,能否支持“实物已经推到位”?不能,程序与动作之间还缺实际执行和环境反馈。生成扩大了可提出的任务,验证仍应跟着交付对象走。
连续阅读
CLS 01 · 从条件多解到生成目标
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第1章,从对象和问题开始
阅读与实践
LAB 01 · 自回归:联合概率、贪心与温度
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Language Models are Unsupervised Multitask Learners
观察不同任务怎样借助同一语言建模接口表达;不要把可表达直接当成所有任务都完成。
先看:第2–3页:多任务的语言接口
Scaling Laws for Neural Language Models
先确认作者测量了什么,再思考规模规律为何支持可扩展训练、又不能替代具体应用验收。
先看:第1–3页:规模关系的研究设定
