生成之后,还要选择和检验
两把椅子单独看都很完整,也都可能满足“漂亮的红椅子”。但现在任务是把其中一把推进这张桌子。扶手的宽度和高度必须与桌下空间相容;单张椅子的自然外观没有回答这个关系。
检验后,一把椅子的扶手碰到了桌腿,另一把留有余隙。失败并不是“它不像椅子”,而是“它不适合这张桌子”。如果只按图片美观程度选,或者只取模型最偏爱的候选,就可能漏掉决定任务完成的尺寸条件。模型分配的概率、使用者的偏好和可核对的事实正确性是三种不同量,谁也不能自动代替另两项。
这里要分清四个环节:模型组织哪些候选可能出现,采样得到一次具体结果,选择决定采用哪个候选,验证检查候选是否满足任务。它们可以由不同部件完成。生成器旁边可以有测量规则、程序测试、检索工具或人工判断;生成不是整个系统的终点。
“那就多生成一百把,再挑一把,不就解决了吗?” 这可能有帮助,但每一轮选择仍需依据正确标准。如果桌下尺寸未知,一百张椅图没有自动补齐尺寸;如果检验本身昂贵,候选数量还会增加成本。对付什么不确定性,决定了该增加候选还是增加证据。
因此,使用成本应从提出候选一直算到任务完成:训练与数据处理是前期投入,推理是每次出候选的成本,检查、修改、执行、人工复核和再次检查也都消耗资源。比较时应按成功完成的有效任务计算,把失败尝试和返工计入;只比较一次调用的价格会漏掉可靠性差异。共享底座可能把前期投入摊到多个任务,生成更便宜也可能降低尝试成本;但返工很多时,整项任务未必更省。参数更大同样不等于资源配置更有效,模型、数据量与训练计算需要一起看。
评价也应保持多个维度:候选是否完整,是否服从条件,是否覆盖有意义的变化,若声称事实是否有来源,若交付程序或动作是否可执行。一个漂亮样例只能支持其中很小一部分。
先记住这些检验要求。接下来四种模型路线都在产生待检候选,我们要沿生成过程看它们做了怎样的分工。
画面怎样推进
第1步
两把椅子可以都好看,但是否能进入这张桌子取决于尺寸关系。
打开这一停点第2步
碰撞和余隙分别提供任务失败与相容的依据,不由单张图的自然度决定。
打开这一停点第3步
提出、检查、调整、再检查构成完整使用过程,重试与人工等都进入有效任务成本。
打开这一停点学习材料
与当前画面直接相关
把验证和返工算进去,哪种生成才更省?
用一个构造成本例子核对口径:方案 A 每次生成花 1 单位、检验花 4 单位,平均要尝试 3 次才完成任务,合计为 15;方案 B 每次生成花 3 单位、检验花 1 单位,平均 1 次完成,合计为 4。只比较生成的 1 与 3,会得到相反判断。这里的单位和次数仅为算例,不是实际模型测量。
椅子是否能进入桌下,同样要把测量结果纳入选择。多造一百把可以扩候选,却不能测出未知桌下尺寸。自检:概率最高与外观最好都指向同一把椅子,能否直接接受?仍要检查扶手宽高与桌下空间;两项偏好没有替代尺寸证据。
连续阅读
CLS 01 · 从条件多解到生成目标
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第1章,从对象和问题开始
阅读与实践
LAB 01 · 自回归:联合概率、贪心与温度
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Training Compute-Optimal Large Language Models
核对研究中的预算与比较条件,理解为什么更大参数不等于更有效的资源使用;再补列自己任务的推理和验证成本。
先看:第1–4页:固定计算预算下的模型与数据配置
Introduction
检查单个样本和一批结果分别能提供什么证据,避免只按最好看的输出验收。
先看:第17–27页:生成分布与评价
