
<a id="n07-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-title)


# 生成之后，还要选择和检验

王德泉 · Coding with AI · Lecture 04


<a id="n07-e1c45b0cd09b"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-e1c45b0cd09b)

两把椅子单独看都很完整，也都可能满足“漂亮的红椅子”。但现在任务是把其中一把推进这张桌子。扶手的宽度和高度必须与桌下空间相容；单张椅子的自然外观没有回答这个关系。


<a id="n07-cfb31b11e14f"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-cfb31b11e14f)

检验后，一把椅子的扶手碰到了桌腿，另一把留有余隙。失败并不是“它不像椅子”，而是“它不适合这张桌子”。如果只按图片美观程度选，或者只取模型最偏爱的候选，就可能漏掉决定任务完成的尺寸条件。模型分配的概率、使用者的偏好和可核对的事实正确性是三种不同量，谁也不能自动代替另两项。


[课程图解] 扶手碰到桌腿与顺利进入桌下，分别说明两把椅子的适配结果；自然外观没有替代这项检验。；图中标签与关系：任务：把红椅推进同一张桌子下 A · 扶手碰到桌腿 B · 已进入桌下
扶手碰到桌腿与顺利进入桌下，分别说明两把椅子的适配结果；自然外观没有替代这项检验。


<a id="n07-4717f9401140"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-4717f9401140)

这里要分清四个环节：模型组织哪些候选可能出现，采样得到一次具体结果，选择决定采用哪个候选，验证检查候选是否满足任务。它们可以由不同部件完成。生成器旁边可以有测量规则、程序测试、检索工具或人工判断；生成不是整个系统的终点。


<a id="n07-ca71efd1998f"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-ca71efd1998f)

**“那就多生成一百把，再挑一把，不就解决了吗？”** 这可能有帮助，但每一轮选择仍需依据正确标准。如果桌下尺寸未知，一百张椅图没有自动补齐尺寸；如果检验本身昂贵，候选数量还会增加成本。对付什么不确定性，决定了该增加候选还是增加证据。


<a id="n07-0b22e15b367b"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-0b22e15b367b)

因此，使用成本应从提出候选一直算到任务完成：训练与数据处理是前期投入，推理是每次出候选的成本，检查、修改、执行、人工复核和再次检查也都消耗资源。比较时应按成功完成的有效任务计算，把失败尝试和返工计入；只比较一次调用的价格会漏掉可靠性差异。共享底座可能把前期投入摊到多个任务，生成更便宜也可能降低尝试成本；但返工很多时，整项任务未必更省。参数更大同样不等于资源配置更有效，模型、数据量与训练计算需要一起看。


<a id="n07-5d2e28662717"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-5d2e28662717)

评价也应保持多个维度：候选是否完整，是否服从条件，是否覆盖有意义的变化，若声称事实是否有来源，若交付程序或动作是否可执行。一个漂亮样例只能支持其中很小一部分。


<a id="n07-850bc683d921"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-850bc683d921)

先记住这些检验要求。接下来四种模型路线都在产生待检候选，我们要沿生成过程看它们做了怎样的分工。


<a id="n07-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-states)


## 画面怎样推进


<a id="n07-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-b0)

两把椅子可以都好看，但是否能进入这张桌子取决于尺寸关系。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N07.html?step=b0)


<a id="n07-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-b1)

碰撞和余隙分别提供任务失败与相容的依据，不由单张图的自然度决定。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N07.html?step=b1)


<a id="n07-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-b2)

提出、检查、调整、再检查构成完整使用过程，重试与人工等都进入有效任务成本。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N07.html?step=b2)


<a id="n07-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-materials)


## 继续阅读与实验


<a id="n07-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-learning-unit-001)


### 把验证和返工算进去，哪种生成才更省？


<a id="n07-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-learning-unit-002)

用一个构造成本例子核对口径：方案 A 每次生成花 1 单位、检验花 4 单位，平均要尝试 3 次才完成任务，合计为 15；方案 B 每次生成花 3 单位、检验花 1 单位，平均 1 次完成，合计为 4。只比较生成的 1 与 3，会得到相反判断。这里的单位和次数仅为算例，不是实际模型测量。


<a id="n07-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-learning-unit-003)

椅子是否能进入桌下，同样要把测量结果纳入选择。多造一百把可以扩候选，却不能测出未知桌下尺寸。自检：概率最高与外观最好都指向同一把椅子，能否直接接受？仍要检查扶手宽高与桌下空间；两项偏好没有替代尺寸证据。


<a id="n07-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-learning-unit-004)

[继续读：按成功任务计算投入](https://codingai-lec04.pages.dev/lecture.html#ch01-data-cost) · [生成与选择之后的验证](https://codingai-lec04.pages.dev/lecture.html#ch01-decision-chair)


<a id="n07-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-chapter-reading)


### [CLS 01 · 从条件多解到生成目标](https://codingai-lec04.pages.dev/lecture.html#ch01)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第1章，从对象和问题开始


<a id="n07-lab01-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-lab01-practice)


### [LAB 01 · 自回归：联合概率、贪心与温度](https://codingai-lec04.pages.dev/course/notebooks/39071d41f84d4621ad69c6140a6dccc9.html)

先读本册保存结果，再按实现顺序核对一个算例；最后只改一个变量。

先看：先看保存结果与读图解释


<a id="n07-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-material-1)


### [Training Compute-Optimal Large Language Models](https://arxiv.org/pdf/2203.15556v1)

核对研究中的预算与比较条件，理解为什么更大参数不等于更有效的资源使用；再补列自己任务的推理和验证成本。

先看：第1–4页：固定计算预算下的模型与数据配置


<a id="n07-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N07.html#n07-material-2)


### [Introduction](https://mit-6s978.github.io/assets/pdfs/lec1_intro.pdf#page=17)

检查单个样本和一批结果分别能提供什么证据，避免只按最好看的输出验收。

先看：第17–27页：生成分布与评价

