
<a id="n06-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-title)


# 记录里的世界，少了什么？

王德泉 · Coding with AI · Lecture 04


<a id="n06-12e520f0f193"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-12e520f0f193)

画面里有很多次成功拿杯的记录；眼前这只杯子却只露出正面，背面尚不可见。再增加一万张相似的成功照片，可以增加一般经验，却没有直接回答“这只杯子的背面有没有裂纹”。这一问需要的是关于当前对象的新信息。


<a id="n06-c41fcf97db5e"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-c41fcf97db5e)

训练数据不是世界的完整复制。有人选择拍什么、从哪个角度拍、哪些失败不上传、哪些文本被保留。假如资料多是干燥桌面上的成功演示，模型可能很熟悉这些外观，却少见湿滑表面、破损杯柄或拿取失败。文件数量增加，不必然意味着这些缺口被补上。


<a id="n06-db68184a7aa0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-db68184a7aa0)

这也说明数据难度不只是标注量。生成一个完整场景要协调部件关系、光照、遮挡和长尾情形；走向行动，还需要知道当时做了什么、后来发生什么。重复图片可以增加训练次数，却不能替代新的关系与条件覆盖。训练与测试若含有近重复记录，还可能让记忆表现看起来像泛化。


<a id="n06-fc4872698020"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-fc4872698020)

当我们转过杯子看见裂纹，判断改变，是因为加入了一条与这只杯子有关的证据。换一个随机种子，让模型改口说“有裂纹”，与取得这条观察并不是同一回事。没有充分证据时，模型应能表达不确定、请求补看，或暂不作判断；流畅输出不能替代这些选择。


[课程图解] 转过杯子才取得关于这只杯背面裂纹的新证据；更多相似照片没有替代这次观察。；图中标签与关系：已有记录 相似的成功 当前杯子 补充观察 失败 新条件 背面 已知：背面有裂纹 已排除：无裂纹
转过杯子才取得关于这只杯背面裂纹的新证据；更多相似照片没有替代这次观察。


<a id="n06-1f3d25f0d349"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-1f3d25f0d349)

**“开放的生成接口不是能回答任何问题了吗？”** 能表达更多答案，确实超出了固定标签表；但它也能表达更多错误。甚至学到某种数据密度，也不能直接推出模型能可靠识别所有分布外输入。这里没有一项通用分数能替我们确认杯背的事实。


<a id="n06-bfcd4cfda150"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-bfcd4cfda150)

记录还可能通过训练留下参数影响。之后删除原始文件，并不自动证明模型已不再记忆或利用其中内容；这需要另外的归因、遗忘或行为检验。


<a id="n06-0911e188aa80"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-0911e188aa80)

来源与使用条件同样属于数据问题：没有人工标签，不代表资料没有创建者、没有使用限制，也不代表来源不必保留。课程在此强调数据记录与研究责任，不把它简化成越多越好的收集竞赛。


<a id="n06-924c3cdc47f5"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-924c3cdc47f5)

把这几层分开，下一步就清楚了：一般经验不足，要扩充合适的记录；眼前事实未知，要补观察；已有候选要用于任务，还需选择并检验。下一页用椅子与桌子的实际关系看这最后一步。


<a id="n06-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-states)


## 画面怎样推进


<a id="n06-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-b0)

重复成功记录没有提供当前杯背面的信息。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N06.html?step=b0)


<a id="n06-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-b1)

补充多种条件的记录能扩大一般经验，但不能直接回答这只杯子尚未观察的事实。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N06.html?step=b1)


<a id="n06-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-b2)

新增观察露出裂纹，证据改变判断；随机换一种答案没有完成同样的信息更新。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N06.html?step=b2)


<a id="n06-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-materials)


## 继续阅读与实验


<a id="n06-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-learning-unit-001)


### 缺少的是一般经验，还是这只杯子的当前证据？


<a id="n06-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-learning-unit-002)

若训练资料少有湿滑桌面，增加这类拿杯成功与失败记录，可以补一般关系覆盖；若当前杯背被遮住，增加别人的一万张杯图仍不能确认它有没有裂纹。这两种缺口对应不同下一步：改善经验分布，或取得当前对象的新观察。


<a id="n06-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-learning-unit-003)

读数据时可分别数三件事：有多少文件，有多少不同对象，覆盖了多少任务相关条件。近重复图片使第一项增加，却可能没有补后两项。自检：把看不见的杯背生成得很自然，是否证明背面事实？不能；那是模型提出的候选。事实未知时，补看、表达不确定或暂停判断，都比把候选当观察更准确。


<a id="n06-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-learning-unit-004)

[继续读：增加训练题与增加覆盖的区别](https://codingai-lec04.pages.dev/lecture.html#ch01-augmentation-limits)


<a id="n06-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-chapter-reading)


### [CLS 01 · 从条件多解到生成目标](https://codingai-lec04.pages.dev/lecture.html#ch01)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第1章，从对象和问题开始


<a id="n06-lab01-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-lab01-practice)


### [LAB 01 · 自回归：联合概率、贪心与温度](https://codingai-lec04.pages.dev/course/notebooks/39071d41f84d4621ad69c6140a6dccc9.html)

先读本册保存结果，再按实现顺序核对一个算例；最后只改一个变量。

先看：先看保存结果与读图解释


<a id="n06-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-material-1)


### [Deduplicating Training Data Makes Language Models Better](https://arxiv.org/pdf/2107.06499v2)

比较重复数据、训练记忆和独立泛化证据，追问“更多文件”是否带来更多独立经验。

先看：第6–9页：重复与评测影响


<a id="n06-material-2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-material-2)


### [Do Deep Generative Models Know What They Don’t Know?](https://arxiv.org/pdf/1810.09136v2)

检查“学到输入分布就会识别陌生对象”这一推断为何需要额外证据。

先看：第1–3页：分布外输入的似然现象


<a id="n06-material-3"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N06.html#n06-material-3)


### [Ensuring Data Ownership in Generative Visual Models](https://mit-6s978.github.io/assets/pdfs/data_ownership_MIT_guest_lecture.pdf#page=19)

了解生成数据的来源、归因与退出等研究问题；把删除文件和消除训练影响分开。

先看：先看第19–22页，再按需读第60–61页及85–94页

