记录里的世界,少了什么?
画面里有很多次成功拿杯的记录;眼前这只杯子却只露出正面,背面尚不可见。再增加一万张相似的成功照片,可以增加一般经验,却没有直接回答“这只杯子的背面有没有裂纹”。这一问需要的是关于当前对象的新信息。
训练数据不是世界的完整复制。有人选择拍什么、从哪个角度拍、哪些失败不上传、哪些文本被保留。假如资料多是干燥桌面上的成功演示,模型可能很熟悉这些外观,却少见湿滑表面、破损杯柄或拿取失败。文件数量增加,不必然意味着这些缺口被补上。
这也说明数据难度不只是标注量。生成一个完整场景要协调部件关系、光照、遮挡和长尾情形;走向行动,还需要知道当时做了什么、后来发生什么。重复图片可以增加训练次数,却不能替代新的关系与条件覆盖。训练与测试若含有近重复记录,还可能让记忆表现看起来像泛化。
当我们转过杯子看见裂纹,判断改变,是因为加入了一条与这只杯子有关的证据。换一个随机种子,让模型改口说“有裂纹”,与取得这条观察并不是同一回事。没有充分证据时,模型应能表达不确定、请求补看,或暂不作判断;流畅输出不能替代这些选择。
“开放的生成接口不是能回答任何问题了吗?” 能表达更多答案,确实超出了固定标签表;但它也能表达更多错误。甚至学到某种数据密度,也不能直接推出模型能可靠识别所有分布外输入。这里没有一项通用分数能替我们确认杯背的事实。
记录还可能通过训练留下参数影响。之后删除原始文件,并不自动证明模型已不再记忆或利用其中内容;这需要另外的归因、遗忘或行为检验。
来源与使用条件同样属于数据问题:没有人工标签,不代表资料没有创建者、没有使用限制,也不代表来源不必保留。课程在此强调数据记录与研究责任,不把它简化成越多越好的收集竞赛。
把这几层分开,下一步就清楚了:一般经验不足,要扩充合适的记录;眼前事实未知,要补观察;已有候选要用于任务,还需选择并检验。下一页用椅子与桌子的实际关系看这最后一步。
画面怎样推进
第1步
重复成功记录没有提供当前杯背面的信息。
打开这一停点第2步
补充多种条件的记录能扩大一般经验,但不能直接回答这只杯子尚未观察的事实。
打开这一停点第3步
新增观察露出裂纹,证据改变判断;随机换一种答案没有完成同样的信息更新。
打开这一停点学习材料
与当前画面直接相关
缺少的是一般经验,还是这只杯子的当前证据?
若训练资料少有湿滑桌面,增加这类拿杯成功与失败记录,可以补一般关系覆盖;若当前杯背被遮住,增加别人的一万张杯图仍不能确认它有没有裂纹。这两种缺口对应不同下一步:改善经验分布,或取得当前对象的新观察。
读数据时可分别数三件事:有多少文件,有多少不同对象,覆盖了多少任务相关条件。近重复图片使第一项增加,却可能没有补后两项。自检:把看不见的杯背生成得很自然,是否证明背面事实?不能;那是模型提出的候选。事实未知时,补看、表达不确定或暂停判断,都比把候选当观察更准确。
连续阅读
CLS 01 · 从条件多解到生成目标
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第1章,从对象和问题开始
阅读与实践
LAB 01 · 自回归:联合概率、贪心与温度
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Deduplicating Training Data Makes Language Models Better
比较重复数据、训练记忆和独立泛化证据,追问“更多文件”是否带来更多独立经验。
先看:第6–9页:重复与评测影响
Do Deep Generative Models Know What They Don’t Know?
检查“学到输入分布就会识别陌生对象”这一推断为何需要额外证据。
先看:第1–3页:分布外输入的似然现象
Ensuring Data Ownership in Generative Visual Models
了解生成数据的来源、归因与退出等研究问题;把删除文件和消除训练影响分开。
先看:先看第19–22页,再按需读第60–61页及85–94页
