同一张桌面:识别什么,构造什么?
桌面上有一只红杯。让模型“找出红杯”,需要它判断什么是杯子,并指出位置。只要位置足够准确,就可以支持分拣或计数;它不必同时交代杯壁每一点的颜色、杯柄怎样弯曲。这种省略是围绕任务保留信息的能力。
现在遮住杯柄,要求模型补全。位置框还在,却不足以决定新画出的像素:杯柄可以是弯曲的,也可以更接近方形;但必须接在杯身上,与既有视角、光照和遮挡关系相容。原来识别时可以忽略的细节,如今变成了模型必须作出的选择。若任务进一步放宽成“在原场景里设计另一只红色、可握持的杯子”,杯身也可以变化,桌面和杯外场景仍应保持。
“已经知道是杯子,为什么不能把识别过程倒过来?” 因为“杯子”这个答案对应很多具体对象。一个分类器完全可能把圆杯、直杯、曲柄、方柄都判对,却没有学会这些差异通常怎样共同出现。把一个标签写回去,没有补上构造完整外观所缺的规则。
概率语言能把两类任务联系起来,但不能消除这项信息缺口:知道一张图属于哪个类别,不等于知道该类别下各种图像怎样分布。反过来,能生成图像的模型也可能帮助识别;是否准确、是否值得付出额外计算,仍须针对识别任务检验。
这里不应把判别式简化成“只会给单一标签”。检测、分割、回归与排序都可以直接输出任务所需的信息,也可以表达不确定性。关键区别是训练与交付要求:找杯子时可以不恢复杯柄细节,补杯柄时必须给出一个具体、相容的结果。一个困难的判别任务,并不会因为输出短就变得容易。
下一页继续收紧要求:如果把颜色、材质和朝向都说清,是否就只剩一个正确答案?
画面怎样推进
第1步
识别红杯并定位,回答已有对象是什么、在哪里;位置框没有指定杯柄外观。
打开这一停点第2步
遮住杯柄后,可见场景相同,曲柄与方柄都可能是相容补全;补全需要新增细节选择。
打开这一停点第3步
条件放宽为另一只红色可握持的杯子,杯身可以改变,但杯外场景与剩余要求仍须保持。
打开这一停点学习材料
与当前画面直接相关
为什么不能把“杯子”标签倒放成一幅图?
设圆杯与方杯都被分类器输出为“杯子”。分类器可以把区别合并掉,依然完成识别;若让它反过来画图,这一个标签没有指明该恢复哪种杯型,也没有提供杯柄与杯壁如何连接的分布。把多个对象压成同一答案之后,反向恢复缺少的信息并没有唯一规则。
这不是要求生成器逐字找回某张原照片:任务可以允许多个新杯型,但每个具体结果仍须保持完整关系。自检:定位框已准确包住红杯,能否据此接受一个悬空杯柄的补全?不能;位置正确与新像素相容是两项交付要求,前者没有检验后者。
连续阅读
CLS 01 · 从条件多解到生成目标
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第1章,从对象和问题开始
阅读与实践
LAB 01 · 自回归:联合概率、贪心与温度
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Introduction
检查两类任务分别需要哪些信息;重点理解为何类别判断不能直接反向变成图像生成。
先看:第12–16页:判别与生成
