
<a id="n01-title"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-title)


# 同一张桌面：识别什么，构造什么？

王德泉 · Coding with AI · Lecture 04


<a id="n01-478c61117e10"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-478c61117e10)

桌面上有一只红杯。让模型“找出红杯”，需要它判断什么是杯子，并指出位置。只要位置足够准确，就可以支持分拣或计数；它不必同时交代杯壁每一点的颜色、杯柄怎样弯曲。这种省略是围绕任务保留信息的能力。


<a id="n01-0604340c7d99"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-0604340c7d99)

现在遮住杯柄，要求模型补全。位置框还在，却不足以决定新画出的像素：杯柄可以是弯曲的，也可以更接近方形；但必须接在杯身上，与既有视角、光照和遮挡关系相容。原来识别时可以忽略的细节，如今变成了模型必须作出的选择。若任务进一步放宽成“在原场景里设计另一只红色、可握持的杯子”，杯身也可以变化，桌面和杯外场景仍应保持。


[课程图解] 同一处杯柄空缺可以有曲柄与方柄两种补全；桌面和杯外场景仍需保持。；图中标签与关系：补全杯柄 固定：桌面与杯外场景 原条件 待补杯柄 曲柄补全 方柄补全 杯柄可以不同
同一处杯柄空缺可以有曲柄与方柄两种补全；桌面和杯外场景仍需保持。


<a id="n01-4e7b5164bafc"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-4e7b5164bafc)

**“已经知道是杯子，为什么不能把识别过程倒过来？”** 因为“杯子”这个答案对应很多具体对象。一个分类器完全可能把圆杯、直杯、曲柄、方柄都判对，却没有学会这些差异通常怎样共同出现。把一个标签写回去，没有补上构造完整外观所缺的规则。


<a id="n01-b0a0243a1da9"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-b0a0243a1da9)

概率语言能把两类任务联系起来，但不能消除这项信息缺口：知道一张图属于哪个类别，不等于知道该类别下各种图像怎样分布。反过来，能生成图像的模型也可能帮助识别；是否准确、是否值得付出额外计算，仍须针对识别任务检验。


<a id="n01-95492bc95840"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-95492bc95840)

这里不应把判别式简化成“只会给单一标签”。检测、分割、回归与排序都可以直接输出任务所需的信息，也可以表达不确定性。关键区别是训练与交付要求：找杯子时可以不恢复杯柄细节，补杯柄时必须给出一个具体、相容的结果。一个困难的判别任务，并不会因为输出短就变得容易。


<a id="n01-f32d07a93c0a"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-f32d07a93c0a)

下一页继续收紧要求：如果把颜色、材质和朝向都说清，是否就只剩一个正确答案？


<a id="n01-states"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-states)


## 画面怎样推进


<a id="n01-b0"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-b0)

识别红杯并定位，回答已有对象是什么、在哪里；位置框没有指定杯柄外观。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N01.html?step=b0)


<a id="n01-b1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-b1)

遮住杯柄后，可见场景相同，曲柄与方柄都可能是相容补全；补全需要新增细节选择。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N01.html?step=b1)


<a id="n01-b2"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-b2)

条件放宽为另一只红色可握持的杯子，杯身可以改变，但杯外场景与剩余要求仍须保持。

[返回这一课堂停点](https://codingai-lec04.pages.dev/classroom/N01.html?step=b2)


<a id="n01-materials"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-materials)


## 继续阅读与实验


<a id="n01-learning-unit-001"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-learning-unit-001)


### 为什么不能把“杯子”标签倒放成一幅图？


<a id="n01-learning-unit-002"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-learning-unit-002)

设圆杯与方杯都被分类器输出为“杯子”。分类器可以把区别合并掉，依然完成识别；若让它反过来画图，这一个标签没有指明该恢复哪种杯型，也没有提供杯柄与杯壁如何连接的分布。把多个对象压成同一答案之后，反向恢复缺少的信息并没有唯一规则。


<a id="n01-learning-unit-003"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-learning-unit-003)

这不是要求生成器逐字找回某张原照片：任务可以允许多个新杯型，但每个具体结果仍须保持完整关系。自检：定位框已准确包住红杯，能否据此接受一个悬空杯柄的补全？不能；位置正确与新像素相容是两项交付要求，前者没有检验后者。


<a id="n01-learning-unit-004"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-learning-unit-004)

[继续读：标签压缩了哪些差异](https://codingai-lec04.pages.dev/lecture.html#ch01-label-versus-sample)


<a id="n01-chapter-reading"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-chapter-reading)


### [CLS 01 · 从条件多解到生成目标](https://codingai-lec04.pages.dev/lecture.html#ch01)

按连续正文理解这条方法的训练信号、使用过程与算例；数学与实践在相关问题旁展开。

先看：第1章，从对象和问题开始


<a id="n01-lab01-practice"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-lab01-practice)


### [LAB 01 · 自回归：联合概率、贪心与温度](https://codingai-lec04.pages.dev/course/notebooks/39071d41f84d4621ad69c6140a6dccc9.html)

先读本册保存结果，再按实现顺序核对一个算例；最后只改一个变量。

先看：先看保存结果与读图解释


<a id="n01-material-1"></a>
[区块原文](https://codingai-lec04.pages.dev/course/N01.html#n01-material-1)


### [Introduction](https://mit-6s978.github.io/assets/pdfs/lec1_intro.pdf#page=12)

检查两类任务分别需要哪些信息；重点理解为何类别判断不能直接反向变成图像生成。

先看：第12–16页：判别与生成

