生成模型

一个要求,怎样产生多个合理结果?

一个器形镂空模版展开为三个不同的完整器物,蓝色结构由金色纸带连接。

生成模型

左右滑动查看完整图解 ↔

放大阅读图解 ↗

本讲目录

封面与60页正文

开篇:从任务到可能性

自回归与VAE:逐步决定与潜表示

GAN:反馈、约束与编辑

扩散及延展:从局部改进到跨段生成

World Model、语言与全课回收

本页说明

学习材料

图像变清楚了,细节就是真的吗?

对抗反馈的建设性作用,是让生成器学会哪些局部纹理与边缘更像目标域中的真实图像。在逐像素平均容易变平滑的地方,它可以提出清晰可辨的细节。接着才问这些细节是否被输入证据支持:外观改善与事实恢复是两项不同的能力。 从一张低清建筑照片出发,平滑候选看上去不够锐利,带有砖缝的候选则像一张更清楚的照片。第一反应往往是后者更好。但“更像清晰照片”和“更接近这栋建筑的原貌”是两项任务。

低清观测可能已经抹掉了墙面细节。一个简单缩小过程会把多个高分辨率像素合成一个数:许多不同细节都可能产生相同的低分辨率结果。模型无法从已经丢失的信息中唯一推出原貌,只能结合训练中学到的规律提出补全。课堂图里的纹理候选用于演示这一点,并不声称两个候选在每个低清像素上严格相等。

三类常见反馈在这里做不同工作。像素误差逐位置比较数值,例如 L1 或 L2;感知损失先用一个特征提取器表示图像,再比较特征;对抗反馈则学习候选是否具有目标图像集合的外观。这些要求可以组合并调整权重,但每项都只检查自己看到的信息。换用特征,并没有取消特征选择带来的偏好;加上对抗反馈,也没有让缺失事实重新被观测。

“砖缝更锐利了,为什么还不能说恢复成功?” 因为可能只是补得更像砖墙。揭开本例选定的高分辨率原图,在同一处墙面核对:如果原貌是灰泥,新增砖缝再自然,也没有忠实恢复这里的材质。独立原图提供了区分候选的证据,而不是另一项审美意见。

低清观测平滑重建纹理候选已知原图新增砖缝这里没有砖缝清晰是外观;恢复需要证据。
新增砖纹需与原图同位置比较;更锐利的候选未必更忠实。

这也解释了为什么像素折中有时显得平滑:多个来处都可能时,降低平均误差可以奖励折中,而一个具体自然纹理需要作出选择。选择本身并不坏。创意设计可以欢迎合理的新纹理;文献修复、测量或证据辨读却不能把新增细节直接当成记录中的事实。成功标准必须随任务改变。

下一页看一种更强的训练条件:输入结构图和目标照片来自同一栋楼,位置能够对齐。这样一组配对究竟向模型补充了什么信息?

画面怎样推进

第1步

平滑与纹理候选看起来不同;锐利本身不能证明忠实于原貌。

打开这一停点

第2步

像素、感知特征与对抗反馈分别检查不同层次的差异。

打开这一停点

第3步

将候选砖缝与独立原图同位置比较,才能检验新增纹理是否属于原场景。

打开这一停点

学习材料

与当前画面直接相关

一个低清像素,能决定两块高分辨率像素吗?

把缩小暂时写成取平均:高分辨率两像素(0,1)和(1,0),都会变成低清值0.5。仅凭0.5无法判断原来是哪一对。若两种来处等可能,逐像素平方误差的最优折中是(0.5,0.5);它较平滑,却不是任一原始细节。

对抗反馈可以鼓励选择一份更像真实纹理的完整结果,但输入仍没有提供被丢掉的信息。创意补全可以接受合理选择;恢复文献或辨读证据时,必须用独立原图或其他记录核对。清晰度提升与事实恢复,应各自给出证据。

接着读:补得自然为何仍未恢复事实。

连续阅读

CLS 04 · 对抗反馈与图像翻译

按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。

先看:第4章,从对象和问题开始

阅读与实践

LAB 08 · 生成器与判别器的真实反馈

固定生成起点比较训练前中后;改变 D:G 更新比,分别读近模式比例与模式覆盖。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

LAB 03 · CycleGAN:可逆不等于语义正确

先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。

先看:先看保存结果与读图解释

在 Deepnote 阅读与运行

来源与进一步阅读

Generative Adversarial Networks

比较像素、感知与对抗项分别惩罚什么误差,联系超分辨率中新增纹理的证据边界。

先看:第81–92页