两种合理结果,平均起来可能哪一种都不像
题目没有固定椅子在画面里的位置,因此左侧一把完整椅子成立,右侧一把完整椅子也成立。现在逐像素平均这两幅图:左边保留一半椅子的颜色,右边也保留一半,结果是两份半透明重影。它在数字上做了折中,却没有选择一把完整椅子的位置。
这解释了为什么“接近所有参考答案”与“交出一个合理样本”可能冲突。平均图不是把一把椅子平稳移到中间,而是在每个像素上折中两幅图。图像里的对象结构不一定在这种平均运算下保持。
一个更小的数值例子可以看清评分的作用。假设答案等概率为 −1 或 +1,只允许模型输出一个数,并用平方误差评分。输出 0 时,两种情况下误差都为 1;输出 +1 时,一半误差为 0,另一半为 4,平均误差为 2。于是这套单点评分偏好 0,但若任务要求从两个合法答案中给出一个样本,0 恰好都不是。
“所以均值预测是错误的方法吗?” 不是。若任务就是估计平均数量或最小化平方误差,均值可能正是合适答案;问题出在把这个答案直接当作完整候选。当多种可能路线分别绕过障碍,而平均路线穿过障碍时,也会出现相同区别:算术折中不保证保留可行性。
在固定方差高斯观测模型等条件下,像素平方误差会鼓励相应的均值行为;换观测模型、条件或生成过程,结论可以改变。不能据此断言所有 VAE 必定模糊,也不能看到扩散训练里的均值预测,就断言最终采样只能是一幅重影。N31 会专门区分预测器在当前状态给出的信息,与整个迭代过程交付的完整样本。
这里的要点是把目标说清:要一个平均估计,还是要一个满足结构的具体实现?改为从不同潜变量取完整样本后,我们还需要检查这些起点是否广泛可用。下一页看为什么一条漂亮插值路径回答不了这个问题。
画面怎样推进
第1步
位置未被条件固定,左侧与右侧的完整椅子都是允许答案。
打开这一停点第2步
逐像素平均产生两份半透明重影,没有交付一把完整椅子。
打开这一停点第3步
某种评分偏爱的平均估计未必是结构成立的样本;结论须保留相应评分与输出假设。
打开这一停点学习材料
与当前画面直接相关
平均误差最小,为什么仍不是一个合法样本?
让结果以相同概率取 −1 或 +1。确定地输出 0,平方误差总为 1;输出 +1,一半误差为 0、一半为 4,平均是 2。因此均值 0 确实优化了这项评分,却不属于真实结果集合。两把不同位置的椅子逐像素平均,可能得到重影,也是“数值折中没有保留样本结构”的例子。
自检:这是否证明均值预测都错误?不。若任务是最小化平方误差,0 正是答案;若任务是交付一次可能发生的结果,需要进一步组织分布与采样。解码器显示的均值或概率图,也应与最终观测抽样区分。不能从这个小例子推出所有 VAE 必然模糊,或扩散最后只能交付平均图。
连续阅读
CLS 03 · 潜变量:从重建到生成
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第3章,从对象和问题开始
阅读与实践
LAB 07 · 图像 VAE:重建与可用起点
先比较原图与重建,再看同一先验起点。只改变 KL 权重,读取重建与编码区域的权衡。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行LAB 02 · VAE:ELBO 缺口与重参数化
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Variational Autoencoder
寻找高斯观测假设和平方误差的对应条件;说明为什么这一结论不能概括所有VAE或完整扩散采样。
先看:第23–28页:观测模型与重建评分
