到底让网络学着预测什么?
受损红杯图与当前难度不变,右侧却可以提出三种问题:加进去的扰动是什么?干净图大概是什么?接下来应怎样变化?这不是把三种名字贴到同一张结果上,而是决定网络直接输出哪一种量,再怎样计算损失和采样更新。
在已知加噪关系和相应条件下,预测噪声与预测干净图可以互相转换。例如已知当前图由原图与扰动按给定比例组成,估计出其中一项就能代入关系求另一项。但“可以换算”不等于有限网络同样容易学。变换会改变误差的尺度,不同难度的权重也可能变化;如果某个系数接近零,数值处理还需额外注意。网络容量、时间抽样、损失权重和训练预算都会影响最终结果。
学生问:“理论表达相通,为什么还值得研究预测目标?” 因为优化的是一个具体、有限的学习系统。让同一个学生写完整图案,和让他逐点记录干扰图案,可以通过已知关系互相推算,却可能要求保留不同的信息。数学关系提供可比较的原则,没有替实际学习难度作答。
JiT 的研究由 Tianhong Li 与 Kaiming He 提出,重新检验直接预测干净图的价值:在自然数据具有低维结构的假设下,干净图与高维噪声对有限网络的信息要求可能不同。它将这个问题放在大 patch 的像素 Transformer 中检验。这里应分清“网络直接预测什么”“在哪个空间计算损失”“采样器使用什么量”,不能把三者混为一个标签。像素与潜在空间的优劣比较,还要受分辨率、网络容量与训练预算约束,不能把特定设置的结果外推到所有任务。
“网络已经预测干净图,为什么还要回到更新回路?” 这是一张由当前受损输入估计出的干净图,不自动等于最终一次交付。JiT 的采样仍结合状态与预测形成更新并重复调用;原文默认使用多步 Heun 求解。因此 JiT 本身不应被归成“一步生成”,直接预测干净图也不是论文首次发明的概念。
训练目标还决定有限资源被分配到哪些问题:经常采样的难度、较大权重的误差,会更强地影响训练。概率建模的原则与具体训练配方需要一起看,不能只看一个公式变形就宣布实现等效。
下一页选择“变化方向”继续展开:怎样用许多起点和数据端点构造训练关系,让一个共享预测器学会搬运一整群样本?
同一生成循环,本页改变预测目标
当前表示 → 模型预测 → 更新规则 → 下一状态 预测目标
画面怎样推进
第1步
相同受损输入可以要求网络预测噪声、干净图或变化量。
打开这一停点第2步
目标可转换并不保证容量、损失权重和有限训练条件下同样易学。
打开这一停点第3步
JiT直接预测干净图并研究像素Transformer;预测之后仍经更新与重复调用,不等于一步生成。
打开这一停点学习材料
与当前画面直接相关
能换算的预测目标,为什么未必同样好学?
关系xₜ=a x₀+σ ε给出:干净值误差=−(σ/a)×噪声预测误差。若噪声误差都是0.1,a=0.8、σ=0.6时,干净误差为−0.075;若a=0.1、σ≈0.995,则约−0.995。相同噪声误差在不同难度上,对干净结果的影响可以相差很多。
因此直接预测哪种量、在哪个空间计分、如何加时间权重,是关联但不同的决定;两种未加权MSE不会因代数可换算就等效。JiT重新检验有限网络下的干净图预测,仍使用多步求解,不能把“输出干净估计”当成“一步生成”。
接着读:误差换算与损失权重及JiT改变的具体问题。
连续阅读
CLS 05 · 扩散:训练、采样与少步生成
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第5章,从对象和问题开始
阅读与实践
LAB 09 · 学得去噪器与完整采样
固定初始噪声,仅改采样步数;把网络近似误差与数值步进误差分开。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行LAB 05 · 扩散的条件均值与流积分
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行来源与进一步阅读
Back to Basics: Let Denoising Generative Models Denoise
区分prediction space、loss space和generator space;检查直接净图预测为何仍进入多步采样。
先看:第3节、第4.2节与采样算法
Diffusion Models
沿不同预测参数化理解目标之间的关系,留意权重和有限训练配方。
先看:第25–57页
