同时提出很多词,仍要让它们一起讲得通
N03 的一双鞋要求部件共同守约,N09 用“先选左鞋,再按它选右鞋”处理这种依赖。现在把生成组织换成多个空位同时提出内容:题目只允许两个完整场景——红杯在左,或蓝杯在右。颜色空位可以提出“红”,位置空位也可能提出“右”;两项各自都曾在合法记录中出现,拼在一起却不属于题目允许的组合。
错误并不来自某个词本身。若已经确定红杯,位置应随之受到约束;若确定在右侧,颜色也需要与它协调。同一轮里给许多位置提案,减少的是逐位置等待,没有取消位置之间的依赖。这次和鞋对例子的不同在于:我们正在比较如何安排生成过程,而不只是认识联合约束存在。
一种恢复过程可以先保留较确定的位置,把尚不相容或不确定的位置留下,下一轮利用已经确定的内容继续提议;有的方法还允许重新遮住部分候选再修订。模型的联合上下文、训练方式与采样规则共同影响最终结果。课堂例子只说明为什么需要协调,并不宣称某一项具体修订规则已能保证所有语言关系。
“红和右都高概率,同时选出来为什么会错?”一个位置在尚未知道另一位置时的常见选择,与知道另一位置以后的合适选择不是同一个问题。两个局部最高分,未必组成联合最高分,更未必满足硬条件。这里的红左、蓝右是题目明定的两个候选,不是关于现实杯子的普遍规律;若条件允许红杯在右,判断自然会改变。
“那并行生成是不是只能先乱填,再返工?”不是。模型可以在每轮预测时读取当前整体状态,学到跨位置关系,某些候选也可能一次就相容。例子要否定的是“并行自动消除依赖”这个推断,而不是否定并行路线本身。
还应分清词在句中的位置、哪些位置先被确定,以及预测时可以读取哪些内容。这三个顺序或范围不必相同。模型高置信只表示自身偏好强,不能代替照片、规则或环境提供的正确性证据。
自回归让已经选出的内容逐步成为条件,多位置恢复则以不同方式让候选相互约束。下一页要把这些过程放回完整任务:减少等待轮数,究竟在什么条件下能成为用户实际感受到的速度或可用性提升?
画面怎样推进
第1步
题目仅允许红杯在左与蓝杯在右;红与右分别常见不能直接组成新的合法结果。
打开这一停点第2步
冲突不在词的外观,而在颜色与位置的联合关系。并行提案仍然需要协调。
打开这一停点第3步
红杯被确定以后,剩余位置应利用它作为条件恢复为左侧;这展示了候选如何相互约束。
打开这一停点学习材料
与当前画面直接相关
两个空位都选了常见词,为什么整句还会错?
本页只允许“红杯在左”或“蓝杯在右”。分别给颜色和位置各一半概率,再独立取样,会得到四种组合,只有两种合法:局部概率正确仍可能生成“红杯在右”。错误来自丢掉联合依赖,不是某个词从未出现。
LAB04 把关系展开成两处物种、两处叫声,四个不确定位置独立抽样有16种组合,仅两条合法,理论合法率1/8。先提交一个“猫”,后续再根据它预测其余位置,改变的是可使用的条件,不只是多调用一次。
自检:阈值降到0.5,让所有候选一起提交,会怎样?本例退回独立并行取样。读联合关系算例。
连续阅读
CLS 07 · 离散恢复与 diffusion LLM
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第7章,从对象和问题开始
阅读与实践
LAB 04 · 遮挡文本:并行候选与迭代相容性
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行相关材料
LAB 04 · 遮挡文本:并行候选与迭代相容性
先预测单次并行采样可能产生的冲突,再改变提交门槛,分开观察合法率与轮次。
先看:一次并行独立采样丢了什么?;一个可逐步检查的迭代规则
来源与进一步阅读
Large Language Diffusion Models
观察一次恢复哪些位置、下一轮使用哪些上下文;勿把置信度直接当成外部正确性。
先看:第4–5页:采样与重新遮罩
Simple and Effective Masked Diffusion Language Models
比较不同恢复组织如何利用已有候选,理解位置顺序和恢复顺序可以不同。
先看:采样与半自回归生成部分
