语言的“受损”,可以是把一部分词藏起来
照片中的红杯与梨提供了场景条件,完整描述则是一条已有训练记录。现在藏起描述中的一部分词,例如保留“杯子在梨的”,遮住颜色和位置。原句仍由出题者保存;模型收到照片、问题和当前可见词,尝试恢复被藏起的位置。批改时,再把这些位置的预测与原词比较。
这和 N30 的造题逻辑相通:我们主动隐藏了什么,就知道本次该在什么位置给反馈。轻遮罩留下较多语言线索,重遮罩要求模型组织更多内容。若每个回答位置独立地以某个概率被遮住,这个概率控制的是平均受损程度,不保证每句话恰好遮住同样数量的词。
文字需要适合自己的受损方式。词表编号只是地址。如果把编号连同词表、嵌入与输出对应一致重排,词的含义不变;若字典不变而只换输入编号,模型读到的词就变了。编号相差一并不表示语义接近。因此不能把词号直接当像素值加一点噪声,再认为它变成了“相邻意义”的词。这里采用的是把词类别替换成特殊遮罩符号。离散扩散还可以定义其他类别转移;遮罩是一条具体路线,不是全部语言扩散的唯一形式。
“能读两侧可见词,会不会是在偷看答案?”两侧文字若属于当前合法输入,就可以提供条件。被遮住的真实词仍留在批改端,不能交给模型。对一条训练记录,模型看到哪些位置与在哪些位置评分必须分开。当前示例只批改被藏起的回答位置;更完整的训练目标还会处理不同遮罩难度出现的概率及相应权重。
“生成时,原句也在旁边吗?”没有。生成一个新回答时,问题和允许的上下文仍可见,未知回答不会以真实词的形式提前给出。模型需要从遮罩或已有候选中逐步形成回答。指令微调也可以沿用这个区分:保持提示不变,对回答部分制造恢复任务,让模型学习在该条件下怎样作答。
训练时抽取一道某种遮罩程度的恢复题,与生成时反复调用预测器形成回答,是两个不同过程。多比例填空目标只是系统的一部分,还要说明怎样从初始状态逐步得到完整输出;难度参数可以连续变化,也不表示词类别因此变成连续数值。
本页照片是讲清条件关系的例子,不意味着被引用的语言模型已经获得读图能力,也没有在课堂上训练出一个大语言模型。我们先弄清训练信息怎样流动。下一页再看:当几个空位同时提出候选,为什么每个位置单独答得合理,整句话仍可能违约?
画面怎样推进
第1步
轻重遮罩留下不同数量的上下文,使同一记录产生不同难度的恢复任务。
打开这一停点第2步
模型看到当前合法词与条件,预测被遮位置;批改依据是出题者保存的原词。
打开这一停点第3步
训练保存的真词用于评分,新回答生成时不可见;提示可保持不变,回答才是恢复对象。
打开这一停点学习材料
与当前画面直接相关
遮住词以后,模型能看什么、批改端知道什么?
训练者保存原句,模型只读当前可见词和合法提示,为被遮位置给概率。左右两侧可见词可以作为线索;被遮位置的真实答案只用于损失,不能提前作为输入。生成新回答时,更没有一条完整正确回答放在旁边。
例如两个被遮词的正确概率为0.8与0.6,未加权负对数概率和约0.734;若本题遮罩比例参数为0.5,LLaDA 目标中的时间权重使它约为1.468。具体实现是否再除长度另行核对。参数0.5表示每位置被遮的概率,不保证每句恰好遮一半。
自检:词号相差一是否意味着语义相近?不是,编号是词表地址。读这个监督算例。
连续阅读
CLS 07 · 离散恢复与 diffusion LLM
按连续正文理解这条方法的训练信号、使用过程与算例;数学与实践在相关问题旁展开。
先看:第7章,从对象和问题开始
阅读与实践
LAB 04 · 遮挡文本:并行候选与迭代相容性
先读本册保存结果,再按实现顺序核对一个算例;最后只改一个变量。
先看:先看保存结果与读图解释
在 Deepnote 阅读与运行相关材料
LAB 04 · 遮挡文本:并行候选与迭代相容性
在既有小语法例子中逐项检查条件与评分位置;这里的精确有限分布不等于训练一个真实语言模型。
先看:保持条件、计算损失,再评价迭代成本
来源与进一步阅读
Structured Denoising Diffusion Models in Discrete State-Spaces
先看类别状态怎样受损,再辨认遮罩只是其中一种选择;长公式可暂时跳过。
先看:第2–4页:离散转移与吸收遮罩
Large Language Diffusion Models
逐项标出模型可见输入、被遮位置和评分对象,检查提示为何保持可见。
先看:第3–5页:预训练目标与监督微调
