Appearance
第 11 讲 扩散语言模型
本讲对应 Week 14–15 的课堂内容:先从连续空间中的 DDPM 推出前向加噪、反向去噪与训练目标,再把状态空间改为离散 token,得到 D3PM 与 masked diffusion language model。
1. 生成模型的两条路径
自回归语言模型把联合分布分解为
生成顺序固定为从左到右。扩散模型则先定义一个逐步破坏数据的前向过程,再学习逆过程:
2. DDPM 的前向过程
连续数据中常用高斯 Markov 链:
其中噪声日程
利用高斯分布的封闭性,可以跳过中间状态,直接采样任意时刻:
等价地,
这条重参数化公式是训练效率的关键:随机抽一个
3. 反向过程与可计算后验
真实反向条件
训练时已知干净样本
可以解析写成高斯分布。以
对负对数似然使用变分上界,可得到逐步 KL 项:
若方差按日程固定,并把均值改写为噪声预测器
模型也可以预测
4. DDPM 的训练与采样
训练的一次更新可以概括为:
- 从数据集采样
; - 均匀或按权重采样时间步
; - 采样高斯噪声
,直接构造 ; - 网络读取
,预测噪声、干净样本或反向分布参数; - 计算去噪损失并更新参数。
生成时从
5. 为什么文本不能直接照搬高斯噪声
图像像素位于连续空间,而 token 是有限词表
D3PM 直接在离散状态上定义转移。把
多步转移仍可一次计算:
因此离散扩散与 DDPM 共享同一结构:已知的前向破坏过程、可计算的多步边缘分布,以及需要学习的反向去噪过程。
6. 转移矩阵的三种设计
Uniform corruption
以一定概率保留原 token,其余概率均匀分配到词表:
它对称、简单,不需要真的存储
Absorbing-mask corruption
每个 token 以概率 [MASK],而 [MASK] 一旦出现就在前向过程中保持。
Semantic transition
把概率分配给 embedding 或语义上相近的 token,试图让破坏过程更平滑。但它需要定义可靠的邻接关系,可能保留过多原语义,也会增加计算和扩展到大词表的难度。
7. 离散反向过程
已知
神经网络通常读取被破坏序列
masked diffusion 的一次迭代不是简单地“把所有 mask 一次填完”,而是预测各位置、按置信度或日程接受一部分结果,再继续修订。时间嵌入告诉网络当前噪声强度:早期应恢复粗粒度全局结构,后期处理局部细节。
8. 与自回归语言模型的比较
| 维度 | 自回归 LM | 扩散 LM |
|---|---|---|
| 因子分解 | 固定左到右 | 多轮全局去噪 |
| 单轮并行性 | 每次通常生成一个 token | 同一轮可更新多个位置 |
| 迭代次数 | 与输出长度近似线性 | 由去噪步数决定 |
| 修改已生成内容 | 需回退或重生成 | 可在多轮中共同修订 |
| 成熟生态 | KV cache、连续批处理较成熟 | 缓存和服务仍在快速发展 |
| 主要风险 | 前缀错误累积 | 采样步多、转移与日程敏感 |
扩散 LM 的并行修订有利于全局约束、填空和编辑,但“能并行更新 token”不自动等于端到端更快:真实延迟还取决于去噪步数、每步网络成本、接受策略和硬件利用率。
9. 关键设计联动
- 噪声日程决定不同时间步的信息量,过快会让学习目标太难,过慢会浪费步骤。
- 转移矩阵决定模型到底学习“从什么噪声恢复什么结构”,并非无关紧要的实现细节。
- 时间步采样会改变损失权重;可按信噪比或历史损失重加权。
- 采样器、步数和置信度策略共同决定质量、并行度与延迟。
- 比较自回归与扩散模型时,应控制参数量、训练数据、计算预算和解码成本,不能只比较单一基准分数。
10. 后验均值与三种预测参数化
由高斯条件分布可得
其中
神经网络若预测噪声
恢复
11. VAE 视角
VAE 引入潜变量
第一项要求可重构,第二项把编码分布约束到易采样先验。扩散模型可看成拥有许多层潜变量
12. D3PM 后验与损失
对 one-hot 状态,已知
归一化后即可得到精确后验。模型常预测
转移矩阵还可按 token 距离设计为 discretized Gaussian,或依据 embedding 相似度构造邻域,但大词表下不能显式保存稠密
13. LLaDA、Dream 与生成过程
课堂中的 LLaDA 采用 masked diffusion:前向随机 mask,反向 Transformer 同时预测多个缺失位置。训练随机采样 mask 比例,使用被 mask token 的交叉熵;生成从全 mask 开始,每轮根据置信度提交一部分 token,并允许剩余位置继续全局修订。
Dream 展示了另一条工程路线:利用成熟自回归模型权重初始化扩散模型,减少从头训练的成本。由于 causal attention 与双向去噪的可见性不同,需要调整 mask、位置和训练目标,权重迁移不是直接复制即可。
扩散 LM 的吞吐优势取决于“每轮提交多少 token × 需要多少轮”。步数少时速度快但错误多,步数多时质量提高却可能失去并行优势。代码补全、约束填空和局部编辑尤其适合非左到右生成,因为模型能先确定结构再回填细节。
延伸阅读
- Ho et al., Denoising Diffusion Probabilistic Models
- Austin et al., Structured Denoising Diffusion Models in Discrete State-Spaces
- Sahoo et al., Simple and Effective Masked Diffusion Language Models