离散扩散模型:一个通用框架,其中状态空间的设计决定了生成过程

20 九月 202623 视图

作者提出通过构建离散状态空间的视角来审视这类模型——即分词方案、词表拓扑与领域字母表。矩阵转移、状态掩码以及基于评分的方法,最终都是同一设计空间的特例,这揭示了在训练目标、推理算法、扩展性、系统优化与评估协议中存在的共同权衡。

离散扩散模型:一个通用框架,其中状态空间的设计决定了生成过程

离散扩散模型的位置

离散去噪扩散模型(DDM)处理的是离散数据。它们是自回归建模(AR)的替代方案。模型不是逐步延续序列,而是并行生成并迭代地、全局地细化结果。

与连续扩散的主要区别在于状态空间的构造方式。在连续情形下,空间是固定的。在离散情形下,空间是被构造出来的,而生成效果取决于这一构造。

方法生成模式
自回归建模顺序生成
连续扩散在固定状态空间下迭代细化
离散扩散并行生成与迭代式全局细化

选择标准很简单。在需要并行生成和全局精修结果的地方,就采用 DDM。但这种生成的质量不仅取决于模型本身。

状态空间:三个组成部分

统一框架通过底层离散状态空间的构造来审视离散扩散。这一构造包含三个要素。

  • 分词方案决定数据被拆分成哪些单元。
  • 词表拓扑决定这些单元之间如何相互关联。
  • 领域结构字母表规定特定于该领域的单元与关联。

这三个决策并非在现成模型之上的设置项。它们规定了扩散所进行的那一空间本身。因此,分词与生成被放在同一个框架中考察,而不是分开来看。

实践标准:先描述状态空间,再选择模型表述。

统一框架与三种表述

现有的离散扩散表述,其实是同一个解空间的不同实例。框架中有三种。

  • Transition-matrix——通过转移矩阵的表述。
  • Masking / absorbing-state——通过掩码与吸收态的表述。
  • Score / ratio-based——通过 score 与比值的表述。

框架表明,这些并非相互竞争的理论,而是同一构造的不同变体。它们之间的差异在于书写方式,共同点则在于它们所属的解空间。

标准:比较不同表述,应当在同一框架内进行。它们之间的选择,相对于状态空间如何构造而言是次要的。

贯穿性的权衡

各项决策相互关联的轴线

框架揭示出在多个轴线上同时存在的共同权衡:

  • 训练目标;
  • 推理算法;
  • 扩展时的行为;
  • 系统优化;
  • 评估协议。

各轴线之间相互关联。训练目标的决策会限制推理算法的选择。系统优化和评估协议也取决于同一选择。

如何使用

对各个变体的比较要同时沿所有轴线进行。在某一轴线上的优势,并不能免除对其余轴线的检验。框架还指出了后续研究的方向。

决策顺序

  1. 描述状态空间:分词方案、词表拓扑、领域结构字母表。
  2. 在框架内选择表述:转移矩阵、掩码、score/ratio。
  3. 针对这一构造设定训练目标和推理算法。
  4. 沿各轴线检验方案:扩展、系统优化、评估协议。

选择标准:如果状态空间的构造未被描述,就无法论证表述和推理方案的合理性。该框架在论文《Discrete Diffusion Models: A Unified Framework from Tokenization to Generation》(arXiv:2607.13431,2026 年 8 月 25 日 v2)中有所阐述。

常问问题

离散扩散模型:一个通用框架,其中状态空间的设计决定了生成过程