El lugar de los modelos de difusión discreta
Los modelos de difusión de denoising discreta (DDM) trabajan con datos discretos. Constituyen una alternativa al modelado autorregresivo (AR). En lugar de continuar la secuencia paso a paso, el modelo genera en paralelo y refina el resultado de forma iterativa y global.
La principal diferencia con la difusión continua es la estructura del espacio de estados. En el caso continuo, el espacio es fijo. En el caso discreto, se construye, y de esa construcción depende la generación.
| Enfoque | Modo de generación |
|---|---|
| Modelado autorregresivo | Generación secuencial |
| Difusión continua | Refinamiento iterativo con espacio de estados fijo |
| Difusión discreta | Generación paralela y refinamiento global iterativo |

El criterio de elección es simple. Los DDM se emplean donde se necesitan generación paralela y refinamiento global del resultado. Pero la calidad de dicha generación no depende solo del modelo en sí.
Espacio de estados: tres componentes
El marco unificado contempla la difusión discreta a través de la construcción del espacio de estados discreto subyacente. En la construcción intervienen tres elementos.
- El esquema de tokenización determina en qué unidades se dividen los datos.
- La topología del vocabulario determina cómo se relacionan esas unidades entre sí.
- Los alfabetos estructurales de dominio definen las unidades y las relaciones específicas de la materia.

Estas tres decisiones no se reducen a ajustes sobre un modelo ya listo. Definen el propio espacio por el que transcurre la difusión. Por eso la tokenización y la generación se consideran dentro de un mismo marco, y no por separado.
Criterio práctico: primero se describe el espacio de estados, luego se elige la formulación del modelo.
Marco unificado y tres formulaciones
Las formulaciones existentes de la difusión discreta resultan ser distintas instancias de un mismo espacio de soluciones. En el marco hay tres.
- Transition-matrix — formulación mediante la matriz de transiciones.
- Masking / absorbing-state — formulación mediante enmascaramiento y estado absorbente.
- Score / ratio-based — formulación mediante score y cocientes.
El marco muestra que no son teorías competidoras, sino variantes de una misma construcción. La diferencia entre ellas reside en el modo de formulación, y lo común está en el espacio de soluciones al que pertenecen.
Criterio: comparar formulaciones tiene sentido dentro de un mismo marco. La elección entre ellas es secundaria respecto a cómo está estructurado el espacio de estados.
Compromisos transversales
Ejes por los que se relacionan las decisiones
El marco revela compromisos comunes en varios ejes a la vez:
- objetivos de entrenamiento;
- algoritmos de inferencia;
- comportamiento al escalar;
- optimización sistémica;
- protocolos de evaluación.

Los ejes están interconectados. La decisión sobre el objetivo de entrenamiento limita la elección del algoritmo de inferencia. La optimización sistémica y los protocolos de evaluación dependen de esa misma elección.
Cómo utilizarlo
La comparación de variantes se lleva a cabo por todos los ejes a la vez. La ventaja en un eje no exime de verificar los demás. El marco también señala direcciones para investigaciones futuras.
Orden de las decisiones
- Describir el espacio de estados: el esquema de tokenización, la topología del vocabulario, el alfabeto estructural de dominio.
- Elegir la formulación dentro del marco: matriz de transiciones, enmascaramiento, score/ratio.
- Definir el objetivo de entrenamiento y el algoritmo de inferencia para esa construcción.
- Verificar la decisión por los ejes: escalado, optimización sistémica, protocolos de evaluación.
Criterio de elección: si la construcción del espacio de estados no está descrita, no se puede justificar la formulación ni el esquema de inferencia. El marco se describe en el trabajo «Discrete Diffusion Models: A Unified Framework from Tokenization to Generation» (arXiv:2607.13431, v2 del 25 de agosto de 2026).



