O lugar dos modelos de difusão discreta
Os modelos de difusão de denoising discreta (DDM) operam com dados discretos. Eles se apresentam como alternativa à modelagem autorregressiva (AR). Em vez de continuar a sequência passo a passo, o modelo gera em paralelo e refina o resultado de forma iterativa e global.
A principal diferença em relação à difusão contínua está na estrutura do espaço de estados. No caso contínuo, o espaço é fixo. No caso discreto, ele é construído, e a geração depende dessa construção.
| Abordagem | Modo de geração |
|---|---|
| Modelagem autorregressiva | Geração sequencial |
| Difusão contínua | Refinamento iterativo com espaço de estados fixo |
| Difusão discreta | Geração paralela e refinamento global iterativo |

O critério de escolha é simples. Os DDM são adotados onde são necessárias geração paralela e elaboração global do resultado. Mas a qualidade dessa geração é determinada não apenas pelo próprio modelo.
Espaço de estados: três componentes
O arcabouço unificado examina a difusão discreta por meio da construção do espaço de estados discreto subjacente. A construção inclui três elementos.
- O esquema de tokenização determina em quais unidades os dados são divididos.
- A topologia do vocabulário determina como essas unidades se relacionam entre si.
- Os alfabetos estruturais de domínio definem unidades e relações específicas da área de aplicação.

Essas três decisões não se resumem a configurações sobre um modelo pronto. Elas definem o próprio espaço pelo qual a difusão ocorre. Por isso, tokenização e geração são consideradas em um único arcabouço, e não separadamente.
Critério prático: primeiro descreve-se o espaço de estados, depois escolhe-se a formulação do modelo.
Arcabouço unificado e três formulações
As formulações existentes de difusão discreta revelam-se diferentes instanciações de um mesmo espaço de soluções. No arcabouço, são três.
- Transition-matrix — formulação por meio da matriz de transição.
- Masking / absorbing-state — formulação por meio de mascaramento e estado absorvente.
- Score / ratio-based — formulação por meio de score e razões.
O arcabouço mostra que não são teorias concorrentes, mas variantes de uma mesma construção. A diferença entre elas está na forma de escrita, e o que têm em comum está no espaço de soluções ao qual pertencem.
Critério: comparar formulações faz sentido dentro de um mesmo arcabouço. A escolha entre elas é secundária em relação a como o espaço de estados é estruturado.
Trade-offs transversais
Eixos pelos quais as decisões se conectam
O arcabouço revela trade-offs comuns em vários eixos ao mesmo tempo:
- objetivos de treinamento;
- algoritmos de inferência;
- comportamento em escala;
- otimização de sistemas;
- protocolos de avaliação.

Os eixos estão interligados. A decisão sobre o objetivo de treinamento limita a escolha do algoritmo de inferência. A otimização de sistemas e os protocolos de avaliação dependem da mesma escolha.
Como usar isso
A comparação de variantes é feita por todos os eixos ao mesmo tempo. O ganho em um eixo não dispensa a verificação dos demais. O arcabouço também aponta direções para pesquisas futuras.
Ordem das decisões
- Descrever o espaço de estados: esquema de tokenização, topologia do vocabulário, alfabeto estrutural de domínio.
- Escolher a formulação dentro do arcabouço: matriz de transição, mascaramento, score/ratio.
- Definir o objetivo de treinamento e o algoritmo de inferência para essa construção.
- Verificar a solução pelos eixos: escala, otimização de sistemas, protocolos de avaliação.
Critério de escolha: se a construção do espaço de estados não está descrita, não é possível justificar a formulação e o esquema de inferência. O arcabouço está descrito no trabalho «Discrete Diffusion Models: A Unified Framework from Tokenization to Generation» (arXiv:2607.13431, v2 de 25 de agosto de 2026).



