Introdução
Em aprendizado profundo, a complexidade de um modelo pode ser controlada de diferentes maneiras. Uma delas é a norma variacional: a soma das normas dos pesos em todas as camadas. Ela limita o "volume" da família de funções e permite obter estimativas de generalização. No entanto, permanecia em aberto a questão de quão precisamente essas estimativas refletem a complexidade real da rede.
Em um trabalho recente (arxiv:2608.17434), foi demonstrado que, para redes ReLU profundas com norma variacional, a entropia local — o logaritmo do número de funções distinguíveis em uma bola — cresce quadraticamente com a profundidade. Isso significa que a dependência quadrática do risco em (L) não é um artefato das estimativas superiores, mas uma propriedade intrínseca da classe.

Formulação do problema e arquitetura
Considera-se a regressão gaussiana com uma função desconhecida de uma classe definida pela arquitetura Parhi–Nowak deep-RBV² (versão com valores vetoriais). Os parâmetros são a profundidade (L) e a largura (w), com um total de (O(L w^2)) parâmetros. O orçamento de variação da soma por camadas é (A), e o limite de saída é (B). Para esse modelo, já eram conhecidos os limites inferior e superior do risco minimax, mas eles diferiam por um fator de profundidade. O novo resultado fecha essa lacuna: a dependência quadrática em (L) é exata.
A ideia-chave é construir um empacotamento local: um conjunto de funções que são pairwise distantes, mas que estão em uma pequena bola de raio (O(\lambda)L^2). O logaritmo da cardinalidade desse empacotamento (entropia local) é (\Omega(L^2 w^2 \log w)). Isso significa que, com norma fixa, o número de funções distinguíveis cresce exponencialmente com (L^2 w^2 \log w), e não apenas com (w^2).
Como o empacotamento é construído
Para obter tais funções, os autores usam dois ingredientes:
- Teorema de aproximação com viés: qualquer função da classe desejada pode ser aproximada por uma rede com coeficientes limitados.
- Amplificação balanceada: a multiplicação da saída de uma rede ReLU de profundidade (D) por um número (q) é realizada com um único canal constante, enquanto cada coeficiente cresce apenas como (q^{1/D}). O custo desse truque é (O(D w^2 q^{1/D})) em termos da soma das normas.
Combinando essas técnicas, é possível "incorporar" um conjunto de funções na bola da norma variacional, preservando sua separação pairwise. Isso fornece o limite inferior para a entropia.

Limite inferior do risco minimax
Com o empacotamento local, usando a técnica padrão — a variante gaussiana do lema de Fano — obtém-se o limite inferior. O raio da bola é escolhido explicitamente e depende do tamanho da amostra, da escala de saída (B) e das restrições de representação. No caso particular (A = B = R) e (\sigma \sim R) (a menos de constantes), o risco minimax é de ordem não menor que (L^2 w^2 \log(w) R^2 / n).
O limite superior, obtido via pseudodimensão da rede finita, fornece (\widetilde{O}(L^2 w^2 R^2 / n)) para respostas gaussianas ilimitadas. A coincidência dos limites inferior e superior, a menos de fatores logarítmicos, mostra que a dependência quadrática da profundidade é exata. Quando o raio diminui, ocorre uma transição para o regime em que as restrições de representação começam a dominar.
Implicações práticas
O que isso significa na prática? Se regularizamos a rede com a norma variacional, aumentar a profundidade exige significativamente mais dados ou uma regularização mais forte: a complexidade da classe cresce como (L^2 w^2). Isso explica por que redes muito profundas tendem a superajustar com um orçamento fixo de pesos.
Além disso, o resultado mostra que não se pode "contornar" a limitação simplesmente usando uma norma de Banach em vez de uma norma cruzada — a dependência quadrática está embutida na estrutura das ativações ReLU e das camadas com valores vetoriais. Isso é um importante ponto de referência para o desenvolvimento de novas arquiteturas e métodos de regularização.
Em geral, o trabalho fornece uma resposta precisa para a antiga questão sobre a lacuna nas estimativas e confirma a intuição de que a profundidade não é apenas um parâmetro, mas um fator independente de complexidade que afeta todas as garantias estatísticas.



