Por que a entropia local cresce mais rápido em redes ReLU profundas com norma variacional: dependência quadrática da profundidade

27 agosto 20268 visualizações

Novo resultado de cota inferior: para a arquitetura ReLU Parhi–Nowak deep-RBV², o risco minimax da regressão gaussiana não pode ser menor que a ordem L²w²log(w)R²/n. Os autores constroem um empacotamento local com cardinalidade logarítmica Ω(L² w² log w), que mostra que a contribuição quadrática do número de camadas é de fato irremovível.

Por que a entropia local cresce mais rápido em redes ReLU profundas com norma variacional: dependência quadrática da profundidade

Introdução

Em aprendizado profundo, a complexidade de um modelo pode ser controlada de diferentes maneiras. Uma delas é a norma variacional: a soma das normas dos pesos em todas as camadas. Ela limita o "volume" da família de funções e permite obter estimativas de generalização. No entanto, permanecia em aberto a questão de quão precisamente essas estimativas refletem a complexidade real da rede.

Em um trabalho recente (arxiv:2608.17434), foi demonstrado que, para redes ReLU profundas com norma variacional, a entropia local — o logaritmo do número de funções distinguíveis em uma bola — cresce quadraticamente com a profundidade. Isso significa que a dependência quadrática do risco em (L) não é um artefato das estimativas superiores, mas uma propriedade intrínseca da classe.

Formulação do problema e arquitetura

Considera-se a regressão gaussiana com uma função desconhecida de uma classe definida pela arquitetura Parhi–Nowak deep-RBV² (versão com valores vetoriais). Os parâmetros são a profundidade (L) e a largura (w), com um total de (O(L w^2)) parâmetros. O orçamento de variação da soma por camadas é (A), e o limite de saída é (B). Para esse modelo, já eram conhecidos os limites inferior e superior do risco minimax, mas eles diferiam por um fator de profundidade. O novo resultado fecha essa lacuna: a dependência quadrática em (L) é exata.

A ideia-chave é construir um empacotamento local: um conjunto de funções que são pairwise distantes, mas que estão em uma pequena bola de raio (O(\lambda)L^2). O logaritmo da cardinalidade desse empacotamento (entropia local) é (\Omega(L^2 w^2 \log w)). Isso significa que, com norma fixa, o número de funções distinguíveis cresce exponencialmente com (L^2 w^2 \log w), e não apenas com (w^2).

Como o empacotamento é construído

Para obter tais funções, os autores usam dois ingredientes:

  • Teorema de aproximação com viés: qualquer função da classe desejada pode ser aproximada por uma rede com coeficientes limitados.
  • Amplificação balanceada: a multiplicação da saída de uma rede ReLU de profundidade (D) por um número (q) é realizada com um único canal constante, enquanto cada coeficiente cresce apenas como (q^{1/D}). O custo desse truque é (O(D w^2 q^{1/D})) em termos da soma das normas.

Combinando essas técnicas, é possível "incorporar" um conjunto de funções na bola da norma variacional, preservando sua separação pairwise. Isso fornece o limite inferior para a entropia.

Limite inferior do risco minimax

Com o empacotamento local, usando a técnica padrão — a variante gaussiana do lema de Fano — obtém-se o limite inferior. O raio da bola é escolhido explicitamente e depende do tamanho da amostra, da escala de saída (B) e das restrições de representação. No caso particular (A = B = R) e (\sigma \sim R) (a menos de constantes), o risco minimax é de ordem não menor que (L^2 w^2 \log(w) R^2 / n).

O limite superior, obtido via pseudodimensão da rede finita, fornece (\widetilde{O}(L^2 w^2 R^2 / n)) para respostas gaussianas ilimitadas. A coincidência dos limites inferior e superior, a menos de fatores logarítmicos, mostra que a dependência quadrática da profundidade é exata. Quando o raio diminui, ocorre uma transição para o regime em que as restrições de representação começam a dominar.

Implicações práticas

O que isso significa na prática? Se regularizamos a rede com a norma variacional, aumentar a profundidade exige significativamente mais dados ou uma regularização mais forte: a complexidade da classe cresce como (L^2 w^2). Isso explica por que redes muito profundas tendem a superajustar com um orçamento fixo de pesos.

Além disso, o resultado mostra que não se pode "contornar" a limitação simplesmente usando uma norma de Banach em vez de uma norma cruzada — a dependência quadrática está embutida na estrutura das ativações ReLU e das camadas com valores vetoriais. Isso é um importante ponto de referência para o desenvolvimento de novas arquiteturas e métodos de regularização.

Em geral, o trabalho fornece uma resposta precisa para a antiga questão sobre a lacuna nas estimativas e confirma a intuição de que a profundidade não é apenas um parâmetro, mas um fator independente de complexidade que afeta todas as garantias estatísticas.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Por que a entropia local cresce mais rápido em redes ReLU profundas com norma variacional: dependência quadrática da profundidade