深度二次依赖:为什么在具有变分范数的深层ReLU网络中局部熵增长更快

27 八月 20268 视图

新的证明结果:对于ReLU架构的Parhi–Nowak深度RBV²,高斯回归的极小极大风险不能低于L²w²log(w)R²/n的量级。作者构建了一个具有对数基数Ω(L² w² log w)的局部填充,这表明层数平方项的贡献确实是不可消除的。

深度二次依赖:为什么在具有变分范数的深层ReLU网络中局部熵增长更快

引言

在深度学习中,模型复杂度可以通过多种方式控制。其中一种是变分范数:所有层权重范数之和。它限制了函数族的“体积”,并能够获得泛化界。然而,这些界在多大程度上准确反映了网络的实际复杂度,至今仍是一个悬而未决的问题。

在最近的工作中(arxiv:2608.17434)表明,对于具有变分范数的深度ReLU网络,局部熵——球内可区分函数数量的对数——随深度呈二次方增长。这意味着风险对(L)的二次依赖并非上界估计的伪影,而是该类别的内在属性。

问题设定与架构

考虑高斯回归,其中未知函数来自由Parhi–Nowak deep-RBV²架构(向量值版本)定义的类别。参数包括深度(L)和宽度(w),共(O(L w^2))个参数。逐层求和变分预算为(A),输出界为(B)。对于该模型,极小极大风险的下界和上界此前已知,但二者相差一个深度因子。新结果填补了这一差距:(L)的二次依赖是精确的。

关键思想是构造一个局部填充:一组函数,它们两两相距较远,但位于半径为(O(\lambda)L^2)的小球内。该填充的势的对数(局部熵)为(\Omega(L^2 w^2 \log w))。这意味着在固定范数下,可区分函数的数量随(L^2 w^2 \log w)呈指数增长,而不仅仅是(w^2)。

如何构造填充

为了获得这些函数,作者使用了两个要素:

  • 带偏移的逼近定理:所需类别中的任何函数都可以用具有有界系数的网络来逼近。
  • 平衡放大:将深度为(D)的ReLU网络的输出乘以数(q),可以通过一个常数通道实现,同时每个系数仅按(q^{1/D})增长。这种技巧的代价在范数之和方面为(O(D w^2 q^{1/D}))。

通过组合这些技术,可以将一组函数“嵌入”到变分范数球内,同时保持其两两可分性。这便给出了熵的下界。

极小极大风险的下界

利用局部填充,通过标准技术——高斯版本的Fano引理——获得下界。球的半径被显式选择,并依赖于样本量、输出尺度(B)和表示约束。在(A = B = R)且(\sigma \sim R)的特殊情形下(在常数因子内),极小极大风险不低于(L^2 w^2 \log(w) R^2 / n)的量级。

通过有限网络的伪维数获得的上界,对于无界高斯响应给出(\widetilde{O}(L^2 w^2 R^2 / n))。上下界在对数因子内一致,表明对深度的二次依赖是精确的。当半径减小时,会出现表示约束开始主导的机制。

实际意义

这在实践中意味着什么?如果我们用变分范数对网络进行正则化,那么增加深度需要显著更多的数据量或更强的正则化:类别复杂度按(L^2 w^2)增长。这解释了为什么在固定权重预算下,极深网络容易过拟合。

此外,该结果表明,仅通过使用Banach范数而非交叉范数,无法“绕过”这一限制——二次依赖内嵌于ReLU激活和向量值层的结构中。这对开发新架构和正则化方法是一个重要的参考。

总体而言,该工作为关于估计差距的长期问题提供了精确答案,并证实了直觉:深度不仅仅是一个参数,而是一个独立的复杂度因素,影响所有统计保证。

常问问题

深度二次依赖:为什么在具有变分范数的深层ReLU网络中局部熵增长更快