引言
在深度学习中,模型复杂度可以通过多种方式控制。其中一种是变分范数:所有层权重范数之和。它限制了函数族的“体积”,并能够获得泛化界。然而,这些界在多大程度上准确反映了网络的实际复杂度,至今仍是一个悬而未决的问题。
在最近的工作中(arxiv:2608.17434)表明,对于具有变分范数的深度ReLU网络,局部熵——球内可区分函数数量的对数——随深度呈二次方增长。这意味着风险对(L)的二次依赖并非上界估计的伪影,而是该类别的内在属性。

问题设定与架构
考虑高斯回归,其中未知函数来自由Parhi–Nowak deep-RBV²架构(向量值版本)定义的类别。参数包括深度(L)和宽度(w),共(O(L w^2))个参数。逐层求和变分预算为(A),输出界为(B)。对于该模型,极小极大风险的下界和上界此前已知,但二者相差一个深度因子。新结果填补了这一差距:(L)的二次依赖是精确的。
关键思想是构造一个局部填充:一组函数,它们两两相距较远,但位于半径为(O(\lambda)L^2)的小球内。该填充的势的对数(局部熵)为(\Omega(L^2 w^2 \log w))。这意味着在固定范数下,可区分函数的数量随(L^2 w^2 \log w)呈指数增长,而不仅仅是(w^2)。
如何构造填充
为了获得这些函数,作者使用了两个要素:
- 带偏移的逼近定理:所需类别中的任何函数都可以用具有有界系数的网络来逼近。
- 平衡放大:将深度为(D)的ReLU网络的输出乘以数(q),可以通过一个常数通道实现,同时每个系数仅按(q^{1/D})增长。这种技巧的代价在范数之和方面为(O(D w^2 q^{1/D}))。
通过组合这些技术,可以将一组函数“嵌入”到变分范数球内,同时保持其两两可分性。这便给出了熵的下界。

极小极大风险的下界
利用局部填充,通过标准技术——高斯版本的Fano引理——获得下界。球的半径被显式选择,并依赖于样本量、输出尺度(B)和表示约束。在(A = B = R)且(\sigma \sim R)的特殊情形下(在常数因子内),极小极大风险不低于(L^2 w^2 \log(w) R^2 / n)的量级。
通过有限网络的伪维数获得的上界,对于无界高斯响应给出(\widetilde{O}(L^2 w^2 R^2 / n))。上下界在对数因子内一致,表明对深度的二次依赖是精确的。当半径减小时,会出现表示约束开始主导的机制。
实际意义
这在实践中意味着什么?如果我们用变分范数对网络进行正则化,那么增加深度需要显著更多的数据量或更强的正则化:类别复杂度按(L^2 w^2)增长。这解释了为什么在固定权重预算下,极深网络容易过拟合。
此外,该结果表明,仅通过使用Banach范数而非交叉范数,无法“绕过”这一限制——二次依赖内嵌于ReLU激活和向量值层的结构中。这对开发新架构和正则化方法是一个重要的参考。
总体而言,该工作为关于估计差距的长期问题提供了精确答案,并证实了直觉:深度不仅仅是一个参数,而是一个独立的复杂度因素,影响所有统计保证。



