Введение
В глубоком обучении сложность модели можно контролировать разными способами. Один из них — вариационная норма: сумма норм весов по всем слоям. Она ограничивает «объём» семейства функций и позволяет получать оценки обобщения. Однако до сих пор оставался открытым вопрос, насколько точно эти оценки отражают реальную сложность сети.
В недавней работе (arxiv:2608.17434) показано, что для глубоких ReLU-сетей с вариационной нормой локальная энтропия — логарифм числа различимых функций в шаре — растёт квадратично от глубины. Это означает, что квадратичная зависимость риска от (L) не артефакт верхних оценок, а внутреннее свойство класса.

Постановка задачи и архитектура
Рассматривается гауссовская регрессия с неизвестной функцией из класса, заданного архитектурой Parhi–Nowak deep-RBV² (векторнозначная версия). Параметры — глубина (L) и ширина (w), всего (O(L w^2)) параметров. Бюджет вариации суммы по слоям (A), выходная граница (B). Для такой модели уже были известны нижняя и верхняя границы минимаксного риска, но они различались на множитель глубины. Новый результат закрывает этот зазор: квадратичная зависимость от (L) является точной.
Ключевая идея — построить локальную упаковку: набор функций, которые попарно далеки друг от друга, но лежат в небольшом шаре радиусом (O(\lambda)L^2). Логарифм мощности такой упаковки (локальная энтропия) составляет (\Omega(L^2 w^2 \log w)). Это означает, что при фиксированной норме число различимых функций растёт экспоненциально от (L^2 w^2 \log w), а не просто от (w^2).
Как строится упаковка
Чтобы получить такие функции, авторы используют два ингредиента:
- Теорему аппроксимации со смещением: любую функцию из нужного класса можно приблизить сетью с ограниченными коэффициентами.
- Сбалансированное усиление: умножение выхода ReLU-сети глубины (D) на число (q) реализуется с помощью одного постоянного канала, при этом каждый коэффициент растёт лишь как (q^{1/D}). Стоимость такого трюка — (O(D w^2 q^{1/D})) в терминах суммы норм.
Комбинируя эти приёмы, удаётся «вложить» множество функций в шар вариационной нормы, сохранив их попарную разделённость. Это и даёт нижнюю оценку на энтропию.

Нижняя граница минимаксного риска
Имея локальную упаковку, стандартным приёмом — гауссовским вариантом леммы Фано — получают нижнюю границу. Радиус шара при этом выбирается явно и зависит от размера выборки, выходного масштаба (B) и репрезентационных ограничений. В частном случае (A = B = R) и (\sigma \sim R) (с точностью до констант) минимаксный риск оказывается не меньше порядка (L^2 w^2 \log(w) R^2 / n).
Верхняя граница, полученная через псевдоразмерность конечной сети, даёт (\widetilde{O}(L^2 w^2 R^2 / n)) для неограниченных гауссовских откликов. Совпадение нижней и верхней границ с точностью до логарифмических множителей показывает, что квадратичная зависимость от глубины — точная. При уменьшении радиуса происходит переход к режиму, где ограничения представлений начинают доминировать.
Практические следствия
Что это значит на практике? Если мы регуляризуем сеть вариационной нормой, то увеличение глубины требует существенно большего объёма данных или более сильной регуляризации: сложность класса растёт как (L^2 w^2). Это объясняет, почему очень глубокие сети склонны к переобучению при фиксированном бюджете на веса.
Кроме того, результат показывает, что нельзя «обойти» ограничение, просто используя банахову норму вместо перекрёстной — квадратичная зависимость зашита в структуру ReLU-активаций и векторнозначных слоёв. Это важный ориентир для разработки новых архитектур и методов регуляризации.
В целом работа даёт точный ответ на давний вопрос о зазоре в оценках и подтверждает интуицию, что глубина — это не просто параметр, а самостоятельный фактор сложности, влияющий на все статистические гарантии.



