Квадратичная зависимость от глубины: почему в глубоких ReLU-сетях с вариационной нормой локальная энтропия растёт быстрее

27 августа 20268 просмотров

Новый доказательный результат: для ReLU-архитектуры Parhi–Nowak deep-RBV² минимаксный риск гауссовской регрессии не может быть меньше порядка L²w²log(w)R²/n. Авторы строят локальную упаковку с логарифмической кардинальностью Ω(L² w² log w), которая показывает, что квадратичный вклад числа слоёв действительно неустраним.

Квадратичная зависимость от глубины: почему в глубоких ReLU-сетях с вариационной нормой локальная энтропия растёт быстрее

Введение

В глубоком обучении сложность модели можно контролировать разными способами. Один из них — вариационная норма: сумма норм весов по всем слоям. Она ограничивает «объём» семейства функций и позволяет получать оценки обобщения. Однако до сих пор оставался открытым вопрос, насколько точно эти оценки отражают реальную сложность сети.

В недавней работе (arxiv:2608.17434) показано, что для глубоких ReLU-сетей с вариационной нормой локальная энтропия — логарифм числа различимых функций в шаре — растёт квадратично от глубины. Это означает, что квадратичная зависимость риска от (L) не артефакт верхних оценок, а внутреннее свойство класса.

Постановка задачи и архитектура

Рассматривается гауссовская регрессия с неизвестной функцией из класса, заданного архитектурой Parhi–Nowak deep-RBV² (векторнозначная версия). Параметры — глубина (L) и ширина (w), всего (O(L w^2)) параметров. Бюджет вариации суммы по слоям (A), выходная граница (B). Для такой модели уже были известны нижняя и верхняя границы минимаксного риска, но они различались на множитель глубины. Новый результат закрывает этот зазор: квадратичная зависимость от (L) является точной.

Ключевая идея — построить локальную упаковку: набор функций, которые попарно далеки друг от друга, но лежат в небольшом шаре радиусом (O(\lambda)L^2). Логарифм мощности такой упаковки (локальная энтропия) составляет (\Omega(L^2 w^2 \log w)). Это означает, что при фиксированной норме число различимых функций растёт экспоненциально от (L^2 w^2 \log w), а не просто от (w^2).

Как строится упаковка

Чтобы получить такие функции, авторы используют два ингредиента:

  • Теорему аппроксимации со смещением: любую функцию из нужного класса можно приблизить сетью с ограниченными коэффициентами.
  • Сбалансированное усиление: умножение выхода ReLU-сети глубины (D) на число (q) реализуется с помощью одного постоянного канала, при этом каждый коэффициент растёт лишь как (q^{1/D}). Стоимость такого трюка — (O(D w^2 q^{1/D})) в терминах суммы норм.

Комбинируя эти приёмы, удаётся «вложить» множество функций в шар вариационной нормы, сохранив их попарную разделённость. Это и даёт нижнюю оценку на энтропию.

Нижняя граница минимаксного риска

Имея локальную упаковку, стандартным приёмом — гауссовским вариантом леммы Фано — получают нижнюю границу. Радиус шара при этом выбирается явно и зависит от размера выборки, выходного масштаба (B) и репрезентационных ограничений. В частном случае (A = B = R) и (\sigma \sim R) (с точностью до констант) минимаксный риск оказывается не меньше порядка (L^2 w^2 \log(w) R^2 / n).

Верхняя граница, полученная через псевдоразмерность конечной сети, даёт (\widetilde{O}(L^2 w^2 R^2 / n)) для неограниченных гауссовских откликов. Совпадение нижней и верхней границ с точностью до логарифмических множителей показывает, что квадратичная зависимость от глубины — точная. При уменьшении радиуса происходит переход к режиму, где ограничения представлений начинают доминировать.

Практические следствия

Что это значит на практике? Если мы регуляризуем сеть вариационной нормой, то увеличение глубины требует существенно большего объёма данных или более сильной регуляризации: сложность класса растёт как (L^2 w^2). Это объясняет, почему очень глубокие сети склонны к переобучению при фиксированном бюджете на веса.

Кроме того, результат показывает, что нельзя «обойти» ограничение, просто используя банахову норму вместо перекрёстной — квадратичная зависимость зашита в структуру ReLU-активаций и векторнозначных слоёв. Это важный ориентир для разработки новых архитектур и методов регуляризации.

В целом работа даёт точный ответ на давний вопрос о зазоре в оценках и подтверждает интуицию, что глубина — это не просто параметр, а самостоятельный фактор сложности, влияющий на все статистические гарантии.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Квадратичная зависимость от глубины в ReLU-сетях — обзор