ER-KAN 抗噪声:数据稀缺下 Kolmogorov–Arnold 网络变体的鲁棒性

21 九月 20269 视图

在噪声和小样本条件下对高效KAN架构的比较表明,当σ=0.1时,ChebyKAN在纯参考基准上的误差增大了10.6倍,而所提出的ER-KAN仅增大了1.4倍。共享高斯RBF基、训练中逐步引入噪声以及熵加权正则化共同保障了鲁棒性;该工作还引入了噪声退化比这一指标,并在阻尼振子的PINN上展示了相对于MLP将MSE降低4.2倍,同时如实报告了在Burgers方程上的失败。

ER-KAN 抗噪声:数据稀缺下 Kolmogorov–Arnold 网络变体的鲁棒性

为什么干净数据掩盖了 KAN 变体之间的差异

关于柯尔莫哥洛夫–阿诺德网络高效变体的文献涵盖了 Chebyshev、小波和径向基函数版本的原始 KAN。这些工作中的基准测试都建立在干净数据之上。这种选择掩盖了架构能力上的巨大差异。

论文 arXiv:2608.14773 将这一差异凸显出来。第一版于 2026 年 8 月 14 日发布,第二版于 2026 年 8 月 25 日发布。篇幅为 22 页、20 张图和 8 张表。主题为机器学习和人工智能。

实用标准:仅在干净数据上比较 KAN 变体无法为选择提供依据。评估需要采用带噪声数据的协议。

噪声下误差会增长多少

指标为测试 MSE,针对干净的参考函数进行测量。训练在受 sigma = 0.1 噪声污染的数据上进行。增长指标描述误差相对于干净情况增长了多少倍。

架构变体sigma = 0.1 时测试 MSE 的增长
ChebyKAN10.6x
原始 KAN7.9x
标准 MLP1.7x
ER-KAN1.4x

结论:在已验证的变体中,ER-KAN 的误差增长最小。标准 MLP 的表现也明显优于 ChebyKAN 和原始 KAN。

赋予 ER-KAN 稳健性的三个设计

ER-KAN 由三种针对数据稀缺下噪声模式的技术组成。

  • 层内所有边共享的高斯 RBF 基。提供局部性和经济的参数化。
  • 训练期间的课程噪声注入。模型显式地学习对噪声的稳健性。
  • 熵加权自适应正则化。在样本数量较少时防止过拟合。

结果:一个 595 参数的网络在中等噪声下精度与 MLP 相当。当噪声增大时,它的退化要平缓得多。

验证协议及其负面结果

实验建立在多组条件之上。

  • 八个解析函数,样本数量 N 取自 50、200 和 500。
  • 噪声水平 sigma 取自 0.03 和 0.1。
  • 阻尼谐振子的 PINN:ER-KAN 的 solution MSE 比 MLP 小 4.2 倍。
  • 伯格斯方程的 PINN:所有模型均不收敛。

作者公开报告了在伯格斯方程上的失败。这是方法的局限,而非报告中隐藏的缺陷。关于谐振子的结论不能自动推广到其他方程。

Noise degradation ratio 作为独立指标

作者引入了 noise degradation ratio——对现有度量的一个简单补充。该指标显示噪声数据上的误差是干净数据上误差的多少倍。作者建议将其作为关于 KAN 高效变体论文中报告的必要组成部分。

该指标的实用价值在于按稳健性而非仅按精度比较架构。对于基准测试一直建立在干净数据之上的文献而言,这改变了评估标准。

实用选择标准

  • 带噪声数据和少量样本。 在已验证的变体中,ER-KAN 的误差增长最小。
  • 中等噪声。 一个 595 参数的网络精度与 MLP 相当。
  • 需要一个简单的对比基线。 标准 MLP 的退化比 ChebyKAN 和原始 KAN 更弱。
  • 阻尼谐振子的 PINN。 ER-KAN 的 solution MSE 比 MLP 更小。
  • 伯格斯方程的 PINN。 已验证的模型中没有一个是收敛的。

选择应依据噪声水平和样本量,而非干净数据上的结果。对于存在噪声的任务,缺少 noise degradation ratio 的报告是不完整的。

常问问题

ER-KAN 抗噪声:数据稀缺下 Kolmogorov–Arnold 网络变体的鲁棒性