为什么干净数据掩盖了 KAN 变体之间的差异
关于柯尔莫哥洛夫–阿诺德网络高效变体的文献涵盖了 Chebyshev、小波和径向基函数版本的原始 KAN。这些工作中的基准测试都建立在干净数据之上。这种选择掩盖了架构能力上的巨大差异。
论文 arXiv:2608.14773 将这一差异凸显出来。第一版于 2026 年 8 月 14 日发布,第二版于 2026 年 8 月 25 日发布。篇幅为 22 页、20 张图和 8 张表。主题为机器学习和人工智能。

实用标准:仅在干净数据上比较 KAN 变体无法为选择提供依据。评估需要采用带噪声数据的协议。
噪声下误差会增长多少
指标为测试 MSE,针对干净的参考函数进行测量。训练在受 sigma = 0.1 噪声污染的数据上进行。增长指标描述误差相对于干净情况增长了多少倍。
| 架构变体 | sigma = 0.1 时测试 MSE 的增长 |
|---|---|
| ChebyKAN | 10.6x |
| 原始 KAN | 7.9x |
| 标准 MLP | 1.7x |
| ER-KAN | 1.4x |
结论:在已验证的变体中,ER-KAN 的误差增长最小。标准 MLP 的表现也明显优于 ChebyKAN 和原始 KAN。
赋予 ER-KAN 稳健性的三个设计
ER-KAN 由三种针对数据稀缺下噪声模式的技术组成。
- 层内所有边共享的高斯 RBF 基。提供局部性和经济的参数化。
- 训练期间的课程噪声注入。模型显式地学习对噪声的稳健性。
- 熵加权自适应正则化。在样本数量较少时防止过拟合。

结果:一个 595 参数的网络在中等噪声下精度与 MLP 相当。当噪声增大时,它的退化要平缓得多。
验证协议及其负面结果
实验建立在多组条件之上。
- 八个解析函数,样本数量 N 取自 50、200 和 500。
- 噪声水平 sigma 取自 0.03 和 0.1。
- 阻尼谐振子的 PINN:ER-KAN 的 solution MSE 比 MLP 小 4.2 倍。
- 伯格斯方程的 PINN:所有模型均不收敛。

作者公开报告了在伯格斯方程上的失败。这是方法的局限,而非报告中隐藏的缺陷。关于谐振子的结论不能自动推广到其他方程。
Noise degradation ratio 作为独立指标
作者引入了 noise degradation ratio——对现有度量的一个简单补充。该指标显示噪声数据上的误差是干净数据上误差的多少倍。作者建议将其作为关于 KAN 高效变体论文中报告的必要组成部分。
该指标的实用价值在于按稳健性而非仅按精度比较架构。对于基准测试一直建立在干净数据之上的文献而言,这改变了评估标准。
实用选择标准
- 带噪声数据和少量样本。 在已验证的变体中,ER-KAN 的误差增长最小。
- 中等噪声。 一个 595 参数的网络精度与 MLP 相当。
- 需要一个简单的对比基线。 标准 MLP 的退化比 ChebyKAN 和原始 KAN 更弱。
- 阻尼谐振子的 PINN。 ER-KAN 的 solution MSE 比 MLP 更小。
- 伯格斯方程的 PINN。 已验证的模型中没有一个是收敛的。
选择应依据噪声水平和样本量,而非干净数据上的结果。对于存在噪声的任务,缺少 noise degradation ratio 的报告是不完整的。



