深层 Transformer 中块内残差动态作为路由信号

25 九月 202612 视图

HAARES 方法通过评估区块两部分中残差流变化的差异,为区块的最终信号提供补充,同时纳入部分内部动态,而无需对每个子层进行路由。实验表明,48 层模型的性能提升最为稳定;计算开销较小,但内存和路由成本有所增加。

深层 Transformer 中块内残差动态作为路由信号

为什么仅有块级摘要可能不够

块级残差路由让可训练的残差连接聚合变得切实可行:路由器依赖块级摘要。每个摘要都会将注意力和 MLP 更新的有序序列压缩为一个累积向量。

  • 摘要保留了整个块的累积贡献。
  • 它无法描述块内更新的演变轨迹。

实用判断标准:如果需要块内残差流变化的粗略信号,仅靠一个累积摘要可能不够。

HAARES 如何加入块内信号

HAARES 是 Kehan Wang 在论文 arXiv:2606.06564 中提出的残差基路由器。它保留块的累积来源,并添加一个通过二分拆分得到的细节基。

  • 细节基通过计算块前半部分与后半部分的残差流更新之差得出。
  • 该基会进行 RMS 对齐,并在线更新。
  • 路由器可以获得块内轨迹的粗略信息,而无需进行密集的子层级路由。

实用判断标准:HAARES 将累积来源与一个额外的细节信号结合起来,而不是分别路由每个子层。

实验中效果的体现

实验涵盖 OpenWebText、跨领域字符级基准测试,以及采用 BPE 分词的 OpenWebText。结果取决于模型深度。

条件观察结果
深度较小增益较小或不明确
48 层模型效果最稳定
48 层的 201M 配置HAARES 在三个随机种子下均优于 Block AttnRes
使用两个随机种子的 453M 试验结果显示出相同趋势

消融实验表明,这种效果并非源于来源重复、随机符号细节或细节来源的固定偏置,也不能仅用块数变化来解释。

实用判断标准:与浅层模型相比,结果为 HAARES 在 48 层模型中的应用提供了更有力的依据。

需要考虑哪些成本

成本分析指出,额外 FLOPs 较低,但耗时成本并非为零。该方法会增加内存和路由开销。

  • 随着模型宽度增加,相对计算成本会被摊薄。
  • 更早收敛可能会缩短达到目标结果所需的时间。

实用判断标准:评估 HAARES 时,不应只考虑 FLOPs,还应考虑内存、路由和收敛时间。

常问问题

深层 Transformer 中块内残差动态作为路由信号