La dynamique des résidus au sein des blocs comme signal de routage dans les transformeurs profonds

25 septembre 202612 vues

La méthode HAARES complète le signal final du bloc en évaluant les différences entre les variations du flux résiduel dans ses deux parties, tout en tenant compte d’une partie de la dynamique interne sans router chaque sous-couche. Les expériences montrent les gains les plus stables dans les modèles à 48 couches ; la charge de calcul est faible, mais les coûts en mémoire et en routage augmentent.

La dynamique des résidus au sein des blocs comme signal de routage dans les transformeurs profonds

Pourquoi un résumé au niveau des blocs peut ne pas suffire

Le routage résiduel au niveau des blocs rend pratique l’agrégation apprenable des connexions résiduelles : le routeur s’appuie sur des résumés de blocs. Chaque résumé compresse une séquence ordonnée de mises à jour de l’attention et du MLP en un seul vecteur cumulatif.

  • Le résumé conserve la contribution totale du bloc.
  • Il ne décrit pas la trajectoire des mises à jour à l’intérieur du bloc.

Critère pratique : si un signal grossier sur l’évolution du flux résiduel à l’intérieur du bloc est important, un seul résumé cumulatif peut ne pas suffire.

Comment HAARES ajoute un signal intrabloc

HAARES est un routeur de base résiduelle proposé dans les travaux de Kehan Wang, arXiv:2606.06564. Il conserve la source cumulative du bloc et ajoute une base de détails obtenue par division en deux.

  • La base de détails est calculée comme la différence entre les mises à jour du flux résiduel dans la première et la seconde moitié du bloc.
  • La base est ajustée selon la RMS et mise à jour en ligne.
  • Le routeur reçoit des informations grossières sur la trajectoire intrabloc, sans routage dense au niveau des sous-couches.

Critère pratique : HAARES combine une source cumulative avec un signal de détail supplémentaire, au lieu de router chaque sous-couche séparément.

Où l’effet s’est manifesté dans les expériences

Les expériences portaient sur OpenWebText, des benchmarks de prédiction de caractères interdomaines et OpenWebText avec une tokenisation BPE. Le résultat dépendait de la profondeur du modèle.

ConditionObservation
Faible profondeurGain faible ou ambigu
Modèles à 48 couchesEffet le plus stable
Configuration 201M à 48 couchesHAARES surpasse Block AttnRes avec les trois seeds
Test sur 453M avec deux seedsLe résultat va dans le même sens

Les ablations montrent que l’effet ne s’explique pas par la duplication des sources, des détails de signe aléatoires ou des décalages fixes des sources de détails. Il ne peut pas non plus s’expliquer uniquement par une modification du nombre de blocs.

Critère pratique : les résultats étayent plus solidement la méthode pour les modèles à 48 couches que pour les modèles de faible profondeur.

Quels coûts prendre en compte

L’analyse des coûts fait état d’un faible surcoût en FLOPs, mais pas d’un coût nul en temps. La méthode ajoute des coûts de mémoire et de routage.

  • Le coût arithmétique relatif est amorti à mesure que la largeur du modèle augmente.
  • Une convergence plus précoce peut réduire le temps nécessaire pour atteindre le résultat cible.

Critère pratique : il convient d’évaluer HAARES en tenant compte non seulement des FLOPs, mais aussi de la mémoire, du routage et du temps de convergence.

Foire aux questions

Matériaux connexes

Tous matériaux
La dynamique des résidus au sein des blocs comme signal de routage dans les transformeurs profonds