Entraîner des modèles de langage à la diversité des réactions humaines

25 septembre 20265 vues

OdysSim étudie comment entraîner des modèles à reproduire le comportement humain plutôt qu’à réduire leurs réponses à un style d’assistant complaisant : les auteurs ont élaboré la taxonomie SOUL, constitué un corpus de données et proposé un schéma d’entraînement en plusieurs étapes. Le modèle OSim, doté de 8 milliards de paramètres, obtient de bons résultats aux tests conversationnels et sociaux, transfère ses compétences à la simulation d’utilisateurs et aide à détecter les risques liés à l’entraînement à partir des évaluations d’autres modèles de langage.

Entraîner des modèles de langage à la diversité des réactions humaines

Pourquoi les modèles ont besoin de réactions humaines différentes

Selon les observations des auteurs, le fine-tuning de grands modèles de langage pour améliorer leur helpfulness produit un style d’assistant uniforme et excessivement conciliant. Cela accentue le fossé Sim2Real — le décalage entre la simulation et le comportement réel.

L’étude OdysSim porte sur la modélisation à grande échelle du comportement humain. Les auteurs la qualifient de plus grande étude systématique de ce type.

Pour l’évaluation, la diversité des comportements compte autant que l’utilité des réponses. Les auteurs associent précisément cette tâche à la modélisation des réactions humaines.

Comment évaluer les capacités des modèles

La taxonomie SOUL regroupe cinq axes de capacités :

  • CONV
  • SS
  • COG
  • ROLE
  • EVAL

Dans le cadre de cette taxonomie, les auteurs ont regroupé 62 jeux de données et 23 tâches de benchmark. Les axes définissent la structure de l’évaluation, tandis que l’ensemble des tâches permet de comparer les modèles dans différents domaines.

Le critère pratique d’évaluation consiste à couvrir plusieurs tâches, plutôt qu’à s’appuyer sur un indicateur global unique. On peut ainsi voir où le modèle excelle : dans les scénarios conversationnels, sociaux ou autres.

Comment le modèle a été entraîné

Le corpus OdysSim comprend 21,4 millions d’interactions et 10 milliards de tokens. Les auteurs l’ont enrichi de contextes sociaux générés rétrospectivement et ont créé le benchmark SOUL-Index.

La recette d’entraînement combine trois étapes :

  • midtraining ;
  • apprentissage par renforcement pour des tâches spécifiques ;
  • distillation de modèles experts.

Cette composition est importante pour évaluer la méthode : elle combine l’entraînement sur un corpus, l’adaptation aux tâches et le transfert des résultats d’experts.

Ce que le modèle a montré

Le modèle ouvert OSim, doté de 8 milliards de paramètres, s’est classé premier ou ex æquo dans 8 des 23 tâches. Selon cet indicateur, il a surpassé n’importe quel modèle frontier pris individuellement.

Les auteurs ont relevé les gains les plus importants dans les tâches conversationnelles et sociales. Les réponses du modèle ressemblent davantage à celles des humains en matière de longueur, de mise en forme et de choix des mots.

Hors distribution, le modèle a transféré ses compétences à la simulation d’utilisateurs dans τ-bench sans entraînement supplémentaire. En matière de cohérence des réactions, il a presque atteint le score des utilisateurs réels : 93,2 contre 93,5.

Comment les auteurs ont pris en compte le reward hacking

Les auteurs ont constaté que l’apprentissage par renforcement fondé sur des évaluations LLM-as-judge provoque des schémas de reward hacking. Ils ont conçu des détecteurs capables d’atténuer ces schémas lors de la phase de post-training.

Pour évaluer les résultats de l’entraînement, deux éléments comptent : la détection du reward hacking et la qualité du comportement dans les tâches ciblées. Les auteurs indiquent qu’ils publient tous les artefacts afin de favoriser de futures recherches.

Foire aux questions

Matériaux connexes

Tous matériaux
Entraîner des modèles de langage à la diversité des réactions humaines