SEATauBench : évaluation des agents d’IA dans cinq langues d’Asie du Sud-Est

25 septembre 202615 vues

Les auteurs évaluent trois modèles en faisant varier successivement la langue du dialogue, la configuration des outils et le domaine des tâches. Les résultats montrent que le transfert depuis l’anglais se maintient lorsque la langue de communication change, mais se dégrade nettement lorsque les outils et le contexte sont localisés ; les tests en anglais reflètent donc mal les performances des agents dans la région.

SEATauBench : évaluation des agents d’IA dans cinq langues d’Asie du Sud-Est

Ce qu’est SEATauBench

SEATauBench est le premier système d’évaluation axé sur les agents pour l’IA souveraine en Asie du Sud-Est. Il adapte Tau2-Bench à cinq langues : le chinois (mandarin), le vietnamien, le thaï, l’indonésien et le philippin.

Ce benchmark est conçu pour évaluer les agents dans les contextes linguistiques et thématiques de la région. Le critère pratique pour déterminer s’il convient est la correspondance entre les langues évaluées et le public cible.

Quelles conditions changent lors de l’évaluation

Les chercheurs localisent progressivement le contexte de travail de l’agent. Ils modifient trois éléments :

  • la langue d’interaction entre l’utilisateur et l’agent ;
  • les spécifications des outils ;
  • les domaines thématiques des tâches.

Cette conception permet de tester non seulement le changement de langue du dialogue. Elle couvre également les changements d’outils et de thèmes des tâches.

Ce que montrent les résultats

L’étude a évalué trois modèles. Les auteurs ont comparé l’évolution des capacités des agents selon différents niveaux de localisation.

Conditions d’évaluationRésultat
Seule la langue du dialogue changeLes capacités en anglais sont assez bien transférées
Un contexte supplémentaire est localiséLa qualité et la robustesse diminuent fortement
Le domaine thématique est entièrement adaptéLes pertes les plus importantes sont observées

Les auteurs soulignent qu’une évaluation menée uniquement en anglais ne prédit que dans une mesure limitée les capacités des agents dans les langues d’Asie du Sud-Est. Les résultats des tests en anglais ne remplacent donc pas une évaluation dans des conditions localisées.

À quoi sert le benchmark

SEATauBench est présenté comme un benchmark diagnostique et un pipeline d’adaptation réutilisable. Il est conçu pour créer des agents multilingues fiables.

Lors du choix d’une évaluation, l’étendue de la localisation est importante : langue du dialogue, spécifications des outils et domaines thématiques. Tester uniquement le changement de langue ne reflète pas les résultats d’une adaptation complète du contexte.

Publication et versions

L’article a été publié dans EMNLP Findings 2026. La version v1 a été soumise le 27 juin 2026, et la dernière révision, v2, a été publiée le 5 septembre 2026.

Identifiant de l’article : arXiv:2606.28715.

Foire aux questions

Matériaux connexes

Tous matériaux
SEATauBench : évaluation des agents d’IA dans cinq langues d’Asie du Sud-Est