Les agents IA modernes s'en sortent plutôt bien avec les tâches de bureau typiques, mais comment vérifier s'ils sont prêts à travailler dans un environnement d'entreprise complexe — par exemple, dans les télécommunications ? Ici, les tests génériques ne suffisent pas : il faut des scénarios réalistes avec de vrais documents, des bases de données et des questions d'utilisateurs atypiques. C'est précisément dans ce but qu'a été créé Telco-GAIA — un benchmark multimodal bilingue construit autour des données d'un véritable opérateur de télécommunications. Il permet d'évaluer dans quelle mesure un agent IA sait raisonner, utiliser des outils et extraire des informations de différentes sources.
Pourquoi un tel benchmark est nécessaire
La plupart des tests ouverts pour les agents IA ressemblent à des énigmes : ils sont soit trop synthétiques, soit ne nécessitent pas un véritable travail avec des données d'entreprise. Telco-GAIA comble cette lacune. Ses questions sont conçues pour que l'agent soit confronté à des tâches familières aux employés des opérateurs de télécommunications : trouver des informations sur un site web, les recouper avec des enregistrements dans une base de données, vérifier des détails dans des documents d'archives. Il ne s'agit pas de tester la mémoire du modèle, mais sa capacité à travailler avec plusieurs sources et à tirer des conclusions.
Le benchmark est bilingue : toutes les tâches sont formulées en anglais et en arabe. Ce choix n'est pas anodin — il reflète les besoins réels des opérateurs dans une région où l'arabe est la langue de travail, mais où une grande partie de la documentation interne reste en anglais.
Ce que contient Telco-GAIA
Le benchmark comprend 100 tâches de questions-réponses, chacune ayant été vérifiée par un humain. Il est important de noter que les tâches ne nécessitent pas une réponse en un mot, mais une série d'étapes logiques — 4,2 étapes en moyenne. Toutes les questions sont réparties par type de modalité : texte, tableaux et graphiques. Cela signifie que le modèle doit travailler aussi bien avec un document PDF qu'avec une image ou la structure d'une requête SQL.

Pour résoudre une tâche, l'agent doit consulter trois sources hétérogènes :
- Un instantané statique du site web de l'opérateur — pages HTML, images et fichiers PDF associés.
- Une base de données relationnelle synthétique — sa structure imite le système interne de l'opérateur, mais les données qu'elle contient peuvent être publiées en toute sécurité.
- Des archives web externes — des documents supplémentaires qui peuvent être nécessaires pour vérifier des faits ou clarifier le contexte.
Comment fonctionne l'évaluation
L'un des principes fondamentaux de Telco-GAIA est l'objectivité. Les auteurs ont renoncé aux juges LLM à la mode, où un modèle évalue les réponses d'un autre. À la place, une comparaison normalisée et exacte des chaînes de caractères est utilisée, et l'ensemble du benchmark est emballé dans un environnement Docker isolé. Cela signifie que le résultat ne dépend pas d'une machine spécifique ou d'une version particulière des bibliothèques : lancez le conteneur — obtenez les mêmes chiffres. Cette approche rend l'évaluation déterministe et reproductible, ce qui est essentiel pour la recherche et la comparaison de différents modèles.

Ce que les tests ont montré
Les développeurs ont fait passer à travers le benchmark un agent de référence avec douze modèles différents — à la fois commerciaux et open source. Les résultats se sont avérés modestes : même le modèle le plus performant n'a réussi que 71 % des tâches. Si le budget d'appels d'outils est réduit à un niveau modéré, le résultat chute à environ 40 %. En d'autres termes, l'agent commence à « couper les coins ronds » de manière notable : il ne fait pas de démarches supplémentaires, ne vérifie pas les détails et commet plus souvent des erreurs dans les cas non standard.
Les modèles sont particulièrement faibles dans les catégories où il faut utiliser des informations visuelles — images et graphiques. Le résultat moyen y est inférieur à 30 %. Cela montre que la compréhension de documents contenant des images reste un point de croissance majeur pour les agents IA. Dans l'ensemble, Telco-GAIA met en évidence un écart significatif entre les attentes placées dans un agent d'entreprise et les capacités réelles des LLM modernes.
Conclusions
Telco-GAIA n'est pas simplement un benchmark de plus pour la recherche. C'est un outil pratique pour les entreprises qui construisent leurs propres agents IA et souhaitent comprendre leurs limites à l'avance. Grâce à son environnement reproductible et à ses tâches validées, il peut être utilisé comme un standard de qualité interne.
De plus, l'approche intégrée dans Telco-GAIA peut être facilement adaptée à d'autres domaines fermés — des banques à la logistique. Le format fournit un modèle prêt à l'emploi : prendre des données réelles, les anonymiser soigneusement, les répartir en sources indépendantes et construire un environnement dans lequel l'agent doit démontrer ses compétences de raisonnement. C'est précisément le changement dont le marché a besoin : passer de tests génériques d'érudition à la vérification de compétences pratiques sur des données d'entreprise plausibles.



