Telco-GAIA: cómo probar un agente de IA con datos reales de un operador de telecomunicaciones

10 septiembre 20264 vistas

Un nuevo benchmark propone 100 escenarios de preguntas y respuestas en inglés y árabe, construidos en torno a datos reales del operador: sitio web, base SQL y archivo web. Las pruebas en 12 modelos mostraron que incluso el mejor resuelve solo el 71% de las tareas, y en categorías visuales el resultado cae por debajo del 30%.

Telco-GAIA: cómo probar un agente de IA con datos reales de un operador de telecomunicaciones

Los agentes de IA modernos se desenvuelven bastante bien en tareas ofimáticas típicas, pero ¿cómo comprobar si están listos para trabajar en un entorno corporativo complejo, por ejemplo, en el sector de las telecomunicaciones? Aquí no bastan las pruebas generales: se necesitan escenarios realistas con documentos auténticos, bases de datos y preguntas de usuarios poco habituales. Precisamente para eso se creó Telco-GAIA, un benchmark bilingüe y multimodal construido en torno a los datos de un operador de telecomunicaciones real. Permite evaluar hasta qué punto un agente de IA sabe razonar, utilizar herramientas y extraer información de distintas fuentes.

Por qué se necesita un benchmark así

La mayoría de las pruebas abiertas para agentes de IA parecen acertijos: o son demasiado sintéticas o no exigen un trabajo real con datos corporativos. Telco-GAIA cubre ese vacío. Sus preguntas están diseñadas para que el agente se enfrente a tareas conocidas por los empleados de los operadores de telecomunicaciones: encontrar información en un sitio web, cotejarla con los registros de una base de datos, precisar detalles en documentos de archivo. No se trata de poner a prueba la memoria del modelo, sino su capacidad para trabajar con varias fuentes y extraer conclusiones.

El benchmark es bilingüe: todas las tareas están formuladas en inglés y en árabe. Esta elección no es casual: refleja las necesidades reales de los operadores en una región donde el árabe es la lengua de trabajo, pero gran parte de la documentación interna sigue estando en inglés.

Qué contiene Telco-GAIA

El benchmark incluye 100 tareas de preguntas y respuestas, cada una de las cuales ha sido revisada por una persona. Es importante señalar que las tareas no requieren una respuesta de una sola palabra, sino una serie de pasos lógicos: una media de 4,2 pasos. Todas las preguntas se clasifican por tipo de modalidad: texto, tablas y gráficos. Esto significa que el modelo debe desenvolverse con la misma soltura tanto con un documento PDF como con una imagen o la estructura de una consulta SQL.

Para resolver una tarea, el agente debe recurrir a tres fuentes heterogéneas:

  • Una instantánea estática del sitio web del operador: páginas HTML, imágenes y archivos PDF relacionados.
  • Una base de datos relacional sintética: su estructura imita el sistema interno del operador, pero los datos son seguros para su publicación.
  • Archivos web externos: materiales adicionales que pueden ser necesarios para verificar datos o precisar el contexto.

Cómo funciona la evaluación

Uno de los principios fundamentales de Telco-GAIA es la objetividad. Los autores han descartado los modernos jueces basados en LLM, en los que un modelo evalúa las respuestas de otro. En su lugar, se utiliza una comparación normalizada y exacta de cadenas de texto, y todo el benchmark está empaquetado en un entorno Docker aislado. Esto significa que el resultado no depende de una máquina concreta ni de la versión de las librerías: se ejecuta el contenedor y se obtienen las mismas cifras. Este enfoque hace que la evaluación sea determinista y reproducible, algo fundamental para la investigación y para comparar distintos modelos.

Qué mostraron las pruebas

Los desarrolladores probaron en el benchmark a un agente de referencia con doce modelos distintos, tanto comerciales como de código abierto. Los resultados fueron discretos: incluso el modelo más potente solo completó el 71% de las tareas. Si se reduce el presupuesto para llamadas a herramientas a un nivel moderado, el resultado cae hasta aproximadamente el 40%. En otras palabras, el agente empieza a tomar «atajos» de forma notable: no da pasos adicionales, no comprueba detalles y se equivoca con más frecuencia en casos atípicos.

Los modelos rinden especialmente mal en las categorías en las que hay que utilizar información visual: imágenes y gráficos. El resultado medio allí es inferior al 30%. Esto demuestra que la comprensión de documentos con imágenes sigue siendo un importante punto de mejora para los agentes de IA. En general, Telco-GAIA constata una brecha significativa entre las expectativas depositadas en un agente corporativo y las capacidades reales de los LLM actuales.

Conclusiones

Telco-GAIA no es solo otro benchmark para la investigación. Es una herramienta práctica para las empresas que construyen sus propios agentes de IA y quieren conocer sus limitaciones de antemano. Gracias a su entorno reproducible y a sus tareas validadas, puede utilizarse como estándar interno de calidad.

Además, el enfoque subyacente de Telco-GAIA se adapta fácilmente a otros dominios cerrados, desde la banca hasta la logística. El formato ofrece una plantilla lista para usar: tomar datos reales, anonimizarlos cuidadosamente, dividirlos en fuentes independientes y crear un entorno en el que el agente deba demostrar sus habilidades de razonamiento. Ese es precisamente el cambio que el mercado necesita: pasar de las pruebas generales de erudición a la verificación de competencias prácticas con datos corporativos verosímiles.

Preguntas frecuentes

Telco-GAIA: cómo probar un agente de IA con datos reales de un operador de telecomunicaciones