SEATauBench: evaluación de agentes de IA en cinco idiomas del Sudeste Asiático

25 septiembre 202615 vistas

Los autores evalúan tres modelos cambiando sucesivamente el idioma del diálogo, la configuración de las herramientas y el ámbito de las tareas. Los resultados muestran que la transferencia desde el inglés se mantiene al cambiar el idioma de comunicación, pero empeora notablemente al localizar las herramientas y el contexto, por lo que las pruebas en inglés reflejan poco el rendimiento de los agentes en la región.

SEATauBench: evaluación de agentes de IA en cinco idiomas del Sudeste Asiático

Qué es SEATauBench

SEATauBench es el primer sistema de evaluación orientado a agentes para la IA soberana en el Sudeste Asiático. Adapta Tau2-Bench a cinco idiomas: chino mandarín, vietnamita, tailandés, indonesio y filipino.

El benchmark está diseñado para evaluar agentes en contextos lingüísticos y temáticos de la región. Un criterio práctico para su uso es que los idiomas evaluados se correspondan con el público objetivo.

Qué condiciones cambian durante la evaluación

Los investigadores localizan progresivamente el contexto de trabajo del agente. Cambian tres elementos:

  • el idioma de interacción entre el usuario y el agente;
  • las especificaciones de las herramientas;
  • los ámbitos temáticos de las tareas.

Este diseño permite comprobar no solo el cambio de idioma del diálogo. También abarca los cambios en las herramientas y la temática de las tareas.

Qué mostraron los resultados

En el estudio se evaluaron tres modelos. Los autores compararon cómo cambian las capacidades de los agentes con distintos niveles de localización.

Condiciones de evaluaciónResultado
Solo cambia el idioma del diálogoLas capacidades en inglés se transfieren bastante bien
Se localiza contexto adicionalLa calidad y la robustez disminuyen drásticamente
Se adapta por completo el ámbito temáticoSe observan las mayores pérdidas

Los autores señalan que evaluar únicamente en inglés permite predecir de forma limitada las capacidades de los agentes en los idiomas del Sudeste Asiático. Por tanto, los resultados de las pruebas en inglés no sustituyen la evaluación en condiciones localizadas.

Para qué sirve el benchmark

SEATauBench se presenta como un benchmark de diagnóstico y un flujo de adaptación reutilizable. Está diseñado para crear agentes multilingües fiables.

Al elegir una evaluación, es importante tener en cuenta el alcance de la localización: el idioma del diálogo, las especificaciones de las herramientas y los ámbitos temáticos. Comprobar únicamente el cambio de idioma no refleja los resultados de una adaptación completa del contexto.

Publicación y versiones

El artículo se publicó en EMNLP Findings 2026. La versión v1 se envió el 27 de junio de 2026 y la última revisión, v2, se publicó el 5 de septiembre de 2026.

Identificador del artículo: arXiv:2606.28715.

Preguntas frecuentes

Material similar

Todos los materiales
SEATauBench: evaluación de agentes de IA en cinco idiomas del Sudeste Asiático