Qué es SEATauBench
SEATauBench es el primer sistema de evaluación orientado a agentes para la IA soberana en el Sudeste Asiático. Adapta Tau2-Bench a cinco idiomas: chino mandarín, vietnamita, tailandés, indonesio y filipino.

El benchmark está diseñado para evaluar agentes en contextos lingüísticos y temáticos de la región. Un criterio práctico para su uso es que los idiomas evaluados se correspondan con el público objetivo.
Qué condiciones cambian durante la evaluación
Los investigadores localizan progresivamente el contexto de trabajo del agente. Cambian tres elementos:
- el idioma de interacción entre el usuario y el agente;
- las especificaciones de las herramientas;
- los ámbitos temáticos de las tareas.
Este diseño permite comprobar no solo el cambio de idioma del diálogo. También abarca los cambios en las herramientas y la temática de las tareas.
Qué mostraron los resultados
En el estudio se evaluaron tres modelos. Los autores compararon cómo cambian las capacidades de los agentes con distintos niveles de localización.
| Condiciones de evaluación | Resultado |
|---|---|
| Solo cambia el idioma del diálogo | Las capacidades en inglés se transfieren bastante bien |
| Se localiza contexto adicional | La calidad y la robustez disminuyen drásticamente |
| Se adapta por completo el ámbito temático | Se observan las mayores pérdidas |
Los autores señalan que evaluar únicamente en inglés permite predecir de forma limitada las capacidades de los agentes en los idiomas del Sudeste Asiático. Por tanto, los resultados de las pruebas en inglés no sustituyen la evaluación en condiciones localizadas.
Para qué sirve el benchmark
SEATauBench se presenta como un benchmark de diagnóstico y un flujo de adaptación reutilizable. Está diseñado para crear agentes multilingües fiables.
Al elegir una evaluación, es importante tener en cuenta el alcance de la localización: el idioma del diálogo, las especificaciones de las herramientas y los ámbitos temáticos. Comprobar únicamente el cambio de idioma no refleja los resultados de una adaptación completa del contexto.
Publicación y versiones
El artículo se publicó en EMNLP Findings 2026. La versión v1 se envió el 27 de junio de 2026 y la última revisión, v2, se publicó el 5 de septiembre de 2026.
Identificador del artículo: arXiv:2606.28715.



