O que é o SEATauBench
O SEATauBench é o primeiro sistema de avaliação orientado para agentes de IA soberana no Sudeste Asiático. Adapta o Tau2-Bench a cinco idiomas: chinês (mandarim), vietnamita, tailandês, indonésio e filipino.

O benchmark foi concebido para avaliar agentes em contextos linguísticos e temáticos da região. Um critério prático para a sua utilização é a correspondência entre os idiomas avaliados e o público-alvo.
Que condições mudam durante a avaliação
Os investigadores localizam sistematicamente o contexto de funcionamento do agente. Alteram três elementos:
- o idioma de interação entre o utilizador e o agente;
- as especificações das ferramentas;
- os domínios temáticos das tarefas.
Este desenho permite testar não só a mudança do idioma do diálogo. Abrange também alterações às ferramentas e aos temas das tarefas.
O que revelaram os resultados
O estudo avaliou três modelos. Os autores compararam como as capacidades dos agentes mudam com diferentes níveis de localização.
| Condições de avaliação | Resultado |
|---|---|
| Muda apenas o idioma do diálogo | As capacidades em inglês são transferidas razoavelmente bem |
| É localizado contexto adicional | A qualidade e a robustez diminuem acentuadamente |
| O domínio temático é totalmente adaptado | Observam-se as maiores perdas |
Os autores salientam que a avaliação apenas em inglês permite prever de forma limitada as capacidades dos agentes nos idiomas do Sudeste Asiático. Por isso, os resultados dos testes em inglês não substituem a avaliação em condições localizadas.
Para que serve o benchmark
O SEATauBench é apresentado como um benchmark de diagnóstico e um pipeline de adaptação reutilizável. Destina-se à criação de agentes multilingues fiáveis.
Ao escolher uma avaliação, é importante considerar a abrangência da localização: o idioma do diálogo, as especificações das ferramentas e os domínios temáticos. Testar apenas a mudança de idioma não reflete os resultados de uma adaptação completa do contexto.
Publicação e versões
O artigo foi publicado no EMNLP Findings 2026. A versão v1 foi submetida em 27 de junho de 2026, e a última revisão, v2, foi lançada em 5 de setembro de 2026.
Identificador do artigo: arXiv:2606.28715.



