SEATauBench: teste de agentes de IA em cinco idiomas do Sudeste Asiático

25 setembro 202615 visualizações

Os autores testam três modelos, alterando sucessivamente o idioma do diálogo, a configuração das ferramentas e o domínio das tarefas. Os resultados mostram que a transferência do inglês se mantém quando muda o idioma de comunicação, mas piora significativamente com a localização das ferramentas e do contexto; por isso, os testes em inglês refletem pouco o desempenho dos agentes na região.

SEATauBench: teste de agentes de IA em cinco idiomas do Sudeste Asiático

O que é o SEATauBench

O SEATauBench é o primeiro sistema de avaliação orientado para agentes de IA soberana no Sudeste Asiático. Adapta o Tau2-Bench a cinco idiomas: chinês (mandarim), vietnamita, tailandês, indonésio e filipino.

O benchmark foi concebido para avaliar agentes em contextos linguísticos e temáticos da região. Um critério prático para a sua utilização é a correspondência entre os idiomas avaliados e o público-alvo.

Que condições mudam durante a avaliação

Os investigadores localizam sistematicamente o contexto de funcionamento do agente. Alteram três elementos:

  • o idioma de interação entre o utilizador e o agente;
  • as especificações das ferramentas;
  • os domínios temáticos das tarefas.

Este desenho permite testar não só a mudança do idioma do diálogo. Abrange também alterações às ferramentas e aos temas das tarefas.

O que revelaram os resultados

O estudo avaliou três modelos. Os autores compararam como as capacidades dos agentes mudam com diferentes níveis de localização.

Condições de avaliaçãoResultado
Muda apenas o idioma do diálogoAs capacidades em inglês são transferidas razoavelmente bem
É localizado contexto adicionalA qualidade e a robustez diminuem acentuadamente
O domínio temático é totalmente adaptadoObservam-se as maiores perdas

Os autores salientam que a avaliação apenas em inglês permite prever de forma limitada as capacidades dos agentes nos idiomas do Sudeste Asiático. Por isso, os resultados dos testes em inglês não substituem a avaliação em condições localizadas.

Para que serve o benchmark

O SEATauBench é apresentado como um benchmark de diagnóstico e um pipeline de adaptação reutilizável. Destina-se à criação de agentes multilingues fiáveis.

Ao escolher uma avaliação, é importante considerar a abrangência da localização: o idioma do diálogo, as especificações das ferramentas e os domínios temáticos. Testar apenas a mudança de idioma não reflete os resultados de uma adaptação completa do contexto.

Publicação e versões

O artigo foi publicado no EMNLP Findings 2026. A versão v1 foi submetida em 27 de junho de 2026, e a última revisão, v2, foi lançada em 5 de setembro de 2026.

Identificador do artigo: arXiv:2606.28715.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
SEATauBench: teste de agentes de IA em cinco idiomas do Sudeste Asiático