SEATauBench: испытание ИИ-агентов на пяти языках Юго-Восточной Азии

25 сентября 202615 просмотров

Авторы проверяют три модели, последовательно меняя язык диалога, устройство инструментов и предметную область задач. Результаты показывают: перенос с английского сохраняется при смене языка общения, но заметно ухудшается при локализации инструментов и контекста, поэтому английские тесты слабо отражают работу агентов в регионе.

SEATauBench: испытание ИИ-агентов на пяти языках Юго-Восточной Азии

Что представляет собой SEATauBench

SEATauBench — первая система оценки, ориентированная на агентов, для суверенного ИИ в Юго-Восточной Азии. Она адаптирует Tau2-Bench для пяти языков: китайского (мандаринского), вьетнамского, тайского, индонезийского и филиппинского.

Бенчмарк предназначен для оценки агентов в языковых и предметных контекстах региона. Практический критерий его применения — соответствие проверяемых языков целевой аудитории.

Какие условия меняются при оценке

Исследователи последовательно локализуют контекст работы агента. Они меняют три элемента:

  • язык взаимодействия пользователя и агента;
  • спецификации инструментов;
  • предметные области задач.

Такой дизайн позволяет проверять не только смену языка диалога. Он также охватывает изменения инструментов и тематики задач.

Что показали результаты

В исследовании оценили три модели. Авторы сравнили, как меняются возможности агентов при разных уровнях локализации.

Условия оценкиРезультат
Меняется только язык диалогаВозможности на английском достаточно хорошо переносятся
Локализуется дополнительный контекстКачество и устойчивость резко снижаются
Полностью адаптируется предметная областьНаблюдаются наибольшие потери

Авторы отмечают, что оценка только на английском языке ограниченно предсказывает возможности агентов на языках Юго-Восточной Азии. Поэтому результаты английского тестирования не заменяют проверку в локализованных условиях.

Для чего нужен бенчмарк

SEATauBench представлен как диагностический бенчмарк и повторно используемый конвейер адаптации. Он предназначен для создания надёжных многоязычных агентов.

При выборе оценки важен охват локализации: язык диалога, спецификации инструментов и предметные области. Проверка только смены языка не отражает результаты полной адаптации контекста.

Публикация и версии

Статья опубликована в EMNLP Findings 2026. Версию v1 отправили 27 июня 2026 года, последнюю редакцию v2 выпустили 5 сентября 2026 года.

Идентификатор статьи: arXiv:2606.28715.

Часто задаваемые вопросы

Похожие материалы

Все материалы
SEATauBench: оценка ИИ-агентов в Юго-Восточной Азии