Что представляет собой SEATauBench
SEATauBench — первая система оценки, ориентированная на агентов, для суверенного ИИ в Юго-Восточной Азии. Она адаптирует Tau2-Bench для пяти языков: китайского (мандаринского), вьетнамского, тайского, индонезийского и филиппинского.

Бенчмарк предназначен для оценки агентов в языковых и предметных контекстах региона. Практический критерий его применения — соответствие проверяемых языков целевой аудитории.
Какие условия меняются при оценке
Исследователи последовательно локализуют контекст работы агента. Они меняют три элемента:
- язык взаимодействия пользователя и агента;
- спецификации инструментов;
- предметные области задач.
Такой дизайн позволяет проверять не только смену языка диалога. Он также охватывает изменения инструментов и тематики задач.
Что показали результаты
В исследовании оценили три модели. Авторы сравнили, как меняются возможности агентов при разных уровнях локализации.
| Условия оценки | Результат |
|---|---|
| Меняется только язык диалога | Возможности на английском достаточно хорошо переносятся |
| Локализуется дополнительный контекст | Качество и устойчивость резко снижаются |
| Полностью адаптируется предметная область | Наблюдаются наибольшие потери |
Авторы отмечают, что оценка только на английском языке ограниченно предсказывает возможности агентов на языках Юго-Восточной Азии. Поэтому результаты английского тестирования не заменяют проверку в локализованных условиях.
Для чего нужен бенчмарк
SEATauBench представлен как диагностический бенчмарк и повторно используемый конвейер адаптации. Он предназначен для создания надёжных многоязычных агентов.
При выборе оценки важен охват локализации: язык диалога, спецификации инструментов и предметные области. Проверка только смены языка не отражает результаты полной адаптации контекста.
Публикация и версии
Статья опубликована в EMNLP Findings 2026. Версию v1 отправили 27 июня 2026 года, последнюю редакцию v2 выпустили 5 сентября 2026 года.
Идентификатор статьи: arXiv:2606.28715.



