Современные ИИ-агенты неплохо справляются с типовыми офисными задачами, но как проверить, готовы ли они работать в сложной корпоративной среде — например, в телекоме? Здесь мало общих тестов: нужны реалистичные сценарии с настоящими документами, базами данных и нетипичными пользовательскими вопросами. Именно для этого создан Telco-GAIA — двуязычный мультимодальный бенчмарк, построенный вокруг данных реального оператора связи. Он позволяет оценить, насколько хорошо ИИ-агент умеет рассуждать, пользоваться инструментами и извлекать информацию из разных источников.
Зачем нужен такой бенчмарк
Большинство открытых тестов для ИИ-агентов напоминают головоломки: они либо слишком синтетические, либо не требуют настоящей работы с корпоративными данными. Telco-GAIA закрывает этот пробел. Его вопросы собраны так, чтобы агент сталкивался с задачами, знакомыми сотрудникам телеком-операторов: найти информацию на сайте, сопоставить её с записями в базе данных, уточнить детали в архивных документах. Это не проверка памяти модели, а проверка способности работать с несколькими источниками и делать выводы.
Бенчмарк двуязычный: все задания сформулированы на английском и арабском языках. Такой выбор не случаен — он отражает реальные потребности операторов в регионе, где арабский язык является рабочим, но значительная часть внутренней документации остаётся на английском.
Что внутри Telco-GAIA
Бенчмарк включает 100 вопросно-ответных задач, каждую из которых проверил человек. Важно, что задачи требуют не односложного ответа, а серии логических шагов — в среднем 4,2 шага. Все вопросы разбиты по типам модальностей: текст, таблицы и графика. Это значит, что модель должна одинаково уверенно работать как с PDF-документом, так и с изображением или структурой SQL-запроса.

Чтобы решить задачу, агенту нужно обратиться к трём гетерогенным источникам:
- Статический снимок веб-сайта оператора — HTML-страницы, изображения и связанные PDF-файлы.
- Синтетическая реляционная база данных — её структура имитирует внутреннюю систему оператора, но данные в ней безопасны для публикации.
- Внешние веб-архивы — дополнительные материалы, которые могут понадобиться для проверки фактов или уточнения контекста.
Как устроена проверка
Один из главных принципов Telco-GAIA — объективность. Авторы отказались от модных LLM-судей, где одна модель оценивает ответы другой. Вместо этого используется нормализованное точное сравнение строк, а весь бенчмарк упакован в изолированную Docker-среду. Это значит, что результат не зависит от конкретной машины или версии библиотек: запустил контейнер — получил те же цифры. Такой подход делает оценку детерминированной и воспроизводимой, что критично для исследований и сравнения разных моделей.

Что показали тесты
Разработчики прогнали через бенчмарк эталонного агента с двенадцатью разными моделями — как коммерческими, так и открытыми. Результаты оказались сдержанными: даже самая сильная модель справилась лишь с 71% заданий. Если же бюджет на вызовы инструментов урезать до умеренного, результат падает примерно до 40%. Иначе говоря, агент начинает заметно «срезать углы»: не делает лишних шагов, не проверяет детали и чаще ошибается в нестандартных случаях.
Особенно слабо модели справляются с категориями, где нужно использовать визуальную информацию — изображения и графику. Средний результат там ниже 30%. Это показывает, что понимание документов с картинками всё ещё остаётся серьёзной точкой роста для ИИ-агентов. В целом Telco-GAIA фиксирует существенный разрыв между ожиданиями от корпоративного агента и реальными возможностями современных LLM.
Выводы
Telco-GAIA — не просто очередной бенчмарк для исследования. Это практический инструмент для компаний, которые строят собственных ИИ-агентов и хотят заранее понять их ограничения. Благодаря воспроизводимой среде и проверенным задачам его можно использовать как внутренний стандарт качества.
Более того, подход, заложенный в Telco-GAIA, легко адаптировать под другие закрытые домены — от банков до логистики. Формат даёт готовый шаблон: взять реальные данные, аккуратно их обезличить, разбить на независимые источники и собрать окружение, в котором агент должен проявить свои навыки рассуждения. Это именно тот сдвиг, который нужен рынку: от общих тестов на эрудицию к проверке практических компетенций на правдоподобных корпоративных данных.



