BEAR-Bench: двуязычный тест для оценки логики ИИ-моделей на документах бизнеса и науки

4 сентября 20269 просмотров

Исследователи представили бенчмарк BEAR-Bench, который проверяет, насколько хорошо мультимодальные модели рассуждают над текстово насыщенными профессиональными документами на русском и английском. В набор вошли 1000 размеченных людьми вопросов, а тесты 16 моделей показали, что даже сильнейшие системы далеки от идеала.

BEAR-Bench: двуязычный тест для оценки логики ИИ-моделей на документах бизнеса и науки

Зачем нужен BEAR-Bench

Современные мультимодальные модели уверенно распознают объекты на фото и отвечают на вопросы по картинкам, но их навыки работы с плотными текстовыми документами — особенно профессиональными — часто остаются за кадром. Существующие бенчмарки проверяют в основном извлечение фактов, требуют узких предметных знаний или рассматривают деловые бумаги лишь как один из второстепенных сценариев. При этом большинство тестов ориентированы на английский и китайский языки: русскоязычный контент в них практически не представлен.

BEAR-Bench закрывает этот пробел. Это новый двуязычный бенчмарк, который оценивает способность ИИ рассуждать о тексто-насыщенных документах из бизнеса и науки. Работа представлена в статье на arXiv (номер 2608.17895), её подготовили Лиубо Чубарова, Александра Кулешова, Даниил Волков, Кирилл Султанов и Алексей Зайцев.

Как устроен тест

Главная особенность BEAR-Bench — самодостаточность. Модели не нужно искать дополнительные источники: все необходимые данные находятся внутри самих документов. Тест включает 1000 вопросов, размеченных вручную, на английском и русском языках. Вопросы построены вокруг реальных деловых и академических материалов, где важно не просто найти нужную строку, а сделать логический вывод, сравнить цифры или интерпретировать положение документа.

Это принципиально отличает бенчмарк от простых тестов на поиск информации: модель должна продемонстрировать именно рассуждение, а не умение быстро сканировать текст. Благодаря двуязычности разработчики могут проверить, насколько устойчиво модель справляется с профессиональной лексикой и разными языковыми структурами.

Результаты: сильные модели тоже ошибаются

В оценке приняли участие 16 моделей — как проприетарные, так и с открытыми весами. Среди них были такие крупные системы, как Gemini 3.1 Pro и Qwen3.5-397B. Даже лидеры показали заметный разрыв между текущим уровнем и идеальным результатом.

Интересно, что авторы не ограничились простым ранжированием. Они использовали результаты моделей на BEAR-Bench для сравнения популярных методов детекции галлюцинаций. То есть оценивали не только то, как часто модель ошибается, но и насколько надёжно эти ошибки можно обнаружить существующими подходами. Это важный практический аспект: любую систему, которая должна работать с документами, нужно не просто обучать, но и уметь контролировать её ответы.

Выводы для разработчиков

BEAR-Bench задаёт новый стандарт проверки качества ИИ для профессиональной работы с текстами. Двуязычный корпус и фокус на логике, а не на поиске информации, делают его удобным инструментом для сравнения моделей. Наличие русскоязычной части расширяет возможности тестирования для локальных рынков, а включение методов обнаружения галлюцинаций в общую картину оценки помогает практикам выбирать более безопасные решения.

Пока ни одна модель не приблизилась к потолку бенчмарка — значит, в этой области есть куда расти. Для команд, разрабатывающих ассистентов для работы с документами, BEAR-Bench станет ориентиром того, какие навыки нужно прокачивать в первую очередь.

Часто задаваемые вопросы

Похожие материалы

Все материалы
BEAR-Bench: двуязычный тест логики ИИ на документах