Зачем нужен BEAR-Bench
Современные мультимодальные модели уверенно распознают объекты на фото и отвечают на вопросы по картинкам, но их навыки работы с плотными текстовыми документами — особенно профессиональными — часто остаются за кадром. Существующие бенчмарки проверяют в основном извлечение фактов, требуют узких предметных знаний или рассматривают деловые бумаги лишь как один из второстепенных сценариев. При этом большинство тестов ориентированы на английский и китайский языки: русскоязычный контент в них практически не представлен.
BEAR-Bench закрывает этот пробел. Это новый двуязычный бенчмарк, который оценивает способность ИИ рассуждать о тексто-насыщенных документах из бизнеса и науки. Работа представлена в статье на arXiv (номер 2608.17895), её подготовили Лиубо Чубарова, Александра Кулешова, Даниил Волков, Кирилл Султанов и Алексей Зайцев.
Как устроен тест

Главная особенность BEAR-Bench — самодостаточность. Модели не нужно искать дополнительные источники: все необходимые данные находятся внутри самих документов. Тест включает 1000 вопросов, размеченных вручную, на английском и русском языках. Вопросы построены вокруг реальных деловых и академических материалов, где важно не просто найти нужную строку, а сделать логический вывод, сравнить цифры или интерпретировать положение документа.
Это принципиально отличает бенчмарк от простых тестов на поиск информации: модель должна продемонстрировать именно рассуждение, а не умение быстро сканировать текст. Благодаря двуязычности разработчики могут проверить, насколько устойчиво модель справляется с профессиональной лексикой и разными языковыми структурами.
Результаты: сильные модели тоже ошибаются
В оценке приняли участие 16 моделей — как проприетарные, так и с открытыми весами. Среди них были такие крупные системы, как Gemini 3.1 Pro и Qwen3.5-397B. Даже лидеры показали заметный разрыв между текущим уровнем и идеальным результатом.

Интересно, что авторы не ограничились простым ранжированием. Они использовали результаты моделей на BEAR-Bench для сравнения популярных методов детекции галлюцинаций. То есть оценивали не только то, как часто модель ошибается, но и насколько надёжно эти ошибки можно обнаружить существующими подходами. Это важный практический аспект: любую систему, которая должна работать с документами, нужно не просто обучать, но и уметь контролировать её ответы.
Выводы для разработчиков
BEAR-Bench задаёт новый стандарт проверки качества ИИ для профессиональной работы с текстами. Двуязычный корпус и фокус на логике, а не на поиске информации, делают его удобным инструментом для сравнения моделей. Наличие русскоязычной части расширяет возможности тестирования для локальных рынков, а включение методов обнаружения галлюцинаций в общую картину оценки помогает практикам выбирать более безопасные решения.
Пока ни одна модель не приблизилась к потолку бенчмарка — значит, в этой области есть куда расти. Для команд, разрабатывающих ассистентов для работы с документами, BEAR-Bench станет ориентиром того, какие навыки нужно прокачивать в первую очередь.



