Новый бенчмарк GIM: проверка LLM на стыке разных когнитивных навыков

10 сентября 20267 просмотров

Исследователи предложили подход, который оценивает модели не по объёму знаний и не в отрыве от реальности, а через задачи, требующие одновременно рассуждений, контроля контекста и работы с ограничениями. В бенчмарк вошло 820 авторских заданий, а его авторы также изучили, как влияют на результат настройки «размышлений» и другие параметры моделей.

Новый бенчмарк GIM: проверка LLM на стыке разных когнитивных навыков

Куда движутся LLM-бенчмарки

Современные тесты для больших языковых моделей постепенно теряют смысл: модели набирают высокие баллы, а разница между ними становится всё менее показательной. Авторы нового исследования видят причину в том, как устроено усложнение бенчмарков. Сейчас популярны две стратегии: либо наращивать объём узкоспециальных знаний, как в GPQA или HLE, либо уходить в абстрактную логику в духе ARC-AGI. У первого подхода есть проблема: высокий результат может быть следствием запоминания фактов, а не реального понимания. Второй подход, наоборот, отрывает рассуждение от практического контекста — такие задачи мало похожи на то, с чем модель столкнётся в жизни.

Новый бенчмарк GIM (Grounded Integration Measure) предлагает третий путь. Его авторы считают, что сложность должна возникать не из эрудиции и не из головоломок, а из необходимости одновременно задействовать несколько разных когнитивных навыков на материале общедоступных знаний.

Как устроен GIM

Набор состоит из 820 авторских задач: 615 открытых для всех и 205 приватных, которые остаются скрытыми для предотвращения натаскивания. Важно, что каждая задача — оригинальная композиция, а не переработка уже существующих вопросов.

Сложность достигается не за счёт редких фактов, а за счёт координации операций. Например, в одной задаче модели может понадобиться одновременно:

  • удовлетворять несколько ограничений;
  • отслеживать меняющееся состояние процесса;
  • проявлять эпистемическую бдительность, то есть понимать, каким источникам и утверждениям можно доверять;
  • подстраивать ответ под конкретную аудиторию.

При этом все задания опираются на общедоступные знания — от модели не требуется быть экспертом в узкой области. Получается проверка не памяти, а умения собрать разные навыки воедино и применить их в реалистичной ситуации.

Оцениваются ответы преимущественно через рубрики: результат декомпозируется на отдельные компоненты, и каждый компонент проверяется независимо. Это снижает вероятность того, что модель получит полный балл за частично правильный ответ.

Как оценивали модели

Авторы не стали полагаться просто на долю правильных ответов. Вместо этого они использовали непрерывную двухпараметрическую IRT-модель — метод из психометрии, который учитывает и способности модели, и сложность заданий. Модель калибровалась на 53 тест-конфигурациях — уникальных парах «модель × уровень мышления». Для этого привлекли пять специально откалиброванных судей.

Всего было получено более миллиона сырых судейских наблюдений, которые затем усреднили в 203 800 ячеек. Такая процедура даёт устойчивые оценки способностей, которые не разваливаются из-за типичных искажений raw-точности: строгости или снисходительности судей, потерянных данных, неодинаковых ошибок разных моделей. Итоговые оценки правильно упорядочивают тест-конфигурации даже в условиях такого шума.

На основе этих расчётов авторы собрали лидерборд, в который вошли 22 модели и 47 официальных reporting-конфигураций.

Роль времени на размышления

Отдельно исследователи изучили, как влияет вычислительный бюджет во время инференса — test-time compute. Это самое объёмное опубликованное исследование такого рода на фиксированном бенчмарке: в него вошли 11 моделей и 35 тест-конфигураций.

Выводы получились неожиданными во многом благодаря дизайну эксперимента. Внутрисемейные настройки — например, бюджет thinking-токенов или квантизация — влияют на результат не меньше, чем выбор самой модели. То есть можно взять одну и ту же модель, изменить параметры мышления — и получить разницу, сопоставимую с переходом на другую, более мощную модель.

Правда, есть и важное ограничение: увеличение количества reasoning-токенов даёт убывающую предельную отдачу. После некоторого порога дальнейшие вычисления почти не улучшают ответ. Это значит, что бесконечно наращивать «время на подумать» неэффективно — нужно искать баланс между бюджетом и качеством.

Выводы

Статья с описанием GIM вышла на arXiv в 2026 году и стала заметным событием для сообщества: 61 страница, 27 рисунков, 4 таблицы. Код и данные бенчмарка открыты, поэтому любой исследователь сможет прогнать собственные модели и сравнить их с опубликованными результатами.

Главная идея GIM — не в том, чтобы сделать тест ещё сложнее за счёт фактов или абстракций, а в том, чтобы приблизить задачи к реальности, где разные когнитивные навыки работают вместе. Возможно, именно такие бенчмарки позволят оценивать не просто «способность запомнить» или «способность логически мыслить в вакууме», а практическую полезность моделей в комплексных сценариях.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Бенчмарк GIM: проверка LLM на стыке когнитивных навыков