Современные большие языковые модели отлично справляются с задачами, где нужно вспомнить и применить существующие человеческие знания. Но по-настоящему интеллектуальная система должна уметь выходить за пределы изученного: ставить вопросы, которые ещё никто не задавал, и превращать догадки в проверяемые научные результаты. Именно эту способность — а точнее, её отсутствие у нынешних ИИ — решил измерить новый бенчмарк под названием ASI-Bench.
От воспроизведения знаний к созданию новых
Исследователи давно заметили, что современные модели обучены сжимать и комбинировать информацию из огромных массивов данных, созданных людьми. Однако сверхразум в понимании авторов — это не просто более мощный «пересказчик», а система, способная самостоятельно исследовать неизвестное и производить новое знание. Традиционные тесты почти всегда сводятся к проверке того, насколько точно модель воспроизводит выученную информацию и способна ли она следовать детальным инструкциям человека. Они не дают ответа на главный вопрос: может ли ИИ действовать как самостоятельный учёный?
В этой ситуации потребовался принципиально иной инструмент, который проверял бы именно научное творчество и автономность — и первый шаг в этом направлении сделал ASI-Bench.

Как устроен бенчмарк
Разработка нового теста заняла свыше 31 000 человеко-часов совместной работы более чем 40 экспертов. В итоге в бенчмарк вошло 60 проектных исследовательских задач из 11 научных областей — от естественных наук до инженерных дисциплин. Каждое задание устроено как небольшой исследовательский проект, в котором нужно провести работу от начальной гипотезы до проверяемого результата.
Принципиальная особенность ASI-Bench — это постепенное снятие методологической поддержки. Для каждой задачи авторы подготовили несколько уровней руководства: от максимально подробных инструкций, где расписан каждый шаг, до постановки, в которой агент должен сам выбрать метод и даже определить направление исследования. Таким образом, тест позволяет увидеть, как далеко ИИ готов идти без подсказок человека.
Чтобы исключить ошибки и «зазубривание» ответов, все задачи проходят многоступенчатую проверку: экспертное рецензирование, аудит с помощью другой ИИ-системы, исполнение в изолированной песочнице и отдельную валидацию результатов подсчёта баллов. Это делает результаты более надёжными по сравнению с обычными тестами.

Первые результаты: зависимость от человека
Авторы прогнали 18 конфигураций «агент—модель» уровня state-of-the-art через все уровни задач. Результаты оказались показательными. Если при полном методологическом руководстве средний балл составлял 50,91, то, когда агенту оставляли только метод, — уже 29,10. Когда же модели приходилось самостоятельно определять метод, балл падал до 26,62.
Такое резкое снижение говорит о том, что даже самые современные системы пока не готовы проводить сквозные научные исследования без детальных подсказок человека. Они сильны в исполнении чётко поставленных шагов, но заметно теряются, как только нужно взять на себя инициативу. Это важный сигнал для всех, кто ожидает скорого появления сверхразума: прогресс в области воспроизведения знаний не равен прогрессу в автономном научном поиске.
Открытая платформа и следующие шаги
Разработчики сделали ASI-Bench открытым для научного сообщества и приглашают исследователей со всего мира добавлять новые задачи. Это позволит расширять набор областей и сценариев, делая бенчмарк более полным. Кроме того, открытость теста даёт возможность отслеживать прогресс ИИ-систем в динамике: сегодняшние результаты, вероятно, станут отправной точкой для сравнения с будущими моделями.
Несмотря на пока невысокие показатели, главный итог этого исследования — не разочарование, а появление инструмента, который впервые позволяет измерить то самое «исследовательское» качество ИИ. Дальше — дело за тем, смогут ли новые модели и агентные архитектуры сократить разрыв между исполнением под руководством и самостоятельной научной работой.



