Первый тест на пути к сверхразуму: что показал бенчмарк ASI-Bench

26 августа 202630 просмотров

Новый бенчмарк проверил, насколько современные ИИ способны самостоятельно вести научные проекты, и результат оказался неожиданным: без четких инструкций человека модели заметно теряют в эффективности.

Первый тест на пути к сверхразуму: что показал бенчмарк ASI-Bench

Современные большие языковые модели отлично справляются с задачами, где нужно вспомнить и применить существующие человеческие знания. Но по-настоящему интеллектуальная система должна уметь выходить за пределы изученного: ставить вопросы, которые ещё никто не задавал, и превращать догадки в проверяемые научные результаты. Именно эту способность — а точнее, её отсутствие у нынешних ИИ — решил измерить новый бенчмарк под названием ASI-Bench.

От воспроизведения знаний к созданию новых

Исследователи давно заметили, что современные модели обучены сжимать и комбинировать информацию из огромных массивов данных, созданных людьми. Однако сверхразум в понимании авторов — это не просто более мощный «пересказчик», а система, способная самостоятельно исследовать неизвестное и производить новое знание. Традиционные тесты почти всегда сводятся к проверке того, насколько точно модель воспроизводит выученную информацию и способна ли она следовать детальным инструкциям человека. Они не дают ответа на главный вопрос: может ли ИИ действовать как самостоятельный учёный?

В этой ситуации потребовался принципиально иной инструмент, который проверял бы именно научное творчество и автономность — и первый шаг в этом направлении сделал ASI-Bench.

Как устроен бенчмарк

Разработка нового теста заняла свыше 31 000 человеко-часов совместной работы более чем 40 экспертов. В итоге в бенчмарк вошло 60 проектных исследовательских задач из 11 научных областей — от естественных наук до инженерных дисциплин. Каждое задание устроено как небольшой исследовательский проект, в котором нужно провести работу от начальной гипотезы до проверяемого результата.

Принципиальная особенность ASI-Bench — это постепенное снятие методологической поддержки. Для каждой задачи авторы подготовили несколько уровней руководства: от максимально подробных инструкций, где расписан каждый шаг, до постановки, в которой агент должен сам выбрать метод и даже определить направление исследования. Таким образом, тест позволяет увидеть, как далеко ИИ готов идти без подсказок человека.

Чтобы исключить ошибки и «зазубривание» ответов, все задачи проходят многоступенчатую проверку: экспертное рецензирование, аудит с помощью другой ИИ-системы, исполнение в изолированной песочнице и отдельную валидацию результатов подсчёта баллов. Это делает результаты более надёжными по сравнению с обычными тестами.

Первые результаты: зависимость от человека

Авторы прогнали 18 конфигураций «агент—модель» уровня state-of-the-art через все уровни задач. Результаты оказались показательными. Если при полном методологическом руководстве средний балл составлял 50,91, то, когда агенту оставляли только метод, — уже 29,10. Когда же модели приходилось самостоятельно определять метод, балл падал до 26,62.

Такое резкое снижение говорит о том, что даже самые современные системы пока не готовы проводить сквозные научные исследования без детальных подсказок человека. Они сильны в исполнении чётко поставленных шагов, но заметно теряются, как только нужно взять на себя инициативу. Это важный сигнал для всех, кто ожидает скорого появления сверхразума: прогресс в области воспроизведения знаний не равен прогрессу в автономном научном поиске.

Открытая платформа и следующие шаги

Разработчики сделали ASI-Bench открытым для научного сообщества и приглашают исследователей со всего мира добавлять новые задачи. Это позволит расширять набор областей и сценариев, делая бенчмарк более полным. Кроме того, открытость теста даёт возможность отслеживать прогресс ИИ-систем в динамике: сегодняшние результаты, вероятно, станут отправной точкой для сравнения с будущими моделями.

Несмотря на пока невысокие показатели, главный итог этого исследования — не разочарование, а появление инструмента, который впервые позволяет измерить то самое «исследовательское» качество ИИ. Дальше — дело за тем, смогут ли новые модели и агентные архитектуры сократить разрыв между исполнением под руководством и самостоятельной научной работой.

Часто задаваемые вопросы

Похожие материалы

Все материалы
ASI-Bench: что показал тест на пути к сверхразуму