Большие научные прорывы не планируются: у агентных авто-исследователей много общего с фаззинг-тестированием

11 сентября 20260 просмотров

Авторы новой работы argue, что автономные научные системы должны опираться на плотные сигналы промежуточного прогресса, как это делают фаззеры, а не только на редкий финальный результат. Такой подход позволяет агенту исследовать нестандартные гипотезы и избегать переобучения под бенчмарк.

Большие научные прорывы не планируются: у агентных авто-исследователей много общего с фаззинг-тестированием

Наука издавна полна примеров того, как большие открытия совершаются вопреки строгому плану: случайные наблюдения, неожиданные результаты и боковые ветви исследований часто ценнее заранее намеченных целей. Однако современные автономные системы, созданные для научной работы, устроены по принципу «дай агенту задачу и финальную метрику — и он сам придёт к прорыву». Недавний препринт на arXiv, представленный в августе 2026 года, показывает, почему такая парадигма обречена: агентные авто-исследователи, которые оптимизируют только итоговый результат, по сути занимаются фаззинг-тестированием, но не используют главный урок фаззеров — ценность промежуточного сигнала о покрытии.

Иллюзия планируемых прорывов

В большинстве современных авто-исследовательских систем научное открытие рассматривается как задача оптимизации. Агенту задают набор экспериментов, финальный бенчмарк и ожидают, что максимизация балла приведёт к новому знанию. Проблема в том, что финальная оценка — это разреженный сигнал. Он появляется один раз в конце и ничего не говорит о том, какие промежуточные шаги были полезны. Когда агент вознаграждается только за итоговый вердикт, он неизбежно переобучается под условия теста и начинает слепо сэмплировать похожие варианты, не рискуя заглянуть в непривычные режимы.

Такой подход напоминает экзамен, где студенту сначала дают список вопросов, а потом оценивают только правильность ответов, игнорируя, как он искал решения. Если студент зазубрил типовые задачи, он покажет хороший результат на тренировочных примерах, но вряд ли откроет новый закон физики. Аналогично агенты, нацеленные на финальный балл, находят не новое, а лишь то, что подтверждает уже известные данные.

Фаззинг как модель авто-исследования

Авторы препринта проводят неожиданную параллель: агент-исследователь, решающий научную задачу, сталкивается с той же разреженной обратной связью, что и грейбокс-фаззер для поиска уязвимостей в программном обеспечении. Фаззер далеко не всегда сразу находит баг. Если бы он получал только сигнал «есть ошибка/нет ошибки», его работа была бы бессмысленной: большинство прогонов заканчиваются безрезультатно.

Секрет фаззинга в том, что каждый запуск программы измеряется не только по факту падения, но и по покрытию кода. Этот плотный сигнал позволяет видеть частичный прогресс: даже если уязвимость не найдена, новый путь исполнения — уже шаг вперёд. Фаззер использует покрытие для мутации входных данных и для принятия решения, на какие ветки тратить ресурсы. Он не ранжирует готовые прогоны, а активно направляет поиск в неизученные участки.

В науке похожий механизм мог бы работать точно так же. Каждый эксперимент, даже неудачный в смысле окончательной гипотезы, ценен, если он расширяет эпистемическую карту — знание о том, какие части пространства теорий уже проверены, а какие остаются белыми пятнами.

Два условия для работающего исследовательского агента

Чтобы авто-исследователь действительно искал, а не сэмплировал, ему нужны две связанные способности.

  • Дешёвый плотный сигнал. Каждый эксперимент должен до того, как станет доступна финальная научная валидация, давать наблюдаемый показатель эпистемического прогресса. Это не обязательно точная метрика истинности, а скорее индикатор новизны, неизвестности или отклонения от текущей модели мира.
  • Обратная связь должна управлять действием. Полученный сигнал обязан влиять на выбор следующего вмешательства. Если агент просто фиксирует прогресс в журнале, но продолжает сэмплировать в той же области, пользы мало. Сигнал прогресса должен мутировать «входные данные» исследования, как фаззер мутирует тестовые примеры.

Важно, что плотный сигнал — это именно направление, а не итоговый приговор. Поэтому финальная валидация всё равно остаётся необходимой: она оценивает утверждения, используя доказательства, защищённые от адаптивного повторного использования. Иначе агент, который тысячи раз подстраивается под сигнал, может случайно выдать ложное открытие, которое пройдёт проверку только из-за переобучения.

Эксперимент: поиск против сэмплирования

Авторы работы проверили эти идеи в симулированной физической среде. ИИ-агенту нужно было обнаружить скрытый физический закон. Один из агентов был устроен так, что отслеживал собственный промежуточный эпистемический прогресс — что-то вроде «покрытия пространства возможных объяснений». Другие агенты использовали классическую оптимизацию финального результата.

Результат показал, что агент с отслеживанием прогресса успешно находил скрытый закон. Базовые оптимизационные подходы проваливались: они многократно сэмплировали уже имеющиеся данные и переобучались на них, так и не решаясь проверить непопулярные режимы. Это подтверждает, что центральное узкое место автономных исследований лежит не в способности генерировать гипотезы, не в мощности модели и даже не в объёме данных, а в архитектуре обратной связи.

Что это меняет

Сравнение научных авто-исследователей с фаззерами — не просто метафора, а инженерный принцип. Если мы хотим, чтобы ИИ совершал настоящие открытия, нельзя давать ему только разреженную цель и ждать. Нужно проектировать плотные сигналы, которые сделают видимым даже медленное продвижение, а затем позволять агенту использовать эти сигналы для исследования.

Такой подход меняет отношение к неудачам в науке: ценен не только успешный эксперимент, но и любой шаг, который сужает пространство неизвестного. В каком-то смысле это возвращает нас к тому, как работает человеческая наука на практике: учёные движутся от одного частичного результата к другому, и лишь иногда эти пути складываются в большой прорыв, который невозможно было запланировать заранее. Автономным исследовательским системам, похоже, придётся учиться тому же — не планировать открытия, а создавать условия, при которых они становятся возможны.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Авто-исследователи и фаззинг: обзор научного подхода