Долгие исследования: проблема не в одном запросе
Автономный исследователь живёт в другой реальности, чем обычный чат-агент. Ему нужно выдвинуть гипотезу, проверить её, найти ошибку, переписать скрипт, запустить эксперимент, а иногда и вернуться к предыдущей версии модели. Такой цикл может занимать часы, а ценность каждого шага становится понятна только в конце.
У большинства авторисерч-агентов с этим сложно. Механизмов непрерывности почти нет: если эксперимент зашёл в тупик, агент не знает, как восстановить утраченную нить. Нет и функции перераспределять вычисления в зависимости от того, насколько полезен текущий результат. Как следствие, поиск становится рыхлым, вычислительные ресурсы тратятся впустую, а вероятность довести работу до конца снижается.
Как устроен новый подход
Именно эти проблемы решает фреймворк ScienceFlow. Его авторы — команда из 19 исследователей — представили end-to-end архитектуру для автономных научных экспериментов. Агент не действует «по одному промпту»: он строит длинную исследовательскую траекторию.
Внутри работа делится на исследовательские сегменты. Каждый сегмент привязан к исполняемому рабочему пространству: там живут скрипты, данные и окружение. Прогресс исследования — это не разрозненные текстовые заметки, а восстанавливаемое исполняемое состояние. Такое состояние можно «поднять» с диска, переисследовать, пересобрать и запустить снова. Благодаря этому агент легко возвращается в прошлую точку и пробует другую ветку, а не начинает всё заново.

ESTRA: как выбрать следующую развилку
Ключевая деталь — переход между состояниями через механизм ESTRA (Executable-State Transition through Re-Anchoring). На каждом шаге агент смотрит на два типа состояний: живые, где можно продолжить прямо сейчас, и архивные, которые уже привели к каким-то результатам. Но выбирает не просто новую точку, а якорь для дальнейшего движения. Затем определяется сценарий: продолжать движение из этого состояния или перенаправить исследование в другую сторону.
Такой подход снимает главную беду длинных экспериментов — эффект «застрявшего» агента, который продолжает углубляться в бесперспективную ветку, потому что не знает, как откатиться.
Контроллер исполнения с учётом результатов
Ещё один слой фреймворка — контроллер с учётом подтверждённых результатов. Он распределяет ресурсы между отдельными вычислительными заданиями, ориентируясь на три фактора: доступность мощностей, оставшийся бюджет и уже подтверждённый прогресс. Если какое-то направление перестаёт давать измеримый результат, контроллер может урезать его долю и перенаправить ресурсы туда, где движение реально видно. Это не «жадный» планировщик задач, а способ удерживать общую стратегию в рамках цели.
Что показали испытания
В тестах фреймворк охватывал не только классическое машинное обучение, но и научное моделирование, и математическую оптимизацию. Полученные результаты говорят о том, что система способна продуктивно проводить длинные исследовательские сессии, не превращая их в бесконечную череду несвязанных шагов.
Самый заметный результат — на полном MLE-bench внутри 24-часового бюджета: 70,22% по метрике Any-Medal. Это на 4,92 процентного пункта выше предыдущих опубликованных показателей. Учитывая, что MLE-bench проверяет реальные сценарии машинного обучения, это сильный сигнал: устойчивость процесса иногда важнее исходного интеллекта модели.

Что это значит для автономной науки
Авторы статьи формулируют важный вывод: для масштабирования автономных исследований решающее значение имеют управление состоянием, адаптивное исследование и исполнение, согласованное с целью. Одной способности красиво рассуждать мало — нужна инфраструктура, которая не даёт агенту потерять предыдущие достижения и помогает вовремя развернуться.
Похоже, это следующий шаг от LLM-ассистентов к настоящим автономным исследовательским системам. Работа на длинном горизонте перестаёт быть «коротким диалогом с моделью» и превращается в инженерную задачу: как построить процесс, в котором каждая версия эксперимента остаётся доступной, каждый результат проверяется, а каждый следующий шаг вытекает из подтверждённого прогресса.



