ScienceFlow: как LLM-агент учится доводить исследования до конца в долгих экспериментах

11 сентября 20264 просмотров

Новый фреймворк ScienceFlow помогает ИИ-агентам не терять цель в многочасовых исследовательских задачах: работа дробится на восстанавливаемые сегменты, а ресурсы распределяются в зависимости от реально подтверждённого прогресса. На MLE-bench он показал лучший результат среди опубликованных подходов.

ScienceFlow: как LLM-агент учится доводить исследования до конца в долгих экспериментах

Долгие исследования: проблема не в одном запросе

Автономный исследователь живёт в другой реальности, чем обычный чат-агент. Ему нужно выдвинуть гипотезу, проверить её, найти ошибку, переписать скрипт, запустить эксперимент, а иногда и вернуться к предыдущей версии модели. Такой цикл может занимать часы, а ценность каждого шага становится понятна только в конце.

У большинства авторисерч-агентов с этим сложно. Механизмов непрерывности почти нет: если эксперимент зашёл в тупик, агент не знает, как восстановить утраченную нить. Нет и функции перераспределять вычисления в зависимости от того, насколько полезен текущий результат. Как следствие, поиск становится рыхлым, вычислительные ресурсы тратятся впустую, а вероятность довести работу до конца снижается.

Как устроен новый подход

Именно эти проблемы решает фреймворк ScienceFlow. Его авторы — команда из 19 исследователей — представили end-to-end архитектуру для автономных научных экспериментов. Агент не действует «по одному промпту»: он строит длинную исследовательскую траекторию.

Внутри работа делится на исследовательские сегменты. Каждый сегмент привязан к исполняемому рабочему пространству: там живут скрипты, данные и окружение. Прогресс исследования — это не разрозненные текстовые заметки, а восстанавливаемое исполняемое состояние. Такое состояние можно «поднять» с диска, переисследовать, пересобрать и запустить снова. Благодаря этому агент легко возвращается в прошлую точку и пробует другую ветку, а не начинает всё заново.

ESTRA: как выбрать следующую развилку

Ключевая деталь — переход между состояниями через механизм ESTRA (Executable-State Transition through Re-Anchoring). На каждом шаге агент смотрит на два типа состояний: живые, где можно продолжить прямо сейчас, и архивные, которые уже привели к каким-то результатам. Но выбирает не просто новую точку, а якорь для дальнейшего движения. Затем определяется сценарий: продолжать движение из этого состояния или перенаправить исследование в другую сторону.

Такой подход снимает главную беду длинных экспериментов — эффект «застрявшего» агента, который продолжает углубляться в бесперспективную ветку, потому что не знает, как откатиться.

Контроллер исполнения с учётом результатов

Ещё один слой фреймворка — контроллер с учётом подтверждённых результатов. Он распределяет ресурсы между отдельными вычислительными заданиями, ориентируясь на три фактора: доступность мощностей, оставшийся бюджет и уже подтверждённый прогресс. Если какое-то направление перестаёт давать измеримый результат, контроллер может урезать его долю и перенаправить ресурсы туда, где движение реально видно. Это не «жадный» планировщик задач, а способ удерживать общую стратегию в рамках цели.

Что показали испытания

В тестах фреймворк охватывал не только классическое машинное обучение, но и научное моделирование, и математическую оптимизацию. Полученные результаты говорят о том, что система способна продуктивно проводить длинные исследовательские сессии, не превращая их в бесконечную череду несвязанных шагов.

Самый заметный результат — на полном MLE-bench внутри 24-часового бюджета: 70,22% по метрике Any-Medal. Это на 4,92 процентного пункта выше предыдущих опубликованных показателей. Учитывая, что MLE-bench проверяет реальные сценарии машинного обучения, это сильный сигнал: устойчивость процесса иногда важнее исходного интеллекта модели.

Что это значит для автономной науки

Авторы статьи формулируют важный вывод: для масштабирования автономных исследований решающее значение имеют управление состоянием, адаптивное исследование и исполнение, согласованное с целью. Одной способности красиво рассуждать мало — нужна инфраструктура, которая не даёт агенту потерять предыдущие достижения и помогает вовремя развернуться.

Похоже, это следующий шаг от LLM-ассистентов к настоящим автономным исследовательским системам. Работа на длинном горизонте перестаёт быть «коротким диалогом с моделью» и превращается в инженерную задачу: как построить процесс, в котором каждая версия эксперимента остаётся доступной, каждый результат проверяется, а каждый следующий шаг вытекает из подтверждённого прогресса.

Часто задаваемые вопросы

Похожие материалы

Все материалы
ScienceFlow: фреймворк для автономных исследований