Почему самообучающиеся агенты нестабильны: разброс результатов и зависимость от порядка задач
Самообучающиеся агенты — одно из самых многообещающих направлений в современном ИИ. Они способны накапливать опыт в процессе работы и становиться всё лучше с каждой новой задачей. Но за этой привлекательной идеей скрывается серьёзная проблема: такие системы крайне непредсказуемы. Даже один и тот же агент может показать совершенно разные результаты при повторном запуске, а эффективность его обучения напрямую зависит от того, в каком порядке ему попадаются задачи.
Недавнее исследование, представленное в работе «On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification» (arXiv: 2608.18066), вплотную занялось этим вопросом. Авторы провели повторную оценку двух популярных методов, основанных на ведении текстового банка памяти. Такие агенты сохраняют информацию о решённых задачах и используют её как внешнюю память при обработке новых запросов. Казалось бы, механизм простой и логичный, но на практике всё оказалось гораздо сложнее.
Скрытая шумность самообучения

Первое, что обнаружили исследователи, — это высокий уровень шума в оценке таких агентов. В сложных окружениях с многошаговыми задачами результаты одного и того же агента могут существенно колебаться от прогона к прогону. А добавление контура самоулучшения не просто сохраняет этот шум, а заметно его усиливает. Получается парадокс: чем больше агент пытается учиться на своём опыте, тем менее стабильным становится его поведение.
Почему так происходит? Частично это связано с тем, что текстовый банк памяти накапливает информацию недетерминированно. На каждом шаге агент выбирает, что именно сохранить, а что отбросить, и эти решения зависят от множества факторов. В результате даже при идентичных входных данных внутреннее состояние агента может сильно отличаться, что и порождает разброс.
Порядок задач как скрытый учебный план

Второе важное наблюдение касается влияния порядка задач. Оказалось, что улучшение агента сильно зависит от того, в какой последовательности он знакомится с заданиями. В предыдущих работах, посвящённых самообучающимся агентам, часто использовался фиксированный порядок «по умолчанию». Исследователи выяснили, что такой порядок фактически создаёт неявный учебный план — задачи выстроены от простых к сложным, что даёт агенту возможность постепенно наращивать компетенции.
Однако стоит лишь случайным образом перемешать задачи, как эффективность обучения резко падает. Это означает, что заявленный успех многих систем во многом был предопределён удачным расположением материала, а не реальной способностью агента учиться. По сути, порядок по умолчанию выступал скрытым предварительным условием успеха — фактором, о котором обычно даже не упоминали в описаниях методов.
Недоопределённость как корень проблемы
Авторы выдвинули гипотезу, что основная причина хрупкости кроется в недоопределённости (underspecification) задач и окружения. Когда условия задачи описаны недостаточно подробно, агент вынужден принимать множество неоднозначных решений. Это порождает случайность в том, как он накапливает знания, и в том, как он их потом применяет.

Чтобы проверить эту гипотезу, исследователи попытались сделать процесс конструирования памяти более специфицированным. Они добавили в него детальные рубрики оценки и обратную связь от окружения — то есть ту информацию, которая должна была снизить неоднозначность. Результат оказался показательным: дополнительная спецификация лишь частично закрыла деградацию производительности, наблюдаемую в экспериментах. Значительные разрывы сохранились, что указывает на существование других, ещё не охарактеризованных факторов, вносящих вклад в нестабильность.
Что это значит для практиков
Полученные выводы имеют прямое отношение к разработке и тестированию таких систем. Во-первых, нельзя доверять результатам одного прогона. Необходимо запускать агента многократно и сообщать не только средние показатели, но и разброс. В противном случае можно легко сделать ложный вывод об эффективности метода, основываясь на удачной случайности.
Во-вторых, при сравнении разных подходов нужно обязательно проверять их на случайно перемешанных порядках задач. Если метод работает только на «тёпличном» учебном плане, его практическая ценность вызывает сомнения — в реальности задачи редко поступают в идеально выстроенной последовательности.
Наконец, недоопределённость — это не просто особенность конкретных бенчмарков, а фундаментальное свойство многих реальных сценариев. Агентам приходится действовать в условиях, где правила до конца не ясны, и это всегда будет создавать риск непредсказуемых отказов. Поэтому наряду с улучшением самих алгоритмов важно проектировать интерфейсы и процессы, которые позволяют человеку эффективно контролировать поведение агента и вмешиваться до того, как ошибка станет критической.
Вместо итога
Самообучающиеся агенты остаются крайне перспективным, но всё ещё незрелым направлением. Исследование наглядно демонстрирует, что их текущие реализации далеки от надёжности. Разброс результатов и зависимость от порядка задач — это не досадные помехи, а фундаментальные свойства, с которыми придётся считаться. Без строгих протоколов оценки, включающих множественные прогоны и стресс-тесты в сложных окружениях, мы рискуем принять случайные успехи за реальный прогресс. А это уже вопрос доверия к ИИ-системам в целом.



