Что такое Agent Lightning v1.0 и почему о нём говорят
Современные AI-агенты редко работают в одиночку: вокруг них строится agent harness — прослойка, которая управляет инструментами, контекстом и потоком выполнения. От того, как устроен этот «каркас», напрямую зависит, насколько эффективно модель справляется с задачами. Однако долгое время он оставался вне контура обучения: RL-тренер видел только ответы модели и не имел дела с тем, как именно агент взаимодействует со средой.

Проект Agent Lightning v1.0 предлагает другой подход — harnessed agentic RL (управляемый агентный RL). Его идея в том, чтобы harness, который используется на этапе развёртывания, напрямую участвовал в пост-обучении модели. Это позволяет дообучать агента в тех же условиях, в которых он будет работать в проде, и заметно упрощает подключение произвольных агентов к RL-пайплайну.
Как устроен harnessed agentic RL
В традиционном агентном RL цикл «модель → действие → наблюдение → новое действие» принадлежит тренировочному движку. В управляемом варианте весь этот цикл берёт на себя harness, а тренер наблюдает лишь последовательность пар запрос-ответ LLM. Такое разъединение даёт гибкость: можно использовать любой агентный фреймворк, просто подключая его через эндпоинт-прокси.
Эта архитектура не нова: первая версия Agent Lightning представила разъединённую (disaggregated) схему, к которой позже пришли и другие фреймворки — verl Uni-Agent, AReaL 2.0, slime и Polar. Однако у такого подхода есть свои подводные камни.
Ключевые проблемы
Авторы называют несколько сложностей, которые возникают при практической реализации:
- Retokenization — повторная токенизация последовательностей может искажать обучающие данные.
- Sample merging — объединение сэмплов из разных источников требует аккуратной обработки.
- Advantage calculation — расчёт преимущества (advantage) усложняется при нестандартной организации данных.
- Loss normalization — нормализация лосса должна учитывать особенности harness.
- Backend scheduling — планирование вычислений на бэкенде влияет на стабильность обучения.
Эти, казалось бы, технические детали могут серьёзно повлиять на финальный результат. Чтобы их исследовать, и был создан Agent Lightning v1.0 — лёгкий фреймворк примерно на 3 500 строк кода.

Результаты: +14,6 пункта на SWE-bench Verified
Разработчики проверили подход на трёх классах агентов: для следования инструкциям, для поиска и для написания кода. Для coding-агентов опубликован полностью воспроизводимый пайплайн.
Эксперимент выглядит так: всего 6 000 обучающих примеров и умеренные вычислительные ресурсы. Модель Qwen3.5-9B после RL-дообучения показала на SWE-bench Verified результат 56,4% против 41,8% до обучения. Абсолютный прирост — 14,6 процентного пункта. Это сильный результат для такого небольшого объёма данных и лёгкого фреймворка.
При этом авторы открыто публикуют полный рабочий процесс и обучающие скрипты, так что любой желающий может воспроизвести эксперимент или использовать Agent Lightning v1.0 как испытательный стенд для собственных исследований.
Что это значит для индустрии
Появление harnessed agentic RL сдвигает акцент с «накачки» модели данными на согласованную работу модели и её окружения. Если раньше harness считался вспомогательной деталью, то теперь он становится частью обучаемого контура. Для практиков это означает более предсказуемое поведение агентов в реальных сценариях, а для исследователей — новый набор открытых задач: от оптимизации токенизации до планирования вычислений.
Agent Lightning v1.0 — не единственный проект в этой нише, но его открытость и простота делают его удобной отправной точкой для экспериментов. Вполне вероятно, что в ближайшее время мы увидим новые фреймворки, которые доведут эти идеи до промышленного применения.



