Wuying-Browser-Agent: браузерный ИИ, который справляется с длинными сценариями в реальном вебе

27 августа 202615 просмотров

Исследователи представили открытый фреймворк, объединяющий стабильный браузерный харнесс, обучение на восстановлении после ошибок и специальный reinforcement learning. Модель показывает рекордные результаты на WebVoyager, Online-Mind2Web и новом бенчмарке BrowserBench, а подход переносится и на задачи вне браузера.

Wuying-Browser-Agent: браузерный ИИ, который справляется с длинными сценариями в реальном вебе

От идеальных демо к живым сайтам

Браузерные ассистенты на основе ИИ уверенно справляются с короткими и чистыми сценариями: найти товар, оформить заказ, заполнить форму. Но как только такой агент оказывается на настоящем сайте — с медленной загрузкой, неожиданными всплывающими окнами, изменчивой версткой и десятками промежуточных кликов — картина меняется. В реальности ИИ должен удерживать цель на протяжении длинной цепочки действий, замечать собственные ошибки и исправлять их, а также разбираться в перегруженных интерфейсах.

Что такое «длинный сценарий» на практике? Это не один клик и даже не десять: агент может выполнять 30–40 и более шагов, прежде чем дойдёт до нужного результата. Каждый шаг зависит от предыдущего, и одна ошибка способна свести на нет все усилия. К тому же реальные веб-страницы постоянно меняются: верстка «плывёт», появляются новые элементы, а данные подгружаются асинхронно. Модель, обученная на статичных демонстрациях, теряется в таких условиях.

Проблема в том, что большинство существующих подходов тренируются на упрощенных демонстрациях и не рассчитаны на такой уровень сложности. Простое масштабирование модели здесь не помогает: разрыв между лабораторными условиями и реальным вебом требует пересмотра всего пайплайна — от исполнения действий до итоговой оценки.

Единый фреймворк для длинных горизонтов

Именно эту задачу поставила перед собой команда AIMAE, представившая Wuying-Browser-Agent — открытый фреймворк, который охватывает все уровни работы браузерного агента. Вместо того чтобы фокусироваться только на одной части, авторы выровняли исполнение, контроль, оптимизацию и оценку.

Рассмотрим каждый уровень подробнее. Исполнение — это то, как агент взаимодействует со страницей: кликает, вводит текст, переключает вкладки. Контроль — наблюдение за действиями и своевременное вмешательство, если что-то пошло не так. Оптимизация — процесс обучения, который настраивает модель на успешные траектории. И наконец, оценка — способ измерить, насколько хорошо агент справляется с задачами в реальном вебе. Все эти уровни должны работать согласованно, иначе система разваливается на длинных дистанциях.

Три ключевых компонента обеспечивают работу системы:

  • Структурированный браузерный харнесс — набор стабильных примитивов для выполнения действий. Он дает агенту предсказуемую среду и помогает управлять контекстом, ориентируясь на принятие решений. Вместо того чтобы полагаться на ненадёжные селекторы или случайные тайминги, агент получает чёткие команды, которые выполняются единообразно.
  • RUIC-SFT — метод супервизируемой настройки на траекториях восстановления после ошибок и взаимодействиях со сложными элементами интерфейса. Модель учится не только на успешных цепочках, но и на том, как выбраться из тупика.
  • DAO-GRPO — алгоритм оптимизации, который улучшает распределение «кредита» на длинных горизонтах за счёт потенциального формирования вознаграждения и взвешивания шагов по дивергенции. Каждое действие оценивается с учётом его вклада в общий результат, а не изолированно.

Такой подход позволяет модели не просто выполнять идеальные шаги, а реагировать на реальные помехи и понимать, какие действия действительно продвигают её к цели. Фреймворк уже сейчас показывает, что выравнивание пайплайна даёт больший эффект, чем простое увеличение размера модели.

BrowserBench: тест на реальную длину

Как проверить, что агент действительно готов к реальному вебу? Существующие бенчмарки часто слишком короткие и не выявляют характерные отказы на длинных дистанциях. Типичный тест может состоять из 5–10 шагов, тогда как в реальной жизни агенту приходится работать значительно дольше. Поэтому команда создала свой — BrowserBench. Это двуязычный набор из 350 задач, взятых из реальных сайтов, со средней длиной сценария почти 38 шагов.

Такая длина — принципиальное отличие. На коротких задачах агент может действовать почти наугад и всё равно получить высокий результат. На длинных же каждая ошибка накапливается, и без правильного распределения «кредита» система быстро сбивается с курса. BrowserBench позволяет увидеть эти сбои и понять, какие именно механизмы нужно улучшать.

Результаты говорят сами за себя. Wuying-Browser-Agent с 27 миллиардами параметров достигает 80,6% на WebVoyager, 66,7% на Online-Mind2Web и 65,1% на BrowserBench — это новый открытый рекорд на бенчмарках браузерного использования. Тот же пайплайн успешно переносится и на другие области: средний балл 73,8 на наборах Tau2-Bench, Claw-Eval и BFCL-v4.

Показательно, что успех достигается не на одной конкретной задаче, а сразу на нескольких независимых тестах. Это означает, что фреймворк усваивает общие принципы работы с веб-интерфейсами, а не подстраивается под конкретный бенчмарк. Хорошая обобщаемость — признак того, что агент действительно понимает, что делает, а не просто заучивает паттерны.

Что это значит для развития ИИ-агентов

Главный вывод — не в конкретных цифрах, хотя они впечатляют. Важнее подход: чтобы агент работал в реальном мире, нужно перестать гнаться за отдельными рекордами на чистых демонстрациях и вместо этого выстраивать всю систему под длинные, запутанные сценарии. Wuying-Browser-Agent показывает, что это достижимо, причём в открытом виде — исследователи могут воспроизвести его результаты и развивать дальше.

У такого подхода есть и практическая ценность. Представьте, что вам нужно сравнить условия на десятке сайтов, забронировать билеты или заполнить длинную форму. Сейчас это приходится делать вручную, потому что ни один ассистент не может удержать контекст так долго. С фреймворком, подобным Wuying-Browser-Agent, подобные задачи могут быть автоматизированы уже в ближайшее время.

Браузерные агенты перестают быть лабораторным экспериментом и превращаются в практический инструмент. Осталось дождаться, когда такие системы появятся в обычных браузерах и возьмут на себя рутину — от покупок до заполнения документов. И, судя по этому фреймворку, ждать осталось недолго.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Wuying-Browser-Agent: обзор ИИ для длинных сценариев в вебе