Следующая реплика пользователя как сигнал для обучения: новый метод FACA для агентов с инструментами

27 августа 202615 просмотров

Исследователи предложили подход FACA, который оценивает вклад каждого шага диалога, а не только финальный результат. Это заметно повышает качество многоходовых агентов в тестах, особенно в сценариях Telecom.

Следующая реплика пользователя как сигнал для обучения: новый метод FACA для агентов с инструментами

Современные AI-агенты всё активнее работают в диалоговом режиме: пользователь ставит задачу, агент обращается к инструментам, возвращает результат, а человек уточняет или корректирует запрос. Такое многошаговое взаимодействие сложно оценивать, потому что в конце есть только финальный исход. Он не показывает, какие действия агента действительно помогли, а какие оказались лишними.

Почему одного исхода недостаточно

В обучении с подкреплением для таких агентов обычно используется роллаут: агент выполняет серию действий, после чего получает награду за итоговый результат. Такой подход удобен, но довольно груб. Удачное уточнение запроса, явная ошибка и последующее исправление получают одинаковый кредит, хотя их вклад в итог совершенно разный. Из-за этого агент учится медленнее и не всегда понимает, какое именно действие привело к успеху.

Авторы нового исследования обращают внимание на ценный источник сигнала, который часто игнорируется, — следующую реплику пользователя. Когда агент сделал очередной шаг, человек реагирует: уточняет задачу, выражает недовольство, подтверждает ответ. Такая реплика — это не просто контекст для дальнейших шагов, а локальный отзыв о только что выполненном сегменте взаимодействия.

Как устроен FACA

Метод FACA (Feedback-Aware Credit Assignment) превращает реплику пользователя в полноценный обучающий сигнал. Идея в том, чтобы сопоставить каждую реакцию с конкретным сегментом действий агента, а затем вычислить локальное преимущество этой реакции — насколько она лучше ожидаемой для данного контекста. Это преимущество нормализуется и добавляется к стандартному терминальному преимуществу исхода. При этом не требуется ни дополнительного критика, ни новых роллаутов — всё вычисляется на уже собранных данных.

Такая комбинация даёт агенту и грубую оценку итога, и более точные промежуточные сигналы. Дополнительный бонус в том, что метод не усложняет инференс: весь добавочный сигнал извлекается из уже существующих диалогов, поэтому его легко применять в реальных системах.

Результаты экспериментов

Исследователи сравнили FACA с подходом Interactive GRPO, который учитывает только исход. Обучение проходило в одинаковых условиях: тот же симулятор, тот же видимый диалог, та же инициализация и оптимизация. На девяти доменах τ-семейства FACA улучшил средний результат на 5,91 процентного пункта для модели 8B и на 10,22 — для модели 14B. Каждый показатель был получен на трёх независимо обученных запусках.

Наибольший выигрыш пришёлся на домен Telecom. Дополнительный эксперимент с рандомизацией полярности реплик пользователя показал, что для модели 8B этот выигрыш полностью исчезает. Это подтверждает: сигнал несёт полезную информацию, а не просто добавляет шум. В режиме zero-shot на бенчмарках Pare-Bench и Co-Gym результаты сохраняют тот же порядок.

Выводы

Работа наглядно демонстрирует, что следующая реплика пользователя — это больше, чем просто контекст. Она даёт дешёвый локальный кредит, который заметно улучшает обучение агентов для многоходового взаимодействия. FACA предлагает простой и эффективный способ извлечь этот сигнал без существенной перестройки процесса обучения. В результате агенты лучше понимают, какие действия действительно приближают их к цели, а какие стоит пересмотреть.

Часто задаваемые вопросы

Похожие материалы

Все материалы
FACA — метод обучения агентов с инструментами