RobustSGPO: управление вариантами при настройке агентных систем

25 сентября 202610 просмотров

Метод задаёт параметры правки, превращает её в проверяемое изменение и продолжает оптимизацию от текущей лучшей версии либо сохранённых состояний. На отложенных задачах доля успешных завершений поднялась с 60% до 80%, а оценка качества — с 3,77 до 4,14; сохранение альтернативных версий помогает учитывать сдвиг задач, но требует дополнительных ресурсов.

RobustSGPO: управление вариантами при настройке агентных систем

Что именно контролирует RobustSGPO

RobustSGPO развивает SGPO — оптимизацию промптов на основе семантического градиента — с использованием обратной связи от выполнения. Локальное правило SGPO не задаёт масштаб редактирования и конкретную операцию.

Контроль распространяется на запрос к правке, проверку созданного патча и выбор исходной точки для следующего шага. Это отделяет управление поиском вариантов от самого сигнала обратной связи.

Практический критерий: такой подход подходит для настройки, где важно задавать операцию редактирования и проверять патчи, а не только получать обратную связь.

Как устроен поиск вариантов

Процесс включает три действия:

  1. Задать запрошенное редактирование.
  2. Создать патч и проверить его.
  3. Продолжить поиск от текущего лучшего варианта или сохранённых снимков.

Исходная точкаОткуда продолжается поиск
Текущий лучший вариант, incumbentОт лучшего варианта на данный момент
Сохранённые снимки, retained snapshotsОт сохранённых версий

Выбор определяет, от какой версии продолжится поиск. Критерий — нужна ли текущая лучшая версия или сохранённые альтернативные исходные точки.

Как планируют разрешение редактирования

В исследовании сравнили периодическое расписание $1\to2\to3$ с фиксированным максимальным разрешением. Периодическое расписание превзошло фиксированное на 0,28 пункта тестовой оценки.

Авторы оценивали планирование разрешений, кумулятивные ограничения и перенос между семействами задач. Результат относится к этим оценкам и не устанавливает универсальное преимущество расписания.

Критерий сравнения — тестовая оценка при выбранном расписании. В представленном исследовании лучше показало себя периодическое изменение разрешения.

Что показала оценка качества

В рабочем процессе AgentX brainstorming провели 95 запусков на 120 задачах и получили 7 350 попыток кандидатов.

На 30 отложенных задачах completion вырос с 60,0% до 80,0%. Test quality поднялся с 3,77 до 4,14 при бюджете 20 миллионов токенов.

Эти показатели описывают результаты конкретной оценки. При сопоставлении систем важно учитывать её задачи и бюджет, а не переносить цифры на другие условия.

Как выбирать стратегию сохранения вариантов

Сохранение вариантов создаёт измеримые накладные расходы. При этом контроль пространства поиска повышает качество за счёт исполняемых правок и альтернативных исходных точек.

СтратегияРезультат после сдвига задач
Сохранение по категориямСнижает ухудшение на исходных задачах
Случайное сохранениеДаёт более высокий результат на целевом наборе

Выбор зависит от приоритета: удерживать результат на исходных задачах или добиваться более высокого результата на целевом наборе. Сами затраты на сохранение вариантов при этом остаются частью оценки.

Часто задаваемые вопросы

Похожие материалы

Все материалы
RobustSGPO: управление вариантами при настройке агентов