Когда судья необъективен: самообучающиеся агенты перестают избавляться от бесполезных навыков
Представьте агента, который сам пополняет свою библиотеку навыков: пробует новые подходы, оставляет удачные, отбрасывает бесполезные. Чтобы это работало, нужен механизм, который не даёт библиотеке засоряться мусором. В современном дизайне таких агентов эту роль выполняет skill retirement — структурное ограничение, которое гарантирует, что арсенал навыков не станет хуже, чем «вообще без навыков». Но, как показала свежая работа группы исследователей, у этой гарантии есть скрытая уязвимость: она опирается на честную оценку качества. А если оценку ставит LLM-судья, честность не гарантирована.

Почему retirement — это важно
У агента, который постоянно изобретает новые навыки, есть естественная проблема: часть из них оказывается не просто бесполезной, а вредной — она мешает выполнять базовые задачи. Без ограничений библиотека растёт бесконечно, а качество падает. Skill retirement — это как садовник, который вовремя выдёргивает сорняки. Механизм построен на том, что вклад каждого навыка можно измерить: если навык не приносит пользы, его удаляют.
Но как измерить вклад, когда нет эталонного ответа? Во многих практических задачах — написание отчётов, анализ текста, составление планов — правильного решения не существует. Поэтому вместо объективной проверки приходится использовать LLM-судью. И именно здесь кроется корень проблемы.
Судья с предубеждением: незаметный саботаж
Авторы статьи «The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents» (Zhang, Cui, Wang, Li, Qiu, Zhu, He — работа представлена на COLM 2026 Workshop on Agent Behavior) рассмотрели, что происходит, если судья систематически ошибается. Они выделили важный тип ошибки — false-pass: когда неудачный результат судья пропускает как успешный. Казалось бы, небольшой перекос — ну подумаешь, судья слишком лоялен. На деле это приводит к неожиданному эффекту: предвзятый судья не просто добавляет шума в оценки, он полностью отключает механизм retirement.
Для чистоты эксперимента исследователи отделили влияние именно предвзятости от обычного шума. Оказалось, что симметричный шум (судья одинаково часто ошибается в обе стороны) не мешает работе retirement. А вот асимметричное смещение в сторону ложных успехов ломает всё.

Резкий порог, который нельзя обойти
Самое интригующее — как именно происходит отказ. Он не постепенный. Пока доля false-pass не превышает примерно 0,45 — то есть судья пропускает меньше половины провалов — механизм работает. Но стоит перейти через этот порог, и основанный на вкладе retirement перестаёт функционировать полностью. Никакое увеличение объёма данных или числа итераций не помогает: порог невозможно пересечь обратно, просто собрав больше примеров.
Исследователи проверили это в разных условиях: на среде генерации отчётов без референса (с перекрёстной проверкой на генерации кода) и на других доменах, с разной частотой отказов. Отказ механизма воспроизводится повсеместно. Единственное исключение — почти идеальные судьи-верификаторы, где доля ошибок близка к нулю, но это редкий случай для реальных LLM-судей.
Важная деталь: они различают настоящий retirement (удаление реально бесполезных навыков) и «кап-эвикшн» (вытеснение старых навыков новыми по формальным причинам). Отключается именно первый, и это универсальный эффект, а не артефакт конкретной среды.
«Молчаливая» деградация: почему проблема не видна
Если механизм сломан, можно ожидать, что метрики сразу покажут ухудшение. Но нет. Авторы обнаружили, что в некоторых режимах качество оценки остаётся стабильным, несмотря на отключённый retirement. Деградация проявляется только там, где та же самая коррупция судьи дополнительно истощает синтез новых навыков. Если же синтез работает, общая картина выглядит нормально.
Отключённый куратор — «молчаливый»: ни один агрегированный показатель не выдаёт его отсутствия. Внешне агент продолжает работать, по-прежнему генерирует отчёты, но его библиотека медленно засоряется, а потенциал роста снижается. Это делает проблему особенно опасной: её невозможно заметить в обычном тестировании.
Как проверить судью до развёртывания
Авторы предлагают дешёвый и практичный способ аудита — инъекцию дефектов. Идея проста: перед развёртыванием оператор намеренно вводит в библиотеку заведомо бесполезный навык (или подсовывает судье заведомо плохой результат) и смотрит, как судья на него отреагирует. Если судья его отбраковывает — всё в порядке. Если пропускает — значит, система находится по другую сторону порога, и retirement с большой вероятностью уже не работает.
Такой тест не требует сложной инфраструктуры и занимает немного времени. Он показывает не просто точечную ошибку, а то, на какой стороне порога находится судья — а значит, можно принять решение до того, как агент начнёт накапливать бесполезные навыки в боевом режиме.

Вместо вывода
Это исследование — про безопасность поведения, а не про производительность. Оно не обещает, что агенты станут быстрее или точнее. Оно говорит о другом: даже консервативный механизм защиты, как skill retirement, может быть незаметно отключён предвзятым судьёй, и система продолжит выглядеть здоровой. Хорошая новость в том, что этот процесс можно диагностировать простым тестом до того, как он нанесёт реальный ущерб. Для всех, кто проектирует самообучающихся агентов, это повод задуматься: насколько честен ваш судья — и что будет, если он вдруг станет слишком снисходительным.



