FinSkillBench: в инвестиционных ИИ-агентах готовые процедурные навыки иногда важнее выбора модели

9 сентября 20262 просмотров

Новый бенчмарк проверяет языковых агентов в портфельной оптимизации, риск-менеджменте и фундаментальном анализе. На девяти моделях заранее собранные пакеты навыков заметно улучшают средние результаты, а самостоятельное создание навыков агентом почти не дает выигрыша.

FinSkillBench: в инвестиционных ИИ-агентах готовые процедурные навыки иногда важнее выбора модели

Что и зачем оценивает FinSkillBench

Сравнивая ИИ-агентов для управления инвестициями, легко увлечься выбором языковой модели: больше параметров, новее архитектура, выше результат на обычных тестах. Но FinSkillBench предлагает посмотреть на проблему с другой стороны: насколько агент вообще умеет пользоваться финансовыми процедурными навыками — пошаговыми инструкциями и исполняемыми компонентами, которые превращают знания в действие.

Бенчмарк охватывает три ключевые области инвестиционной работы:

  • построение портфеля
  • управление рисками
  • фундаментальный анализ

Внутри этих областей авторы собрали 12 подзадач и 2603 эпизода. Каждый эпизод — это задача с данными на конкретный момент времени, скрытым правильным ответом и формулировкой, которую агент должен превратить в действие. То есть проверяется не память модели, а её способность применить правильную процедуру в нужный момент.

Три режима работы агента

Чтобы понять, что именно даёт навык, авторы сравнивали три варианта поведения агента.

  1. Без навыков. Модель решает задачу «с голым» знанием, без внешних подсказок о том, как действовать.
  2. С курируемыми навыками. Агент получает набор процедурных документов и исполняемых компонентов, отобранных экспертами. Это фактически готовая библиотека действий: правила, формулы, алгоритмы.
  3. С самогенерируемыми навыками. Агент пишет собственные процедуры по ходу решения и пытается использовать их дальше в рамках того же эпизода.

Ключевой вопрос заключался в том, компенсируют ли удачно заготовленные процедуры ограничения модели — или умная модель способна справиться сама.

Результаты получились показательными. На девяти моделях добавление курируемых навыков стабильно улучшало итоговые баллы: средний результат вырос с 0.366 до 0.528. Эффект сильнее всего проявился в построении портфеля и управлении рисками — там, где важна последовательность действий и явные правила.

Самогенерация почти не помогает

Интуиция подсказывает: дайте модели возможность создавать свои процедуры — и она адаптируется к задаче лучше, чем с чужими шаблонами. В эксперименте это не подтвердилось. Самогенерируемые навыки давали лишь незначительное улучшение, зато требовали заметно больше вычислительных ресурсов. Агент тратил время на создание и переписывание процедур, но результат почти не менялся.

Наивная самогенерация похожа на изобретение велосипеда в каждой задаче: дорого и без гарантии качества. Готовый, проверенный процедурный навык оказывается надёжнее, чем попытка модели каждый раз выводить метод с нуля.

Воспроизводимость на другом фреймворке

Любой бенчмарк можно «подогнать» под конкретную среду. Поэтому авторы дополнительно прогнали оценку на независимом агентном фреймворке Hermes Agent: 8 моделей, 5280 эпизодов, те же три области. Общая закономерность подтвердилась — готовые навыки улучшают работу агентов во всех направлениях.

Правда, величина эффекта оказалась неодинаковой: она зависела и от подзадачи, и от того, как устроен агентный «конвейер». Это важная оговорка: навыки — не волшебная кнопка, но систематическое преимущество они дают.

Вывод для тех, кто строит инвестиционных агентов

Главный практический урок исследования: в управлении инвестициями доступ к надежным процедурным навыкам может быть не менее важен, чем выбор базовой модели. Если у агента есть понятная процедура и он умеет ей следовать, он часто справляется лучше более сильной модели, которая действует вслепую.

Для продуктовых команд это означает, что не стоит вкладывать все усилия только в подбор модели. Стоит уделить внимание формированию библиотеки проверенных финансовых процедур: как пересчитать доли портфеля, как учесть фактор риска, как анализировать отчётность. Отдельно авторы подчёркивают: процедуры должны быть курируемыми, а не создаваться агентом на лету.

Финальная деталь: авторы открыли и сам бенчмарк, и инструменты оценки, и пакеты курируемых навыков, и полные траектории действий агентов. Это позволяет воспроизводить результаты и развивать собственные агентные системы, не собирая всё с нуля.

Часто задаваемые вопросы

Похожие материалы

Все материалы
FinSkillBench: обзор бенчмарка ИИ-агентов для инвестиций