Palmyra x6: якорная доработка на 626 инструментальных сценариях подняла корпоративную LLM в лидеры бенчмарков

8 сентября 202617 просмотров

Модель Palmyra x6, построенная на базе архитектуры Mixture-of-Experts, прошла пост-обучение по консервативной методике с синтетическими траекториями работы с инструментами. Такой подход обеспечил ей лучшие показатели среди аналогов на шести публичных тестах, включая рекордные 0,785 на BFCL Core.

Palmyra x6: якорная доработка на 626 инструментальных сценариях подняла корпоративную LLM в лидеры бенчмарков

Что делает Palmyra x6 особенной

В линейке корпоративных языковых моделей появился новый заметный пункт: Palmyra x6. Это не очередная модель, которая просто научилась лучше генерировать текст. Её основная специализация — агентные задачи, где системе приходится не рассуждать в вакууме, а реально обращаться к внешним инструментам, получать результаты и действовать дальше.

Сама по себе модель собрана на базе архитектуры Mixture-of-Experts, но интрига кроется в другом: как именно её дообучали. Авторы применили так называемое якорное обучение с учителем — Anchored Supervised Fine-Tuning. И здесь есть неожиданный поворот: вместо «накормить модель миллионами примеров» они взяли всего 626 верифицированных траекторий. Каждая траектория — это синтетический, но проверенный сценарий работы с инструментами. Обучение шло одну эпоху, с низкой скоростью, а чтобы модель не потеряла уже имеющиеся навыки, её «удерживали» возле замороженной базовой версии с помощью KL-якоря. В качестве оптимизатора использовалась гибридная схема Muon + Adam.

Звучит почти как противоречие: современная LLM, гигантская по масштабу, — и всего несколько сотен примеров. Но именно такой компактный и аккуратный подход позволил добиться существенного прироста по сравнению с предыдущей стандартной моделью для агентной среды Writer Agent. Похоже, что в дообучении моделей иногда важнее не количество данных, а то, насколько точно они отражают нужное поведение.

Как устроена якорная доработка

Если разобрать процедуру по шагам, получится довольно изящная цепочка. Сначала формируется корпус примеров. Данные не собираются из реального трафика, а синтезируются так, чтобы покрыть типичные инструментальные сценарии: вызов функции, обработка ответа, уточнение запроса, повторный вызов. После генерации каждый сценарий проходит проверку — в итоговую выборку попадают только те, что действительно корректно решают поставленную задачу.

Дальше начинается самое интересное. Модель не просто дообучают на этих примерах, а делают это с якорем. С помощью KL-дивергенции её поведение ограничивается: новая версия может адаптироваться к инструментальным задачам, но не имеет права слишком сильно отклоняться от замороженной базовой модели. Это чем-то напоминает обучение человека, который уже хорошо знает тему: ему показывают не все возможные варианты, а лишь несколько ключевых приёмов, но при этом просят не забывать и старые знания.

Связка «небольшая выборка + один проход + низкая скорость обучения» выглядит рискованной, но именно она позволила модели Palmyra x6 аккуратно встроить новые сценарии без катастрофического забывания. А гибридный оптимизатор Muon + Adam добавляет к этому процессу ещё и вычислительную эффективность.

Показатели на бенчмарках

Эффект от такой доработки виден на публичных тестах. На бенчмарке BFCL Core модель достигает 0,785 — это лучший результат среди нескольких недавно выпущенных моделей, с которыми проводилось сравнение. Причём модель сильна не в каком-то одном упражнении: если рассчитать среднее значение по шести разным бенчмаркам, Palmyra x6 снова оказывается выше остальных участников когорты.

Отдельно стоит отметить оценку bias и safety. Резкое улучшение агентных способностей часто сопровождается ростом предвзятости или опасных ответов, но здесь этого не произошло. По показателям предвзятости и безопасности модель либо оказывается на уровне конкурентов, либо выходит вперёд. Для корпоративного использования это принципиально важно: компаниям нужны не только «умные», но и управляемые ассистенты.

Почему это важно для бизнес-агентов

Для компаний, которые строят собственных агентов, этот кейс — хороший сигнал. Дообучение не всегда требует многомиллионных датасетов и недель вычислительного времени. Иногда достаточно сфокусироваться на нескольких сотнях качественных, проверенных сценариев и применить технику, которая не даёт модели «съехать» с уже известного поведения.

Конечно, 626 траекторий не закрывают все возможные ситуации в реальной жизни. Но они задают правильный вектор: модель понимает, как нужно работать с инструментами, а базовые знания помогают ей обобщать эти паттерны на новые случаи. Это особенно ценно в корпоративных средах, где собрать большой набор реальных действий агента непросто из-за ограничений приватности и высокой стоимости экспертной разметки.

Именно поэтому Palmyra x6 стоит рассматривать не просто как очередное обновление, а как демонстрацию того, куда движется дообучение агентных LLM. А с учётом того, что модель уже показывает заметный прирост относительно предыдущей версии для Writer Agent, такие компактные, но аккуратные методики вполне могут стать новым стандартом для enterprise-агентов.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Palmyra x6: обзор якорной доработки корпоративной LLM