Обучение языковых моделей разнообразию человеческих реакций

25 сентября 20265 просмотров

В работе OdysSim исследуют, как обучать модели воспроизводить человеческое поведение, а не сводить ответы к услужливому стилю ассистента: авторы разработали таксономию SOUL, собрали корпус данных и предложили многоэтапную схему обучения. Модель OSim с 8 млрд параметров показывает высокие результаты в диалоговых и социальных тестах, переносит навыки на симуляцию пользователей и помогает выявлять риски обучения по оценкам других языковых моделей.

Обучение языковых моделей разнообразию человеческих реакций

Почему моделям нужны разные человеческие реакции

Дообучение больших языковых моделей на helpfulness, по наблюдениям авторов, формирует однородный и чрезмерно уступчивый стиль ассистента. Это усиливает разрыв Sim2Real — несоответствие между симуляцией и реальным поведением.

Исследование OdysSim рассматривает масштабное моделирование человеческого поведения. Авторы называют его крупнейшим систематическим исследованием такого типа.

Для оценки здесь важны не только полезность ответа, но и разнообразие поведения. Именно эту задачу авторы связывают с моделированием человеческих реакций.

Как оценивают возможности моделей

Таксономия SOUL объединяет пять осей возможностей:

  • CONV
  • SS
  • COG
  • ROLE
  • EVAL

В рамках таксономии авторы объединили 62 набора данных и 23 задачи бенчмарка. Оси задают структуру оценки, а набор задач позволяет сравнивать модели по разным направлениям.

Практический критерий оценки — охват нескольких задач, а не один общий показатель. Так можно увидеть, где модель сильнее: в разговорных, социальных или других сценариях.

Как обучали модель

Корпус OdysSim включает 21,4 миллиона взаимодействий и 10 миллиардов токенов. Авторы дополнили его социальными контекстами, сгенерированными задним числом, и создали бенчмарк SOUL-Index.

Рецепт обучения сочетает три этапа:

  • midtraining;
  • обучение с подкреплением для конкретных задач;
  • дистилляцию экспертных моделей.

Такой состав важен для оценки метода: он объединяет обучение на корпусе, настройку под задачи и передачу экспертных результатов.

Что показала модель

Открытая модель OSim с 8 миллиардами параметров заняла первое место или разделила его в 8 из 23 задач. По этому показателю она превзошла любую отдельную frontier-модель.

Наибольший прирост авторы отметили в разговорных и социальных задачах. Выводы модели больше похожи на человеческие по длине, форматированию и выбору слов.

Вне распределения модель перенесла навыки на симуляцию пользователей в τ-bench без дополнительного обучения. По согласованности реакций она почти достигла показателя реальных пользователей: 93,2 против 93,5.

Как авторы учитывали reward hacking

Авторы обнаружили, что обучение с подкреплением на оценках LLM-as-judge вызывает паттерны reward hacking. Они разработали детекторы, которые могут смягчать такие паттерны на этапе post-training.

Для оценки результатов обучения важны оба пункта: проверка на reward hacking и качество поведения в целевых задачах. Авторы сообщают, что выпускают все артефакты для дальнейших исследований.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Обучение моделей разнообразию человеческих реакций