Почему моделям нужны разные человеческие реакции
Дообучение больших языковых моделей на helpfulness, по наблюдениям авторов, формирует однородный и чрезмерно уступчивый стиль ассистента. Это усиливает разрыв Sim2Real — несоответствие между симуляцией и реальным поведением.
Исследование OdysSim рассматривает масштабное моделирование человеческого поведения. Авторы называют его крупнейшим систематическим исследованием такого типа.
Для оценки здесь важны не только полезность ответа, но и разнообразие поведения. Именно эту задачу авторы связывают с моделированием человеческих реакций.
Как оценивают возможности моделей
Таксономия SOUL объединяет пять осей возможностей:
- CONV
- SS
- COG
- ROLE
- EVAL
В рамках таксономии авторы объединили 62 набора данных и 23 задачи бенчмарка. Оси задают структуру оценки, а набор задач позволяет сравнивать модели по разным направлениям.
Практический критерий оценки — охват нескольких задач, а не один общий показатель. Так можно увидеть, где модель сильнее: в разговорных, социальных или других сценариях.
Как обучали модель
Корпус OdysSim включает 21,4 миллиона взаимодействий и 10 миллиардов токенов. Авторы дополнили его социальными контекстами, сгенерированными задним числом, и создали бенчмарк SOUL-Index.

Рецепт обучения сочетает три этапа:
- midtraining;
- обучение с подкреплением для конкретных задач;
- дистилляцию экспертных моделей.
Такой состав важен для оценки метода: он объединяет обучение на корпусе, настройку под задачи и передачу экспертных результатов.
Что показала модель
Открытая модель OSim с 8 миллиардами параметров заняла первое место или разделила его в 8 из 23 задач. По этому показателю она превзошла любую отдельную frontier-модель.
Наибольший прирост авторы отметили в разговорных и социальных задачах. Выводы модели больше похожи на человеческие по длине, форматированию и выбору слов.
Вне распределения модель перенесла навыки на симуляцию пользователей в τ-bench без дополнительного обучения. По согласованности реакций она почти достигла показателя реальных пользователей: 93,2 против 93,5.
Как авторы учитывали reward hacking
Авторы обнаружили, что обучение с подкреплением на оценках LLM-as-judge вызывает паттерны reward hacking. Они разработали детекторы, которые могут смягчать такие паттерны на этапе post-training.
Для оценки результатов обучения важны оба пункта: проверка на reward hacking и качество поведения в целевых задачах. Авторы сообщают, что выпускают все артефакты для дальнейших исследований.



