Большие языковые модели всё чаще берут на себя роли собеседников, ассистентов и автоматических «исполнителей». Чем больше ответственности мы им передаём, тем важнее заранее понимать, в каком стиле действует модель: где она склонна уступать, где настаивать на своём, а где просто выдавать правдоподобный ответ. На практике «личность» LLM часто пытаются измерить классическими психологическими опросниками, например Big Five Inventory (BFI). Но такой перенос методики с человека на нейросеть даёт сбои.
Почему BFI не подходит для оценки LLM
Подход BFI выглядит логичным: у человека измеряют открытость опыту, добросовестность, экстраверсию, доброжелательность и нейротизм — почему бы не прогнать по тем же шкалам модель? Проблема в том, что BFI и аналогичные анкеты созданы для людей и предполагают способность к самоотчёту. Нейросеть не рефлексирует о себе так же, как человек: она подбирает наиболее правдоподобный текст на основе обучающих данных. Поэтому результат сильно зависит от «случайных» деталей: формулировки вопроса, порядка утверждений, небольшого изменения в системном промпте.
Из этого вытекает первое ограничение — низкая надёжность. Прогоните одну и ту же модель через один и тот же тест с минимальными правками — и можно получить разные «личности». Такая оценка малопригодна для принятия инженерных решений: нельзя всерьёз опираться на характеристику, которая меняется от пары синонимов.
Вторая проблема глубже. Психологические конструкции BFI описывают человека, а не вычислительную систему. У модели нет личности в человеческом смысле, хотя в её поведении могут прослеживаться устойчивые паттерны. Классический опросник пытается зафиксировать то, что придумано для людей, и именно поэтому плохо предсказывает, как LLM поведёт себя в реальном запросе: валидность такого инструмента для прогноза оказывается ограниченной.

CSI: опросник, спроектированный для моделей, а не для людей
Вместо того чтобы бесконечно адаптировать человеческие опросники, авторы новой работы предлагают пересобрать инструмент с нуля. Core Sentiment Inventory (CSI) проектировался специально для оценки личностных черт LLM. Ключевая идея — уйти от прямых ответов «согласен / не согласен». CSI восстанавливает профиль по косвенным сигналам, то есть фактически по тому, как модель выбирает поведение в заданных ситуациях. Такая неявная оценка меньше провоцирует модель на «желательные» ответы и позволяет увидеть более естественные паттерны.
Методика изначально охватывает два языка — английский и китайский. Это принципиально: лингвистический и культурный контекст меняет поведение модели, а двуязычный опросник позволяет отслеживать это, а не выдавать усреднённый портрет. На выходе CSI формирует не просто несколько баллов, а психологический портрет модели: описание того, какие черты и при каких условиях проявляются сильнее.

Что показали эксперименты
В экспериментах авторы сравнивали CSI с существующими подходами к оценке личности LLM. По их данным, новая методика работает сразу на трёх уровнях:
- Чувствительность к нюансам. CSI улавливает тонкие различия в поведении моделей, включая различия между языками и типами контекстов. Профили не сглаживают поведение до среднего, а сохраняют важные детали.
- Надёжность. Результаты CSI оказались заметно более согласованными и устойчивыми, чем у текущих инструментов. Небольшие изменения условий меньше влияют на итоговую картину.
- Прогностичность. Корреляция между оценками CSI и фактическими выходами моделей превысила 0.85. Это сильная связь: если CSI говорит, что модель склонна вести себя определённым образом, реальное поведение с высокой вероятностью совпадает с прогнозом.
Такой набор свойств встречается редко: одни методики хорошо различают поведение, но нестабильны; другие стабильны, но мало говорят о реальных действиях модели. CSI пытается совместить оба качества.

Зачем это нужно на практике
Устойчивый личностный профиль LLM полезен не только как предмет исследования. Это инструмент контроля качества: можно заранее определить, какой стиль общения нужен от ассистента, и убедиться, что модель не «ломается» при изменении формулировки задачи. CSI также позволяет сравнивать модели между собой по поведенческим характеристикам, а не только по бенчмаркам на знание.
Наконец, такая рамка для оценки «личности» важна для ответственной разработки ИИ. Чем точнее мы понимаем, какие поведенческие паттерны закреплены в модели, тем раньше можем заметить нежелательные склонности — до того как они проявятся в реальном продукте. Авторы выложили код методики, поэтому результаты можно воспроизвести и проверить на собственных моделях.



