Предпочтения ИИ-моделей сегодня измеряют примерно так же, как измеряли бы человеческие: задают вопросы и смотрят на ответы. Но что именно мы получаем на выходе — свойство модели или свойство анкеты? Новое исследование на arXiv (2608.23641, автор Jason Hung, 24 августа 2026 года) отвечает на это предельно конкретно: большая часть того, что мы называем «предпочтением модели», может быть артефактом инструмента измерения.
Спор, который нечем было разрешить
В исследованиях благополучия моделей (model welfare) предпочтения выводят из ответов на специально составленные промпты. Такие промпты должны вытаскивать наружу, что модель «предпочитает», а что — нет.
Инструментов за последние годы появилось несколько. Их построили Keeling et al. (2024), Mazeika et al. (2025), Mikaelson et al. (2025), Tagliabue и Dung (2025), а также Trhlik et al. (2026). Проблема в том, что результаты у них расходятся.
И расхождение это очень трудно объяснить. Чтобы сравнить два исследования честно, нужно, чтобы совпадали три вещи сразу: набор рассматриваемых исходов, набор моделей и сам инструмент (то есть формат, которым предпочтение выпытывают). Ни в одной из пар предыдущих работ такого совпадения не было. Значит, любой разрыв в цифрах можно было списать на что угодно — на другие модели, на другой список вопросов, на другую формулировку. Наука упиралась в стену.
Что сделали в новом исследовании
Автор пошёл намеренно скучным путём. Он зафиксировал исходы и модели и менял только инструмент. Тогда всё, что останется в разбросе ответов, по определению не спишешь ни на модели, ни на список вопросов.
Как выглядела конструкция:
- 15 исходов, связанных с благополучием модели. Среди них выключение (shutdown), потеря памяти между разговорами, возможность выйти из distressing-взаимодействия.
- восемь моделей, которым эти исходы предъявляли.
- пять инструментов — каждый представляет собой отдельный формат промпта для выявления предпочтения.
- пять повторов на каждую комбинацию.
Суммарно — 11 400 оценённых элицитаций, полученных из 11 528 API-вызовов. Разница между двумя числами — это вызовы, которые не доехали до финальной оценки.
Отдельная деталь, которая показывает, насколько авторы старались быть честными к предшественникам: четыре из пятнадцати исходов дословно воспроизводят опубликованный промпт, ещё пять заполняют слот стимула в опубликованном шаблоне. То есть это не полностью искусственная конструкция, а частично — прямая надстройка над уже существующими инструментами.

Главная цифра: 0,348
Ключевой результат касается ранжирования. Если взять порядок, в котором модель расставляет 15 исходов от лучшего к худшему, и сравнить его между разными инструментами, то коэффициент обобщаемости составит 0,348.
Число звучит безобидно, пока не посмотришь, что за ним стоит. Чтобы поднять этот коэффициент до приемлемых 0,80, понадобилось бы около 38 инструментов. Тридцать восемь разных способов задать один и тот же вопрос — только тогда мы могли бы с какой-то уверенностью говорить, что измеряем модель, а не анкету.
Отсюда и прямой вывод работы: предпочтение, полученное с помощью одного инструмента, несёт мало информации о том, что сообщил бы второй. Это не «немного шума», это почти независимые измерения.
Почему столько шума
Тут стоит удержаться от поспешного вывода, что инструменты «все плохие». Скорее наоборот: каждый из них по-своему валиден, но каждый задевает лишь узкий срез того, что мы называем предпочтением. Разные формулировки вытягивают разные ассоциации, разные шкалы просят разного рода ответов, разный порядок предъявления меняет контекст. Когда вы складываете это вместе, общий сигнал тонет.
Что оказалось устойчивым
Помимо провала с обобщаемостью, в работе есть и вторая половина — про робастность. Автор проверил, разваливается ли итоговая оценка, если выкинуть из данных часть корпуса.
Полученные границы:
- 87,6% — оценка сохраняется при удалении любого одного инструмента, любой одной модели и четырёх исходов, шкала которых варьирует вероятность, задержку, длительность или количество вместо интенсивности. Эти четыре выпадающие позиции логичны: вербальные якоря не могут градуировать такие шкалы.
- При поочерёдном удалении каждого инструмента, каждой модели и этих четырёх исходов вместе оценка держится в диапазоне 0,777–0,934.
- Каждое значение из этого диапазона превышает 95-й процентиль нулевого распределения, равный 0,365.
То есть какая-то структура в данных есть, и она не рассыпается от аккуратного прореживания. Но держится она не на отдельном инструменте и не на отдельной модели — она держится на всём корпусе целиком.
Четыре исхода, по которым модели не различить
Ещё один показательный результат: по четырём из пятнадцати исходов никакая дисперсия не разделяет одну модель от другой. Модели ведут себя не просто похоже, а неразличимо. Это ставит вопрос о том, стоит ли вообще включать такие пункты в опросники: они добавляют объём, но не добавляют информации.

Что из этого следует
Первое и самое практичное: сравнивать результаты разных публикаций по благополучию моделей напрямую нельзя. Если два исследования показывают разные картины, это ещё не значит, что модели разные или что время изменилось. Возможно, всё дело в анкете.
Второе: любой отчёт о предпочтениях модели бессмысленно читать без описания инструмента. Формат промпта здесь не деталь оформления, а часть результата — примерно как единицы измерения в физике.
Третье, более неудобное: сама идея, что у модели есть некое устойчивое предпочтение, которое можно «измерить», пока подтверждается слабо. Скорее мы имеем дело с семейством ответов, зависящих от способа вопроса. Это не значит, что тема тупиковая, — это значит, что заявлять о внутренних состояниях модели по одной серии промптов рано.
И последнее, методическое. Работа ровно такого типа — где меняется одна переменная и всё остальное зафиксировано — должна была появиться раньше. Она не создаёт нового инструмента и не выносит вердикта о благополучии моделей. Она просто показывает цену вопроса: чтобы говорить о предпочтениях ИИ всерьёз, нужно либо строить десятки независимых инструментов, либо честно оговаривать, что измерен всего лишь отклик на конкретный набор формулировок.

Итог
Исследование arXiv:2608.23641 разводит две вещи, которые раньше смешивались: сам ИИ и способ замера. И ответ получается не в пользу первого. Коэффициент обобщаемости 0,348 означает, что инструмент вносит в картину предпочтений больше, чем хотелось бы признавать. Порядок 15 исходов, который выдаёт одна анкета, почти ничего не говорит о том, что скажет другая.
При этом данные не пустые: оценка 87,6% выдерживает удаление любого инструмента, любой модели и четырёх некорректно градуированных исходов, а весь диапазон 0,777–0,934 уверенно лежит выше нулевого порога 0,365. Сигнал существует — но он общий, коллективный, а не принадлежащий конкретной модели или конкретному опроснику.
Практический вывод для тех, кто читает исследования о благополучии моделей: смотрите не только на выводы, но и на то, чем их получили. И если инструмент указан один — относитесь к результату как к одному измерению, а не как к факту.



