क्यों LLM से प्राप्त प्राथमिकता रेटिंग्स को विश्वसनीय नहीं माना जा सकता: बड़े पैमाने पर परीक्षण में विरोधाभास सामने आए

29 अगस्त 202610 बार देखा गया

लेखकों ने उड़ानों, अपार्टमेंटों और होटलों के बारे में सवालों पर छह भाषा मॉडलों का परीक्षण किया और पाया कि भुगतान करने की इच्छा के बारे में संख्यात्मक उत्तर व्यवस्थित रूप से एक-दूसरे के विपरीत हैं। इस वजह से, ऐसे अनुमानों को एक उपयोगिता फ़ंक्शन द्वारा वर्णित नहीं किया जा सकता — और इसलिए, निर्णय लेते समय उन पर भरोसा करना जोखिम भरा है।

क्यों LLM से प्राप्त प्राथमिकता रेटिंग्स को विश्वसनीय नहीं माना जा सकता: बड़े पैमाने पर परीक्षण में विरोधाभास सामने आए

Почему суждения LLM о предпочтениях не стоит принимать за чистую монету

Современные языковые модели умеют убедительно рассуждать о самых разных вещах, поэтому их всё чаще привлекают в качестве «экспертов» для оценки потребительских предпочтений. Например, спрашивают у ChatGPT, сколько человек готов заплатить за перелёт с багажом или насколько важна для него близость к метро. Идея выглядит заманчиво: если модель достаточно хорошо знает человеческие вкусы, то на основе её ответов можно автоматически подбирать товары, цены и услуги. Но как проверить, что такие оценки действительно отражают устойчивые предпочтения, а не случайные слова?

Группа исследователей решила проверить это с научной точки зрения. Вместо того чтобы просто посмотреть, логичны ли ответы на первый взгляд, они задались более строгим вопросом: можно ли вообще описать ответы модели единой функцией полезности? Функция полезности — это математический способ упорядочить предпочтения: если она существует, то все ответы должны быть согласованы между собой. Например, если вы говорите, что готовы доплатить 500 рублей за дополнительный час сокращения пути, а затем выбираете вариант, который дольше и при этом дороже, — это уже противоречие.

Методика: как измерить несогласованность

Авторы разработали статистические тесты, которые позволяют количественно оценить, насколько ответы модели отклоняются от наилучшим образом подобранной функции полезности. Если отклонения малы, значит, модель почти последовательна в своих предпочтениях. Если велики — значит, суждения носят случайный или ситуативный характер, и сводить их к единой шкале нельзя.

Эксперименты проводились на трёх типах сценариев: выбор авиаперелёта, аренда квартиры и бронирование отеля. Это практичные случаи, где оценка готовности платить особенно важна для бизнеса. В тестировании участвовали шесть разных больших языковых моделей — от этого выборка ещё более показательная.

Результаты: противоречия повсюду

Оказалось, что все шесть моделей дают устойчиво противоречивые ответы. То есть, если задать им похожие вопросы в разных формулировках, они с высокой вероятностью выберут варианты, которые не сочетаются друг с другом. Например, модель могла указать, что для неё крайне важно наличие парковки, но при сравнении двух конкретных квартир отказаться доплачивать за неё, хотя ранее заявляла о своей готовности.

Такие расхождения сложно объяснить погрешностью. Исследователи подчёркивают, что это скорее системное свойство: большие языковые модели не имеют зафиксированных «вкусов», а каждый ответ генерируют заново, ориентируясь на контекст и вероятностные закономерности. Поэтому их можно использовать для черновых идей, но не для точного моделирования индивидуальных предпочтений.

Почему это важно для практики

Полученные результаты бьют сразу по нескольким популярным идеям. В поведенческой экономике и маркетинге всё чаще говорят о том, чтобы использовать LLM для автоматической персонализации: предположим, что модель узнала предпочтения пользователя по его запросам и теперь может подбирать оптимальные предложения. Но если суждения самой модели внутренне противоречивы, то любые оптимизационные алгоритмы, построенные на них, будут давать сбои.

Кроме того, эта проблема касается и самих методологий исследования. Если исследователь использует LLM для оценки полезности в опросах, ему придётся сначала убедиться, что модель не даёт случайных ответов. В противном случае результаты такого исследования окажутся недостоверными.

Хорошая новость в том, что авторы не просто указали на проблему, но и предложили инструменты для её диагностики — тесты и показатели отклонения. Ими уже можно пользоваться для проверки новых моделей или при доработке существующих. Возможно, со временем появятся специальные методы обучения, которые повысят самосогласованность суждений. Но пока рано полагаться на LLM как на надёжный источник информации о том, чего на самом деле хотят люди.

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
क्यों LLM से प्राप्त प्राथमिकता रेटिंग्स को विश्वसनीय नहीं माना जा सकता: बड़े पैमाने पर परीक्षण में विरोधाभास सामने आए