为什么LLM的偏好评分不可靠:大规模测试发现矛盾之处

29 八月 202610 视图

作者测试了六种语言模型在航班、公寓和酒店相关问题上的表现,发现关于支付意愿的数值答案系统性地相互矛盾。因此,这些评估无法用单一的效用函数来描述——这意味着在决策时依赖这些评估存在风险。

为什么LLM的偏好评分不可靠:大规模测试发现矛盾之处

为什么不应将LLM对偏好的判断视为金科玉律

现代语言模型能够对各种事物进行令人信服的推理,因此它们越来越多地被用作评估消费者偏好的“专家”。例如,人们会问ChatGPT,有多少人愿意为带行李的航班支付额外费用,或者地铁的邻近程度对他有多重要。这个想法看起来很诱人:如果模型足够了解人类的品味,那么就可以根据它的回答自动挑选商品、价格和服务。但如何验证这些评估是否真正反映了稳定的偏好,而不是随机的言辞?

一组研究人员决定从科学角度对此进行验证。他们没有仅仅看回答表面是否合理,而是提出了一个更严格的问题:能否用统一的效用函数来描述模型的回答?效用函数是一种对偏好进行排序的数学方法:如果它存在,那么所有回答都应当彼此一致。例如,如果你说愿意为缩短一小时路程额外支付500元,随后却选择了一个耗时更长且价格更高的选项——这本身就是矛盾。

方法:如何衡量不一致性

作者设计了统计检验方法,可以量化评估模型回答与最佳拟合效用函数之间的偏差程度。如果偏差很小,说明模型在偏好上几乎是一致的。如果偏差很大,则说明判断具有随机性或情境性,无法归结为统一的尺度。

实验在三种场景下进行:航班选择、公寓租赁和酒店预订。这些都是实际案例,其中支付意愿的评估对企业尤为重要。测试涉及六种不同的大型语言模型——这使得样本更具代表性。

结果:矛盾无处不在

结果表明,所有六种模型都给出了持续矛盾的答案。也就是说,如果以不同的表述方式提出相似的问题,它们很可能会选择彼此不兼容的选项。例如,模型可能表示停车位对它极为重要,但在比较两套具体公寓时,却拒绝为其支付额外费用,尽管此前它声称愿意这样做。

这种差异很难用误差来解释。研究人员强调,这更像是一种系统性特征:大型语言模型没有固定的“品味”,而是每次根据上下文和概率规律重新生成回答。因此,它们可以用于初步构思,但不能用于精确建模个体偏好。

为什么这对实践很重要

研究结果直接冲击了几个流行的理念。在行为经济学和市场营销中,越来越多的人提倡使用LLM进行自动个性化:假设模型通过用户的查询了解了其偏好,现在可以挑选最优方案。但如果模型自身的判断存在内在矛盾,那么任何基于这些判断的优化算法都会出现故障。

此外,这个问题也涉及研究方法本身。如果研究人员在调查中使用LLM来评估效用,他首先必须确保模型不会给出随机回答。否则,此类研究的结果将不可靠。

好消息是,作者不仅指出了问题,还提出了诊断工具——检验方法和偏差指标。这些工具已经可以用于验证新模型或改进现有模型。也许随着时间推移,会出现专门的训练方法来提高判断的自洽性。但现阶段,依赖LLM作为关于人们真实需求的可靠信息来源,还为时过早。

常问问题

为什么LLM的偏好评分不可靠:大规模测试发现矛盾之处