群体智慧受困于同质化
当需要预测未来的某些事情——市场行为、事件结果、技术的命运——一个简单的想法就会浮现:询问的模型越多,答案就越可靠。逻辑看似铁一般坚固:不同的系统会以不同方式犯错,因此取平均可以抹平随机误差。
但这个方案有一个陷阱。如果“群体”中的所有参与者都以相似的方式推理,他们的声音就不是独立的证据,而是同一个观点被复制增殖。十个几乎相同的答案与一个相比并不会增加信息量;它们只会制造一种确定感,并增加推理账单。
《Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction》这篇工作正是围绕这个问题展开的——由 Niruopam Chetlapalli、Yiming Liao、Min-Chun Chen 和 Keke Chen 完成。预印本 arXiv:2608.24001 于 2026 年 8 月 25 日发布,第二天就出了修订版,而论文本身已投稿至 IEEE BigData 2026。
仅仅“更多模型”并不能解决问题
作者的关键观察是:不同的大语言模型可能表现得过于相似。它们在可比的数据上训练,倾向于相似的措辞和典型的推理路径。结果,机械地扩大参与者名单并不能带来最初所追求的那种多样性。
这里重要的是区分两个概念。数量——是我们询问了多少模型。多样性——是它们得出答案的方式有多大差异。后者并不会自动从前者的产生:可以召集二十个参与者,却得到同一个想法的二十个变体。

方法:按推理风格而非答案来筛选模型
行为筛选是什么样的
作者提出了一个他们称之为行为导向的框架。核心不在于比较模型最终答案的正确性,而在于理解它们如何思考。
方案如下:
- 将每个模型在一组与未来预测无关的独立任务上运行。收集的与其说是答案,不如说是推理链——也就是那些 reasoning traces。
- 基于这些痕迹构建行为画像:模型采取哪些步骤、如何拆解任务、在哪里出错、诉诸哪些论据。
- 按行为相似性将模型聚类。为此使用 K-means++ 算法。
- 从每个聚类中取一个代表——中心点(medoid),即对其所属群体最具典型性的模型。
- 正是这个由中心点组成的紧凑“群体”给出集体预测。
仔细想想,这个想法并不新鲜——统计学中就是这样做的,当从相关特征中只保留一个代表,以避免重复同样的信息。这里的新颖之处在于,“特征”变成了语言模型的推理方式,而不是数值特征。
在什么上验证
实验建立在 25 个模型之上。七个开发基准用于描述和区分模型的行为,另外两个独立的基准——用于未来预测——用于评估所得“群体”的质量。这种划分是原则性的:用于构建画像的任务与用于计算结果的任务并不重合。否则就成了偷看式训练,数字几乎毫无意义。

结果:三个模型胜过二十五个
工作中最引人注目的是比较的结果。通过行为聚类组建的仅由三个中心点模型组成的“群体”,表现优于对全部 25 个模型进行普通投票。而且这对两个预测基准都成立。
同时节省相当可观:模型调用次数减少了 88%,推理成本约减少 80%。对实践而言,这几乎比精度提升本身更重要。预测系统往往卡住的不是答案的质量,而是它的成本:如果每个问题都需要询问二十来个模型,解决方案变得不划算的时间会远早于它变得不准确的时间。
由此得出一个不那么显而易见的结论:“群体”的构成比它的规模更重要。二十五个模型并不自动优于三个,如果这二十五个本质上是在互相重复的话。
并非任何多样性都同样有用
作者还得出另一个容易被忽略的细致结论。原来,重要的不是最大化多样性本身,而是代表性——即所选参与者在多大程度上反映了模型中存在的不同行为极端。
区别是原则性的。可以挑选三个彼此随机且在小事上不同的模型——得到的将是噪声而非信号。也可以从真正不同的行为群体中各选一个——得到一个覆盖解空间的紧凑集合。前者是杂七杂八,后者是异质多样。起作用的是后者。
这里不禁让人联想到普通的专家评审。一个好的委员会不是人更多的那一个,而是代表了不同方法和观点的那一个。来自不同领域的五位专家通常比同一院系的十五名毕业生更有用。
这在实践中意味着什么
对于那些基于语言模型构建预测服务的人来说,文章的结论给出了相当具体的配方:
- 不要追求模型名单的长度。 不分析行为就扩大模型池——等于为重复的答案付费。
- 先测量行为,再选择构成。 在无关任务上运行并聚类,可以清晰地看出集合中谁真正与众不同。
- 有意识地节省。 在保持或提升精度的同时将调用次数减少一个数量级,改变的是产品的经济性,而不仅仅是它的技术特性。
- 记住局限性。 所有这些都是在特定的 25 个模型集合和两个预测基准上验证的;不应将数字原封不动地套用到其他领域和其他模型上。
这篇工作的核心思想听起来几乎充满人性:集体意见的价值不取决于票数的多少,而在于这些声音是否真正不同。应用到语言模型上,这意味着需要测量的不是名单上的名字,而是思维方式——并据此组建团队。



