新GIM基准:在多种认知技能交汇处检验LLM

10 九月 20267 视图

研究人员提出了一种评估模型的方法,该方法不依据知识量或脱离现实,而是通过同时需要推理、上下文控制和约束处理的任务来评估。该基准测试包含820个原创任务,其作者还研究了“思考”设置及其他模型参数对结果的影响。

新GIM基准:在多种认知技能交汇处检验LLM

LLM基准测试的走向

现代大语言模型测试正逐渐失去意义:模型得分很高,而它们之间的差异却越来越不具参考价值。一项新研究的研究者认为,原因在于基准测试的复杂化方式。目前流行两种策略:要么像GPQA或HLE那样增加高度专业化知识的体量,要么像ARC-AGI那样转向抽象逻辑。第一种方法有个问题:高分可能源于对事实的记忆,而非真正的理解。第二种方法则相反,它将推理与实际情境割裂开来——这类任务与现实世界中模型会遇到的情况相去甚远。

新的基准测试GIM(Grounded Integration Measure,落地整合度量)提出了第三条路径。其研究者认为,难度不应来自博学或谜题,而应来自在公共知识基础上同时调动多种不同认知技能的需求。

GIM是如何设计的

该测试集包含820道原创题目:其中615道对所有人开放,205道为私有题目,保持隐藏以防止针对性训练。重要的是,每道题都是原创组合,而非对现有问题的改写。

难度并非来自冷门事实,而是来自操作的协调。例如,在某道题中,模型可能需要同时:

  • 满足多个约束条件;
  • 追踪一个不断变化的过程状态;
  • 表现出认知警觉性,即理解哪些来源和陈述可以信赖;
  • 根据特定受众调整回答。

同时,所有任务都基于公共知识——模型无需成为某一狭窄领域的专家。因此,这检验的不是记忆力,而是将不同技能整合起来并在现实情境中加以运用的能力。

答案主要通过评分细则进行评估:结果被分解为各个组成部分,每个部分独立评分。这降低了模型因部分正确的回答而获得满分的可能性。

模型是如何评估的

研究者并未仅仅依赖正确回答的比例。相反,他们采用了一种连续的双参数IRT模型——一种来自心理测量学的方法,同时考虑模型能力和任务难度。该模型在53种测试配置(即“模型×思维水平”的唯一组合)上进行了校准。为此,他们引入了五位经过专门校准的评审。

总共收集了超过一百万条原始评审观测数据,随后将其聚合为203,800个数据单元。这一流程能得出稳健的能力估计值,不会因原始准确率的典型偏差(如评审的严格或宽松、数据缺失、不同模型的非均匀误差)而失效。即使在存在此类噪声的情况下,最终得分也能正确地对测试配置进行排序。

基于这些计算,研究者构建了一个排行榜,包含22个模型和47个官方报告配置。

思考时间的作用

研究者还专门考察了推理期间的计算预算(即test-time compute)所产生的影响。这是针对固定基准测试所发表的同类研究中规模最大的一项:涵盖11个模型和35种测试配置。

结论在很大程度上因实验设计而出人意料。同族模型内部的设置——例如思考令牌的预算或量化——对结果的影响不亚于模型本身的选择。也就是说,你可以使用同一个模型,改变其思维参数,就能获得与切换到另一个更强大模型相当的差异。

不过,也存在一个重要限制:增加推理令牌数量会带来递减的边际收益。超过某个阈值后,进一步的计算几乎不会改善答案。这意味着,无限延长“思考时间”是低效的——需要在预算与质量之间寻求平衡。

结论

描述GIM的论文于2026年发表在arXiv上,并成为社区中的一件大事:共61页、27张图、4张表。该基准测试的代码和数据均已开源,因此任何研究者都可以运行自己的模型,并与已发表的结果进行比较。

GIM的核心思想不在于通过事实或抽象概念让测试变得更难,而在于让任务更贴近现实——在现实中,不同的认知技能是协同工作的。或许,正是这样的基准测试,才能让我们评估的不只是“记忆能力”或“在真空中逻辑思考的能力”,而是模型在复杂场景中的实际效用。

常问问题

新GIM基准:在多种认知技能交汇处检验LLM