现代大型语言模型在需要回忆和应用现有人类知识的任务上表现出色。但真正智能的系统应当能够超越已学内容:提出尚未有人问过的问题,并将猜想转化为可验证的科研成果。正是这种能力——更准确地说,是当前AI在这方面的缺失——被一个名为ASI-Bench的新基准测试决定性地加以衡量。
从知识复现到知识创造
研究人员早已注意到,现代模型被训练用于压缩和组合海量人类数据中的信息。然而,在作者的理解中,超级智能不仅仅是更强大的“复述者”,而是一个能够自主探索未知领域并产生新知识的系统。传统测试几乎总是局限于检验模型复现所学信息的准确程度,以及其遵循人类详细指令的能力。它们无法回答一个关键问题:AI能否像独立科学家一样行动?
在这种情况下,需要一种根本不同的工具来专门检验科学创造力与自主性——而ASI-Bench正是这一方向上的第一步。

基准测试的构成
新测试的开发耗时超过31,000个人工时,由40多位专家协作完成。最终,基准测试包含来自11个科学领域的60项项目式研究任务——从自然科学到工程学科。每项任务都设计为一个小型研究项目,要求完成从初始假设到可验证结果的完整工作流程。
ASI-Bench的关键特点在于逐步移除方法论支持。针对每项任务,作者准备了多个层级的指导:从每一步都详细说明的最大化指导,到要求智能体自行选择方法甚至确定研究方向的设定。这样一来,测试能够揭示AI在无人提示的情况下能走多远。
为排除错误和“死记硬背”式作答,所有任务都经过多阶段审核:专家评审、另一AI系统的审计、隔离沙箱中的执行,以及评分结果的独立验证。这使得结果比常规测试更加可靠。

初步结果:对人类的依赖
作者将18种“智能体—模型”配置(均为当前最先进水平)运行于所有层级的任务上。结果颇具说明性。在完整方法论指导下,平均得分为50.91;当仅保留方法给智能体时,降至29.10;而当模型需要自行确定方法时,得分进一步跌至26.62。
这种急剧下降表明,即便是最先进的系统,目前也尚未准备好在没有人类详细提示的情况下开展端到端的科学研究。它们在执行明确设定的步骤方面表现出色,但一旦需要主动承担起责任,便会明显迷失方向。这对所有期待超级智能即将到来的人而言是一个重要信号:知识复现领域的进步并不等同于自主科学探索的进步。
开放平台与后续步骤
开发者已将ASI-Bench向科学界开放,并邀请全球研究人员添加新任务。这将有助于扩展领域和场景的覆盖面,使基准测试更加完善。此外,测试的开放性使得能够动态追踪AI系统的进展:当前结果很可能成为与未来模型比较的起点。
尽管目前指标尚不高,这项研究的主要结论并非失望,而是诞生了一种工具,它首次能够衡量AI那种“研究性”品质。接下来,就看新模型和智能体架构能否缩小在指导下执行与自主科研之间的差距。



