ScienceFlow:LLM代理如何在长期实验中学会将研究进行到底

11 九月 20264 视图

ScienceFlow新框架帮助AI代理在长达数小时的研究任务中不迷失目标:工作被分解为可恢复的片段,资源根据实际确认的进展进行分配。在MLE-bench上,它取得了已发布方法中的最佳成绩。

ScienceFlow:LLM代理如何在长期实验中学会将研究进行到底

长期研究:问题不在于单次查询

自主研究人员与普通聊天代理处于完全不同的现实之中。它需要提出假设、验证假设、发现错误、重写脚本、运行实验,有时还需要回退到之前的模型版本。这样的循环可能持续数小时,而每一步的价值只有到最后才能显现。

大多数自动研究代理在这方面都做得不好。连续性机制几乎不存在:如果实验陷入死胡同,代理不知道如何恢复丢失的线索。也没有根据当前结果的有用程度重新分配计算资源的功能。结果,搜索变得松散,计算资源被浪费,而将工作推进到底的可能性也随之降低。

新方法的运作方式

ScienceFlow框架正是为了解决这些问题而设计的。其作者——一个由19名研究人员组成的团队——提出了一种用于自主科学实验的端到端架构。代理并非“按单次提示”行动:它构建一条漫长的研究轨迹。

在内部,工作被划分为研究片段。每个片段都与一个可执行的工作空间绑定:脚本、数据和环境都存放在那里。研究进展不是零散的文本笔记,而是可恢复的可执行状态。这种状态可以从磁盘“加载”,重新研究、重新组装并再次运行。借助这一点,代理可以轻松回到过去的某个点并尝试另一条分支,而不是从头开始。

ESTRA:如何选择下一个分岔点

关键细节是通过ESTRA(可执行状态重锚定转换)机制实现状态间的转换。在每一步,代理都会查看两种状态:活跃状态(可以立即继续)和存档状态(已经产生了一些结果)。但它选择的不仅仅是一个新点,而是进一步移动的锚点。然后确定方案:是继续从该状态推进,还是将研究转向另一个方向。

这种方法解决了长期实验的主要痛点——“卡住”的代理效应,即代理因为不知道如何回退而继续深入无望的分支。

考虑结果执行的控制器

框架的另一层是考虑已确认结果的控制器。它根据三个因素在单个计算任务之间分配资源:算力可用性、剩余预算以及已确认的进展。如果某个方向不再产生可衡量的结果,控制器可以削减其份额,并将资源重新导向到真正能看到进展的地方。这不是一个“贪婪”的任务调度器,而是一种在目标范围内维持整体策略的方式。

测试显示了什么

在测试中,该框架不仅覆盖了经典的机器学习,还涵盖了科学建模和数学优化。获得的结果表明,该系统能够高效地进行长时间的研究会话,而不会将其变成一连串无休止的无关步骤。

最显著的结果是在24小时预算内完成完整的MLE-bench:Any-Medal指标达到70.22%。这比之前公布的结果高出4.92个百分点。考虑到MLE-bench测试的是真实的机器学习场景,这是一个强烈的信号:过程的稳健性有时比模型的原始智能更重要。

这对自主科学意味着什么

论文作者提出了一个重要结论:对于扩展自主研究,状态管理、自适应探索以及与目标一致的执行具有决定性意义。仅仅拥有出色的推理能力是不够的——还需要一个不让代理丢失先前成果并帮助其及时转向的基础设施。

这似乎是LLM助手向真正自主研究系统迈进的下一步。在长周期上的工作不再“与模型的简短对话”,而是变成一个工程问题:如何构建一个过程,使每个版本的实验都保持可访问,每个结果都得到验证,而每一步都源于已确认的进展。

常问问题

ScienceFlow:LLM代理如何在长期实验中学会将研究进行到底