ScienceFlow:LLM代理如何在长期实验中学会将研究进行到底
ScienceFlow新框架帮助AI代理在长达数小时的研究任务中不迷失目标:工作被分解为可恢复的片段,资源根据实际确认的进展进行分配。在MLE-bench上,它取得了已发布方法中的最佳成绩。

39 材料
ScienceFlow新框架帮助AI代理在长达数小时的研究任务中不迷失目标:工作被分解为可恢复的片段,资源根据实际确认的进展进行分配。在MLE-bench上,它取得了已发布方法中的最佳成绩。

研究人员提出将Text-to-SQL领域视为一个综合排行榜,其中结果按模型在生成SQL查询时的自主程度进行分布。他们在Spider上进行了测量,并表明成功并不总能迁移到其他基准测试中,而自主性虽然带来了稳定性,但需要显著的计算资源。

最新基准测试提供了100个基于运营商真实数据(网站、SQL数据库和网络存档)构建的英语和阿拉伯语问答场景。在12个模型上的测试显示,即使是最优秀的模型也仅能解决71%的任务,而在视觉类别的表现则降至30%以下。

研究人员提出了一种评估模型的方法,该方法不依据知识量或脱离现实,而是通过同时需要推理、上下文控制和约束处理的任务来评估。该基准测试包含820个原创任务,其作者还研究了“思考”设置及其他模型参数对结果的影响。

研究人员发现大型语言模型在安全性方面存在严重的跨语言偏差:其对齐主要针对英语进行优化,因此在其他语言中,模型更容易绕过限制并复现有害偏见。新的基准测试INCLUDE在十种模型和六种印度语言上进行了测试,结果显示偏见水平因语言和模型类型的不同而显著差异。

作者提出了一种决策支持系统原型,该系统分析飞行日志中的六项指标,并将其转换为螺旋桨状态变质指数。在基于DronePropA数据的回顾性实验中,该系统正确区分了健康案例与三个故障等级,并提示何时需要进行检查或维护。

Stripe首席执行官称这笔交易是迈向奇点的一步,然而真实动机要务实得多:通过模型路由器,该公司得以触及开发者的AI预算,并打造新的现金流中心。

作者提出了一种对开放权重模型进行无门槛审计的方法,基于工件内部一对互补信号。在273个检查点上的测试中,该方法达到了0.95的AUROC,但仍只是分流手段,而非针对故意规避的防护。

研究人员从真实Python项目中收集了超过1.1万个基于属性的测试,并自动将其转化为数千条Lean 4形式化规范。由此产生的开放基准测试可用于评估模型和智能体在验证真实代码方面的表现。
