经济高效地配置LLM代理以应对关键基础设施:按需分配资源,而非“一刀切”

27 八月 202613 视图

研究人员提出,应根据具体任务来配置LLM代理的访问权限和工具,而不是一次性开放所有能力。这种方法在保持准确性的同时减少了令牌消耗,并表明不同领域在质量与成本之间各有其平衡点。

经济高效地配置LLM代理以应对关键基础设施:按需分配资源,而非“一刀切”

字段:内容 目标语言:中文(zh)

引言:过度配置的问题

现代LLM智能体越来越多地接管关键基础设施的管理——从冷却系统到电网。但要让智能体能够工作,它需要一个环境,这个环境决定了可访问的数据、工具和允许的操作。在大多数系统中,这个环境对所有任务都是一样的:完整的权限集、所有可用信息、所有可能的功能。

这种方法看起来通用,但它有明显的缺点。首先,这是额外的成本:每次对完整工具集的请求都会处理大量数据,消耗token和时间。其次,过多的能力可能会造成干扰:智能体可能会在多余的信息中“迷失”,或者选择错误的工具。第三,当智能体同时拥有所有访问权限时,权限管理和安全性也会受到影响。

方法:任务资源与能力的匹配

研究人员的核心思想是将harness配置视为资源匹配问题。每个任务对数据、工具和操作都有要求,而环境则提供可用的能力。需要找到最优的匹配,而不是给出“包打天下”的最大集合。

为此,管理关键基础设施时出现的任务会根据受控系统的数学描述进行分类。例如,液体冷却中的温度控制任务不同于电网中的负载平衡任务:它们有不同的参数、时间尺度和风险。

反过来,harness配置根据它们提供给智能体的信息的数量和类型进行排序。这样就为每个任务类别形成了可能的“自由度”地图。

匹配映射从何而来

“任务—harness”映射通过两种方式构建。第一种是分析专业文献:智能体在解决特定任务时通常使用什么?第二种是在受控实验中测量智能体的实际行为:什么真正需要,什么不影响结果。这比纯粹的理论假设提供了更可靠的基础。

受控升级算法

基于这些映射,作者提出了map-guided escalation算法。智能体首先获得与其任务在映射中对应的最小权限集。完成工作后,智能体进行自我检查:资源是否足够,任务是否正确解决?如果自我检查显示失败,harness就会扩展——可能到下一个级别,或者到完整级别。这个循环一直重复,直到任务成功解决或达到最大值。

这种方法的美妙之处在于,它不需要为每个任务预先选择配置——升级是自动发生的,并且只在必要时发生。简单任务几乎总是用最小配置解决,而复杂任务则根据需要获得额外资源。

实验:测试显示了什么

研究人员在两个场景中验证了这种方法。在液体冷却中,使用新方法时智能体的准确率为0.715,高于完整配置时的0.652。同时,token消耗几乎减少了一半——节省了48%。此外,准确率与已知的Reflexion自我修正方法相当,但没有其高昂的成本。

在电网中,结果有所不同。完整工具集仍然提供最高准确率,因此如果质量至关重要,放弃它并不明智。然而,基于映射的配置提供了更便宜的替代方案——适用于可以接受小幅质量下降以换取资源节省的任务。

结论与实践建议

主要结论:不存在适用于所有情况的唯一正确配置。每个领域都有自己的帕累托边界——准确率与成本之间的最优平衡。对于某些领域,经济型配置胜出,对于其他领域,完整配置仍然是必要的。

实践者应该:

  • 构建并维护任务与harness的匹配映射;
  • 从最小充分配置开始,仅在自我检查失败后扩展;
  • 不要“平均地”做最优决策,而是针对具体领域做决策。

这种方法有助于在冗余不合理的地方节省资源而不损失质量,并在确实需要时保留完整配置。

常问问题

经济高效地配置LLM代理以应对关键基础设施:按需分配资源,而非“一刀切”