FinSkillBench:在投资型AI代理中,现成的程序性技能有时比模型选择更重要

9 九月 20262 视图

新基准测试评估语言代理在投资组合优化、风险管理和基本面分析中的表现。在九种模型上,预先构建的技能包显著提升了平均结果,而代理自行创建技能几乎未带来收益。

FinSkillBench:在投资型AI代理中,现成的程序性技能有时比模型选择更重要

FinSkillBench评估什么以及为什么评估

在比较用于投资管理的AI代理时,很容易沉迷于语言模型的选择:参数更多、架构更新、在常规测试中得分更高。但FinSkillBench建议从另一个角度看待问题:代理究竟有多擅长使用金融程序性技能——即那些将知识转化为行动的分步指令和可执行组件。

该基准涵盖投资工作的三个关键领域:

  • 投资组合构建
  • 风险管理
  • 基本面分析

在这些领域内,作者收集了12个子任务和2603个片段。每个片段都是一个带有特定时间点数据、隐藏正确答案以及需要代理转化为行动的表述的任务。也就是说,测试的不是模型的记忆,而是它在正确时机应用正确程序的能力。

代理的三种工作模式

为了弄清技能究竟能带来什么,作者比较了代理行为的三种变体。

  1. 无技能。 模型仅凭“裸”知识解决问题,没有任何关于如何行动的外部提示。
  2. 带人工策划技能。 代理获得一套由专家挑选的程序性文档和可执行组件。这实际上就是一个现成的行动库:规则、公式、算法。
  3. 带自生成技能。 代理在解决问题过程中自行编写程序,并尝试在同一片段内继续使用它们。

关键问题在于:预先准备好的程序能否弥补模型的局限——还是说一个聪明的模型能够独自应对。

结果很能说明问题。在九个模型上,添加人工策划的技能稳定地提高了最终得分:平均结果从0.366提升到0.528。这种效应在投资组合构建和风险管理中最为明显——正是在那些需要行动顺序和明确规则的领域。

自生成几乎无济于事

直觉告诉我们:让模型能够创建自己的程序——它就能比使用别人的模板更好地适应任务。但实验并未证实这一点。自生成技能只带来了微不足道的改进,却需要明显更多的计算资源。代理把时间花在创建和重写程序上,但结果几乎没变。

天真的自生成就像在每个任务中重新发明轮子:成本高昂且质量没有保证。一个现成的、经过验证的程序性技能比模型每次从头推导方法更可靠。

在另一个框架上的可复现性

任何基准都可以“适配”到特定环境。因此,作者额外在独立的代理框架Hermes Agent上进行了评估:8个模型,5280个片段,同样的三个领域。总体规律得到了证实——现成的技能在所有方向上都能改善代理的表现。

不过,效应的大小并不一致:它既取决于子任务,也取决于代理“流水线”的构建方式。这是一个重要的说明:技能不是魔法按钮,但它们确实能带来系统性的优势。

给构建投资代理者的结论

这项研究的主要实践教训是:在投资管理中,获得可靠程序性技能的途径可能不亚于基础模型的选择。如果代理有一个清晰的程序并且懂得遵循它,它往往能比一个盲目行动的更强模型表现得更好。

对于产品团队来说,这意味着不应把所有精力都只投入到模型选择上。应该注重建立经过验证的金融程序库:如何重新计算投资组合权重,如何考虑风险因素,如何分析财报。作者特别强调:程序必须是人工策划的,而不是由代理临时生成的。

最后一点:作者公开了基准本身、评估工具、人工策划的技能包以及代理的完整行动轨迹。这使得结果可以被复现,也允许人们发展自己的代理系统,而无需从头开始构建一切。

常问问题

FinSkillBench:在投资型AI代理中,现成的程序性技能有时比模型选择更重要