Telco-GAIA:如何在真实运营商数据上测试AI智能体

10 九月 20264 视图

最新基准测试提供了100个基于运营商真实数据(网站、SQL数据库和网络存档)构建的英语和阿拉伯语问答场景。在12个模型上的测试显示,即使是最优秀的模型也仅能解决71%的任务,而在视觉类别的表现则降至30%以下。

Telco-GAIA:如何在真实运营商数据上测试AI智能体

现代AI代理在处理典型办公任务方面表现不错,但如何检验它们是否能在复杂的公司环境中工作——例如电信行业?这里仅靠通用测试远远不够:需要结合真实文档、数据库和非常规用户问题的现实场景。正是为此,Telco-GAIA应运而生——这是一个围绕真实运营商数据构建的双语多模态基准测试。它能够评估AI代理在推理、使用工具以及从不同来源提取信息方面的能力。

为什么需要这样的基准测试

大多数面向AI代理的公开测试都像拼图游戏:要么过于合成化,要么不需要真正处理企业数据。Telco-GAIA填补了这一空白。其问题经过精心设计,让代理面对电信运营商员工熟悉的场景:在网站上查找信息、将其与数据库记录进行比对、在存档文件中核实细节。这不是对模型记忆力的检验,而是对其多来源协作与推理能力的检验。

该基准测试是双语的:所有任务均以英语和阿拉伯语编写。这一选择并非偶然——它反映了该地区运营商的真实需求,在当地阿拉伯语是工作语言,但大量内部文档仍以英语撰写。

Telco-GAIA包含什么

该基准测试包含100个问答任务,每个任务都经过人工审核。重要的是,这些任务不仅要求简短回答,而是需要一系列逻辑步骤——平均4.2步。所有问题按模态类型划分:文本、表格和图形。这意味着模型必须同样熟练地处理PDF文档、图像或SQL查询结构。

要解决问题,代理需要访问三个异构来源:

  • 运营商网站的静态快照——HTML页面、图像及相关PDF文件。
  • 合成关系数据库——其结构模拟运营商的内部系统,但数据可安全公开。
  • 外部网络存档——用于核实事实或澄清上下文的补充材料。

评估如何进行

Telco-GAIA的核心原则之一是客观性。作者摒弃了流行的LLM评审方式——即让一个模型评估另一个模型的回答。取而代之的是使用归一化的精确字符串比较,整个基准测试被封装在隔离的Docker环境中。这意味着结果不依赖于特定机器或库版本:启动容器——得到相同数字。这种方法使评估具有确定性和可复现性,这对研究和不同模型的比较至关重要。

测试结果如何

开发人员使用一个参考代理对十二种不同模型进行了基准测试——包括商业模型和开源模型。结果较为保守:即使是最强的模型也只完成了71%的任务。如果工具调用预算缩减到中等水平,结果会降至约40%。换句话说,代理开始明显“走捷径”:不执行多余步骤,不检查细节,在非常规情况下更容易出错。

模型在使用视觉信息(图像和图形)的类别中表现尤为薄弱。那里的平均结果低于30%。这表明理解带图片的文档仍然是AI代理的一个重大增长点。总体而言,Telco-GAIA揭示了企业代理的期望与现实LLM能力之间的显著差距。

结论

Telco-GAIA不仅仅是又一个研究用基准测试。它是一个实用工具,适用于构建自有AI代理并希望提前了解其局限性的公司。凭借可复现的环境和经过验证的任务,它可以作为内部质量标准使用。

此外,Telco-GAIA所蕴含的方法易于适配其他封闭领域——从银行业到物流业。该格式提供了一个现成的模板:获取真实数据,仔细脱敏,拆分为独立来源,并构建一个代理需要展现其推理能力的场景。这正是市场所需的转变:从通用知识测试转向基于可信企业数据的实践能力检验。

常问问题