现代AI代理在处理典型办公任务方面表现不错,但如何检验它们是否能在复杂的公司环境中工作——例如电信行业?这里仅靠通用测试远远不够:需要结合真实文档、数据库和非常规用户问题的现实场景。正是为此,Telco-GAIA应运而生——这是一个围绕真实运营商数据构建的双语多模态基准测试。它能够评估AI代理在推理、使用工具以及从不同来源提取信息方面的能力。
为什么需要这样的基准测试
大多数面向AI代理的公开测试都像拼图游戏:要么过于合成化,要么不需要真正处理企业数据。Telco-GAIA填补了这一空白。其问题经过精心设计,让代理面对电信运营商员工熟悉的场景:在网站上查找信息、将其与数据库记录进行比对、在存档文件中核实细节。这不是对模型记忆力的检验,而是对其多来源协作与推理能力的检验。
该基准测试是双语的:所有任务均以英语和阿拉伯语编写。这一选择并非偶然——它反映了该地区运营商的真实需求,在当地阿拉伯语是工作语言,但大量内部文档仍以英语撰写。
Telco-GAIA包含什么
该基准测试包含100个问答任务,每个任务都经过人工审核。重要的是,这些任务不仅要求简短回答,而是需要一系列逻辑步骤——平均4.2步。所有问题按模态类型划分:文本、表格和图形。这意味着模型必须同样熟练地处理PDF文档、图像或SQL查询结构。

要解决问题,代理需要访问三个异构来源:
- 运营商网站的静态快照——HTML页面、图像及相关PDF文件。
- 合成关系数据库——其结构模拟运营商的内部系统,但数据可安全公开。
- 外部网络存档——用于核实事实或澄清上下文的补充材料。
评估如何进行
Telco-GAIA的核心原则之一是客观性。作者摒弃了流行的LLM评审方式——即让一个模型评估另一个模型的回答。取而代之的是使用归一化的精确字符串比较,整个基准测试被封装在隔离的Docker环境中。这意味着结果不依赖于特定机器或库版本:启动容器——得到相同数字。这种方法使评估具有确定性和可复现性,这对研究和不同模型的比较至关重要。

测试结果如何
开发人员使用一个参考代理对十二种不同模型进行了基准测试——包括商业模型和开源模型。结果较为保守:即使是最强的模型也只完成了71%的任务。如果工具调用预算缩减到中等水平,结果会降至约40%。换句话说,代理开始明显“走捷径”:不执行多余步骤,不检查细节,在非常规情况下更容易出错。
模型在使用视觉信息(图像和图形)的类别中表现尤为薄弱。那里的平均结果低于30%。这表明理解带图片的文档仍然是AI代理的一个重大增长点。总体而言,Telco-GAIA揭示了企业代理的期望与现实LLM能力之间的显著差距。
结论
Telco-GAIA不仅仅是又一个研究用基准测试。它是一个实用工具,适用于构建自有AI代理并希望提前了解其局限性的公司。凭借可复现的环境和经过验证的任务,它可以作为内部质量标准使用。
此外,Telco-GAIA所蕴含的方法易于适配其他封闭领域——从银行业到物流业。该格式提供了一个现成的模板:获取真实数据,仔细脱敏,拆分为独立来源,并构建一个代理需要展现其推理能力的场景。这正是市场所需的转变:从通用知识测试转向基于可信企业数据的实践能力检验。



