让GPU都为之“上火”的芯片
就在不久前,人们还认为制造人工智能芯片是英伟达、谷歌或亚马逊这类巨头的专属领域。但从最新的泄露消息来看,OpenAI似乎也准备加入这一俱乐部。在该公司工程师的测试下,其代号为“哈拉佩尼奥”的自研加速器,专为神经网络推理而设计。据报道,初步测试结果非常成功,以至于实验室内部已计划为其数据中心进行大规模量产。
通常,专用“硬件”的发布会在会议和研讨会上进行,但关于“哈拉佩尼奥”测试的消息,是由行业媒体援引匿名消息来源传播的。不过,OpenAI在硬件设计领域的专利活动和公开职位招聘,早已表明这些传闻背后是真实的工程研发工作。
专为OpenAI未来打造的芯片
只有当你想优化产品中最昂贵的环节时,自研芯片才有意义。对于语言模型而言,这个环节就是推理——即成千上万的用户同时发送请求的时刻。每一个这样的请求都需要海量的矩阵乘法运算。现代GPU既能出色地完成训练任务,也能胜任推理任务,但训练并不频繁,而推理则是持续不断的。因此,是时候推出一种专为持续负载而优化的工具了。
“哈拉佩尼奥”并非通用处理器。你无法用它运行普通应用程序,但对于神经网络工作而言,它却堪称完美。其架构被精简为一组专用核心,主要执行矩阵乘法运算和处理注意力机制——这是Transformer架构和大型语言模型的基石。
为什么叫“辣椒”?
该公司的员工喜欢为项目起非正式的代号。“哈拉佩尼奥”——一种辛辣的辣椒——暗示了这款芯片能让市场“热得发烫”的能力。当然,该设备与食物或墨西哥菜毫无关系。
初步测试:速度与功耗
最有趣的数据目前只能通过转述得知。据消息人士称,在测试负载下,原型机在请求处理速度上比顶级服务器加速器快数倍,但主要成就在于能效。OpenAI的自研芯片展现了高得多的每瓦性能比。
这得益于几项技术解决方案。
- 低精度计算。 模型权重可以以8位格式存储和处理,而不会出现明显的质量下降。该芯片从一开始就是为此类计算而设计的。
- 精简流水线。 所有指令都服务于单一任务,因此核心不会在无用的分支和上下文切换上浪费时钟周期。
- 快速内存。 模型权重直接位于芯片上,紧邻计算单元,而对于更大的模型,则提供了与外部内存的高速连接。
据非官方数据,在满负荷运行时的功耗远低于通用解决方案。这意味着服务器无需扩展电源和冷却系统,就能处理更多请求。
AI市场将发生哪些变化?
“哈拉佩尼奥”的成功可能会引发颠覆性变革。文本生成和图像处理的成本将会下降,从而使API接入对中小企业来说更便宜、更易获取。许多目前在经济上不可行的新产品将应运而生:实时工作的个性化助手、大规模音视频分析,甚至能够执行长任务链的自主代理。

此外,自研芯片增强了OpenAI与云服务提供商的议价能力。该公司可以将部分负载转移到自己的平台上。对用户而言,这将意味着更少的故障和更可预测的价格。
也不应忽视生态效益:更低的功耗意味着更小的环境影响。更何况,数据中心已经占据了全球碳排放的相当大一部分。
仍有疑问
正如重大新闻中常见的情况一样,“哈拉佩尼奥”也引发了质疑。首批硅片样本可能不具备代表性:由于热限制和特性差异,量产时的时钟频率通常会降低。生产成本和面向客户的目标价格尚不清楚——如果价格过高,节省的电费将无济于事。

此外,该芯片与主流框架的兼容性也存在疑问。大多数公司通过CUDA和PyTorch等高级库使用图形加速器,而将代码迁移到新平台需要时间。OpenAI很可能会将“哈拉佩尼奥”与其自身的软件栈结合使用,但该芯片是否会向第三方开发者开放,则是一个大问题。
总结
第一声钟声已经敲响:“哈拉佩尼奥”芯片极有可能成为真正的产品,而非实验性原型。目前这还只是一个没有官方规格和发布日期工程故事。但如果测试数据得到证实,AI硬件市场将迎来一个强大的新玩家,它有能力改写既定的游戏规则。我们拭目以待官方声明和首批样品。



