Anyscale

免费已支付

基于Ray框架的缩放Python应用程序和AI工作量的平台.

Anyscale

排名位置

564视图
访问网站

概览

Anyscale是一个管理平台,可以让您运行分布的 Python 应用程序和机器学习任务,而无需手动配置和维护服务器集群. 该服务建立在开源的Ray框架之上,在Python的并行计算中已经使用了几年. 任意比例处理所有基础设施:节点创建,负载平衡,内存分配,以及监控,让开发者只有代码.

该产品定位为需要从原型迅速转向生产的团队的解决方案. 如果您的本地代码是和Ray一起写的,几乎不需要重写就可以移动到Anyscale上——这个平台会拾取现有的逻辑,并自动在可用的资源中分配. 重点是与大型语言模型和基因AI合作 ,包括从预建的终点进行微调和运行推论.

任意大小特征

特性数值
核心技术光线框架( 开源)
产品类型管理云平台(PaaS)
主要语言Py
目标工作量分布式计算、AI模型培训和推论
基础设施管理完全自动化,无人工管理
一体化标准雷生态系统、 ML 和 Python 库
分发模式已支付

谁的阶梯?

数据工程师和数据科学家

任何尺度都适合每天使用大数据量工作的专业人员,并经常达到单机的极限. 平台允许您在数十个或数百个节点上进行数据处理,而无需学习DevOps工具或写复杂的集群管理代码.

ML 工程师和研究人员

对于这些培训模型——从经典的梯度提升到大型变压器——来说,该平台在GPU/CPU中自动分配计算。 这缩短了实验时间,加快了迭代速度,而不必担心当地的工作站或廉价的情况是否有足够的资源。

产品团队和启动

任何尺度都涵盖将AI功能迅速运送到生产的需要. 团队可使用现成的推论终点,而不是雇用专门的SRE或支付实际上没有人有时间管理的昂贵基础设施的费用。 这使得他们能够专注于商业逻辑而不是操作.

如何使用任意比例

正在准备雷电码

第一步是使用Ray库(例如, ray.remote 用于分布式函数)。 如果代码已经在本地运行,它只需要轻度修改:用Ray API替换本地执行器. 该流程在平台文档中被描述,通常只需要不超过几个小时.

部署到平台

接下来,通过任意级控制台或CLI部署. 您指定需要哪些图像或依赖性,平台会自动创建环境. 集群启动几乎是即时的:任意比例分配节点,在失败时重新启动节点,优化当前负载的资源计数.

通过终点进行推断

对于基因AI和与预建模型合作,Anyscale提供服务器端端点创建. 训练后,你只是将模型作为 REST API 发布,从任何应用中都可以调用. 月台自动缩放端点处理日益增长的流量.

任意比例特性

自动资源管理

该平台决定了在任何特定时刻需要多少节点,并且将集群从0到数百台机器进行比例化. 当负载下降时,资源会自动释放,防止闲置容量多付.

现成推论终点

任意比例让您快速部署一个模型作为API服务来生产,而不配置网页框架,Docker容器,或者加载平衡器. 与Ray Serve的整合使得整个模型的流程标准.

大规模培训支助

该平台是为培训大型语言模型而建造的。 它将培训流程分布在几十个GPU的集群,正确处理检查站,从节点故障中恢复.

Ray生态系统支持

由于Anyscale是"wraped" Ray,用户可以访问所有框架库:Ray Tune用于超参数调试,Ray Data用于数据集处理,Ray Train用于模型培训. 这为所有计算任务提供了一个单一的切入点.

任意比例优势

没有手动 DevOps

关键的好处是完全没有基础设施管理。 没有Kubernetes设置,SSH访问节点,或内存漏监测. 系统处理一切 ,开发者只看到工作环境。

不重写代码的可缩放性

由于雷的缘故,应用程序可以缩放而几乎不改变源代码. 单台手提电脑的运行没有问题 在200节点集群。

快速启动

平台可以在几分钟内旋转一个工作集群. 这对于在不等待服务器分配的情况下处理交通高峰或紧急训练至关重要。

内设监测和伐木

任何尺度都为跟踪集群健康提供了工具。 您可以看到CPU/GPU加载图表,日志错误,以及任务执行时间——都在一个单独的控制台中.

任意比例限制

锁定到一个特定的技术堆栈

该平台是专门为Python和Ray框架建造的. 如果一个项目需要其他语言(如Go,Java,或C++)来进行部分计算,则集成要么不可能,要么极其困难.

比额表费用

没有统一收费——定价基于消耗的资源。 在持续高负荷下(例如,对100 GPU的24/7推断),账单可能超过直接租用专用服务器的费用.

雷学曲线

虽然雷在ML社区很受欢迎,但新人需要时间来学习它的范式(演员,任务,远程功能). 对于在单机上运行的简单脚本来说,这是过度杀伤.

问题是什么?

该平台涵盖的主要设想包括:

  • ML模式培训:从小实验到微调大型语言模型(LLMs)在集群上需要数百千兆字节的内存.
  • 批量数据处理:将ETL进程平行化,变换terabyte比例数据集的速度远快于单线程模式.
  • 实时推断:将训练有素的模型作为端点发布,以满足高吞吐量用户应用程序的请求.
  • 计算工作量:任何与ML无关的分布式Python任务,如模拟,图像处理,或测试自动化.

任何尺度定价

在所提供的来源数据中,没有具体的订阅定价数字。 发行模式已知支付. 平台采用现收现付方式,最终账单根据消耗的计算资源量(vCPU数,内存,GPU时数)计算. 现时价格列表,参见提供商的官方网站或商业文档.

任何规模的使用条款

任何等级均根据商业许可证提供,并必须进行账户登记。 该平台使用云部署模型:所有计算都发生在提供者的服务器上. 用户在没有公司合同的情况下,无法在自己的硬件上下载和部署全功能版本. 术语包括标准数据处理政策和服务级协议(SLA),详见服务部门的正式文件.

任意规模的可用性

服务以SaaS方式提供,这意味着您需要网页浏览器和稳定的互联网连接. 任何尺度都可以通过网络界面和CLI工具获得. 个人电脑没有离线版本或本地安装包. 该平台运行在公共云数据中心上,因此可以从任何有网络接入的任何地方使用.

任何尺度与替代品有何不同

抽象程度

与Kubernetes或AWS批量不同,Anyscale在Python应用级别上运行. 不需要写舱表或配置Docker图像. 平台"Sees"代码与Ray一起写,并自行决定如何最好地平行.

与 ML 垂直整合

大多数云提供商提供管道工具(Airflow,Kubeflow),但Anyscale是为模型生命周期而专门建造的. 从超参数调试到端点部署,整个生命周期在一个单一平台内实现标准化——这是通用系统缺乏的.

不需要SRE了 不需要了

替代品(如自我管理的Kubernetes集群)需要不断监督和调整。 任何规模的销售不仅仅是资源,而是作为一种服务管理代码执行,这大大降低了小团队拥有权的总成本. 相比之下,大多数IaaS供应商将监测和过失容忍责任转移给用户。

结论

Anyscale是Python堆栈上想要忘记手动管理服务器集群的团队的一个实用解决方案. 该平台有效覆盖了分布式培训,批量处理,以及低纬度推论,特别是大型语言模型. 主要局限是锁定雷生态系统,以及基于消耗资源可变定价的付费模式. 不过,对于那些已经使用雷或愿意迁移到雷的人来说,任何尺度都大大降低 进入分布式计算的障碍.

大型语言模式的培训和推论
启动基因AI应用
高负荷下的缩放 Python 应用程序

常问问题

另见

Anyscale - 对平台 Python 和 AI 缩放的审查