Meta 研究部门出身的团队将面向车间和仓库的开放视觉模型推向市场

21 九月 20269 视图

由两位前 FAIR 员工创立的初创公司 Perceptron 推出了 Isaac 0.5——一个开放权重的模型,据开发者称,它将工业环境中的感知与控制融为一体。读者将了解这一方法是如何构建的、该系统基于哪些数据训练,以及为什么它被视为既适用于专用解决方案、又可替代云端通用型方案的替代选择。

Meta 研究部门出身的团队将面向车间和仓库的开放视觉模型推向市场

Perceptron 推出了什么

Perceptron 是一家成立于 2024 年 11 月的初创公司。它由两位前 Meta 研究科学家 Armen Aghajanyan 和 Akshat Shrivastava 创立。他们曾在 Meta’s Fundamental AI Research (FAIR) 工作。这是 Meta 的人工智能研究部门。

本周,该公司发布了 Isaac 0.5 模型。据创建者称,它赋予机器在工业环境中“perceive, reason and act”的能力。该模型以 open-weight 形式发布。因此,任何人都可以检查其参数和训练材料。

公司将它的软件视为工业自动化部署的未来。

结论:Isaac 0.5 应被视为面向工业任务的开源模型。权重可验证性是选择时的关键标准。

任务:面向仓库和车间的物理智能

Perceptron 正在开发 frontier vision models。它们应帮助机器更胜任地与物理环境交互。该软件能够帮助 vision-guided robots 在复杂环境中移动。这里指的是 warehouses 或 factory floors。

公司这样描述问题:“Physical AI today forces a false choice”。一方面是 generalist foundation models,它们每个 instance 都需要 multiple dedicated cloud GPUs。另一方面是 narrow models,它们处理 perception 或 control,但从不两者兼顾。Isaac 0.5 旨在赋予机器感知、推理和行动的能力。

Shrivastava 建议考虑一个简单的物理过程——整理箱子。一台被部署用于分拣包裹的机器人必须完成许多步骤。首先读取包装上的标签。然后进行空间分析,以了解箱子的位置。接着决定要搬起哪一个。如果它要搬起一系列箱子,就必须规划搬起哪些箱子以及以什么顺序搬。Perceptron 的软件旨在帮助机器人完成流程中的每一步。

结论:选择标准是模型能否覆盖整个流程,从感知到行动规划,而不仅仅是单个操作。

Isaac 0.5 是如何训练的

像 Isaac 0.5 这样的模型通过吸收大量视频训练数据来学习操作技能。Perceptron 表示,它用一百万小时的所谓 general video 训练了新模型。这是为了让算法学会识别特定条件、视觉元素和场景。

公司还大量依赖 ego video。这是以执行物理任务的人的第一视角拍摄的视频。它通过 GoPro 或可穿戴相机拍摄。此外还使用了 UMI video。它们同样通过记录重复的人类动作来训练 AI 系统完成动作。

Perceptron 没有披露其训练数据的来源。Shrivastava 表示,公司“internally built petabyte-scale datasets that span across modalities”。他补充说:“whether it’s images, text, video, etc. all the way through robotic trajectories.”

结论:模型的开放权重使参数和训练材料可以被检查。对于需要可验证性的团队来说,这是一个重要标准。

与现有模型有何不同

Aghajanyan 和 Shrivastava 表示,他们的工具与现有模型不同。它是 general-purpose,也就是说并非为某一项特定的重复任务而打造。模型应当根据具体环境或情况保持灵活。

行业内已经有帮助机器完成其中大多数任务的软件。但很少有软件旨在灵活地做到这一点。以下是基于公司所述事实对各类方法的比较。

方法关键特点
Generalist foundation models每个实例需要多个专用云端 GPU
Narrow models处理感知或控制,但从不两者兼顾
Isaac 0.5General-purpose、open-weight,目标是 perceive, reason and act

Aghajanyan 说:“Nothing like this really exists out there.” 他补充道:“We’re really excited about it.”

结论:如果任务需要在变化的环境中同时进行感知和控制,窄模型并不适用。Generalist 模型每个实例都需要专用云端 GPU。Isaac 0.5 被宣称是这些方案之间的折中。

计划应用在哪里

这家初创公司准备将软件推向市场,面向各类供应商。公司有可能将其 intelligence layer 集成到不同行业。其中包括 manufacturing、logistics and warehousing、security、mobility,以及 media and entertainment。

该软件帮助 vision-guided robots 在复杂环境中移动,例如 warehouses or factory floors。它还帮助公司从这些机器人录制的视频中提取视觉智能。

结论:实用标准是行业与场景是否匹配。对于仓库和车间而言,在复杂环境中移动以及从视频中提取数据很重要。对于 security、mobility、media 和 entertainment,公司宣称有可能进行集成。

融资与状态

Perceptron 此前筹集了 $21 million。投资方为 Bessemer Venture Partners、Foundation Capital 和 S32。这来自 Pitchbook 的数据。SmartGateVC 也参与了公司的 founding round。

据 TechCrunch 消息,这家初创公司正在完成一轮额外融资。其他条款和时间未披露。

结论:公司获得了风险基金的投资,并表示有意进行额外一轮融资。这并不能保证产品已经成熟,但会降低早期选择的风险。

常问问题

Meta 研究部门出身的团队将面向车间和仓库的开放视觉模型推向市场