香蕉代替牙刷:通用人工智能机器人如何通过视频学习任务并即时适应

6 九月 202628 视图

在通用人工智能实验室中,机械臂在观看一段简短视频示例后便能完成新动作:当刷子被移走后,机械臂拿起香蕉并清扫了物品。据作者介绍,这种方法类似于儿童通过直觉理解物理规律进行学习,无需成千上万次重复。

香蕉代替牙刷:通用人工智能机器人如何通过视频学习任务并即时适应

机器人通常并不以灵活性见长:为了一个动作重复成千上万次,而光照或物体形状的任何变化都可能让技能失效。来自马萨诸塞州剑桥市的初创公司Generalist AI正试图颠覆这一逻辑。与其让机器通过大量示例进行长时间学习,不如让它只看一次短视频——它就能在相似但不完全相同的条件下行动。这有点像孩子模仿成人的行为,甚至没有意识到自己正在学习。

视频即指令:机器人如何“一条过”学习

作者曾到访该公司实验室,目睹了一场不寻常的景象。机械臂无需事先准备即可针对具体操作进行调整:它们处理杯子、将它们叠放成堆、把积木从一只碗移到另一只碗。所需的一切只是一段演示动作的短视频,之后机器人便开始处理对它而言全新的物体。

有些场景几乎像是工程思维的微型奇迹。例如,机器人面前的任务是把积木塞进碗里,并给了它一把刷子和一个簸箕作为辅助工具。当刷子被拿走时,机器并没有停下,而是改用簸箕来完成这一目的——用夹爪抓起簸箕,像刷子一样使用,最终成功完成了任务。另一个案例发生在双臂机械臂上。它观看了一段人打开钱包并从中取出纸币的视频。机器人出色地处理了另一只钱包,而当右手无法勾起钞票时,它切换到左手,调整角度,最终还是把钱取了出来。

为什么有效:押注“物理想象力”

Generalist AI的首席执行官兼联合创始人皮特·弗洛伦斯将自家机器人的行为与GPT-3相提并论。语言模型只需被赋予一个新任务,就能找到解决方案,无需经过专门训练。机器人身上发生的大致相同,但考虑到物质世界的修正:它们不仅要生成词语,还要协调动作并考虑物体的物理特性。簸箕可以替代刷子,钱包可以以不同方式打开,而香蕉可以成为扫地的工具。

最后一种情况确实发生过:机器人面前放了一根香蕉,它毫不慌乱,开始用它把桌面上的零件扫落。这看起来很有趣,但背后有一个重要的理念——系统学习的不是某个具体动作,而是人类与生俱来的对物理的直觉感知。这正是创始人团队押注的方向:皮特·弗洛伦斯、安德鲁·巴里和安迪·曾曾在Google DeepMind和Boston Dynamics工作过,如今他们构建的模型能够理解物体在空间中的“行为”。

这种理解的秘诀在于海量高质量的物理交互数据。为了尽可能高效地收集这些数据,Generalist AI制作了形似机器人夹爪的特殊手套。手套内置摄像头,专为人类设计:世界各地的操作员——包括墨西哥——执行日常家务或生产操作,系统将这些录像转化为训练素材。作者甚至被展示了一个箱子,里面装着数百只这样的手套,准备发给数据采集人员。与此同时,公司完全从零构建神经网络,刻意放弃现成的开源语言模型。

可靠性、质疑与工业前景

创始人们并不掩饰弱点。目前,机器人平均在59%的情况下能成功完成所展示的任务。这与工业标准相去甚远——工业要求99%以上的可靠性。技能能在多大程度上迁移到完全陌生的场景,以及模型在条件骤变时如何表现,仍是未知数。但已完成的工作已经给外部专家留下了深刻印象。

佐治亚理工学院的机器人学家徐丹飞表示,在开发通用机器人模型的公司中,正是Generalist AI最接近真正的商业应用。在他看来,团队将理念推向了极致并高质量地实现了它,收集了海量优质数据。斯坦福大学的刘凯伦补充说,该公司的做法之所以有趣,是因为数据以大规模方式收集,且不绑定于某一种机器人结构。这使得训练更像一个开放平台,而非一次性技巧。

对制造业的潜在价值巨大。想象一条传送带,可以瞬间从包装瓶子切换到组装零件——只需给机器人看一段短视频即可。无需漫长的重新调试,无需对操作进行编程。

也许最意味深长的片段是在深夜于这家初创公司的办公室里拍下的。工程师手动在双臂机器人前摆放小杯子。突然,机械臂不等指令,开始抓起杯子,跟着人把它们叠成整齐的一摞。这种自发的动作——尽管简单而短暂——表明机器正在超越无灵魂的指令执行者。或许,正是这种“主动性”将成为那个突破,把机器人从工厂车间的围栏中带进真实世界。

常问问题

香蕉代替牙刷:通用人工智能机器人如何通过视频学习任务并即时适应