为什么几何方法无法胜任抓取任务
机器人操作任务很少能归结为简单的“看一眼—算一下—抓一下”模式。即使几何规划器正确确定了物体的坐标,实际抓取也往往不稳定:物体打滑、偏移,甚至从夹爪中掉落。原因包括相机精度不足、表面特性、微观不平整,甚至物体本身的轻微移动。传统算法遵循“一次射击”原则:它们认为看一眼就足够了,在运动执行过程中不使用反馈。因此,机器人会一遍又一遍地重复同样的错误。
这正是强化学习发挥作用的地方。智能体不是试图第一次就找到完美抓取,而是学会逐步修正自己的决策,每次观察结果并获得信号,判断是否有所改善。这种迭代方法将失败的尝试转化为经验的来源,而不是令人沮丧的理由。

抓取细化是如何运作的
研究人员开发的框架结合了两个抽象层次。在第一层,基于俯视二维图像工作的经典几何算法生成多个初始抓取候选。这些是粗略的位姿,原则上可能成功,但并不保证。在第二层,基于Deep Q-Network(DQN)构建的智能体登场。它不分析完整图像,而是通过关键点使用物体的紧凑表示——这降低了任务的维度并加速了学习。
智能体以循环方式运作。在每一步,它评估当前抓取位姿,决定应该执行什么小幅平移或旋转,并根据物体是否更接近稳定抓取来获得奖励。这种逐步优化类似于微调动作,机器人实际上是在“摸索”正确的位置。正是通过这一机制,最初不适用的抓取逐渐转变为成功的抓取。
关键点和DQN的作用
关键点的选择并非偶然。它们定义了物体的语义骨架:角点、面中心、与表面的接触点。对智能体而言,这是一种在原始图像不可避免的噪声之外描述环境状态的便捷方式。而Deep Q-Network非常适合离散动作:智能体遍历有限的修正集合,并记住哪些会带来奖励。这种方法可以扩展到各种物体,而无需为每个物体重写规则。

从仿真到现实:在300个物体上的验证
实验在配备UR5机械臂和300个Dex-Net物体的仿真环境中进行。这是一个包含各种零件的数据集——从简单的立方体到带有圆角和凹槽的复杂零件。几何方法事先将其中一些物体标记为“不适合抓取”:预计机器人原则上无法抓住它们。然而,经过强化学习的迭代细化后,即使在这些困难样本上,成功率也达到了100%。
仿真中获得的技能并没有停留在屏幕上。在delta机器人上进行的物理实验证实了该方法的可迁移性:机器人通过细化抓取,自信地操作着一个传统方法认为毫无希望的物体。这是一个重要的成果,因为强化学习的主要问题之一是仿真器与现实世界之间的差距。而在这里,通过关键点的紧凑表示帮助智能体忽略了不重要的细节,并在现实条件下保持了有效性。

这对工业机器人技术意味着什么
基于强化学习的迭代细化改变了抓取的整个理念。系统不再要求规划器第一次就给出完美答案,而是获得了犯错并纠正错误的能力。这为更灵活的接触式操作开辟了道路,使机器人能够自信地与陌生或不稳定的物体交互。所提出的框架不是针对某一台特定设备的解决方案,而是一个可适应的基础,可以根据新的机器人和新的物体集合进行重新配置。在不久的将来,这种方法有望减少生产中的废品率,并扩大可自动化任务的范围。



