常规重训练是机器人技术的死胡同
基于端到端“视觉-语言-动作”(VLA)模型和世界-动作模型的现代机器人,在熟悉的环境中表现出色。但一旦场景发生变化——新的光照、不同的布局、不熟悉的物体——模型就开始出错。要恢复技能,必须收集新数据、重新训练策略并运行回归测试。这个循环被称为“重训练税”:每次环境更新都需要新一轮昂贵的手工工作。
机器人技术的一个特点是,数据不能简单地从互联网上下载。物理经验必须通过操控真实机器来获取——既缓慢又昂贵。因此,“收集大量数据——训练——再收集更多”的方法难以规模化。
用智能体替代策略:Teach-and-Grow Learning 的理念
一个研究团队(Chang Nie、Zhe Liu、Hesheng Wang)提出了 Teach-and-Grow Learning(TGL) 架构,将重点从重训练转向经验复用。TGL 不是每次针对新任务重新训练模型,而是构建一个技能库——针对典型子目标的可复用行为集合。
一切始于几次成功的演示。多模态智能体将这些演示拆解为逻辑完整的模块——技能块(Skill Blocks)。每个模块负责一个具体的、有意义的步骤:拿起物体、移动、放置、打开盖子。这些模块作为可执行程序保存在技能库(Skill Library)中。
当机器人进入新场景时,智能体不会运行预先记住的序列,而是进行推理:哪些技能在这里适用、如何组合它们、使用哪种工具——是训练过的还是通过几何计算得出的。然后它执行计划,观察物理结果,如果行为偏离意图,就修正路径。所有成功、失败和修正都被记录在结构化的经验记忆(Experience Memory)中,帮助智能体在下次做出更好的决策。

为什么有效:学习是一个持续的过程
TGL 与经典方法的关键区别在于对部署的态度。通常认为,当模型“上线”时,学习就结束了。而在 TGL 中,部署本身成为持续学习的阶段:每完成一个任务都会让下一个任务更容易,因为智能体积累了可复用的模块及其适用性知识。不需要为特定任务学习新策略——只需组合现有技能,并在必要时调整执行即可。
研究人员提出了一个规模化假设:如果 X 是有效可复用经验的量,那么未来任务上的错误率和微调需求会按幂律下降,趋向于一个不可消除的最小值。换句话说,积累的有用技能越多,掌握新技能的成本就越低。
实验显示了什么
在 LIBERO 基准上的评估显示了最先进水平的成绩。受控研究证实了三个重要特性:
- 技能归纳——智能体能够从演示中提取可泛化的模块,而不仅仅是记住轨迹;
- 稳健的复用——技能无需重训练即可在新场景中工作;
- 智能体驱动的自适应——机器人自己发现偏差并实时调整行为。

结语
Teach-and-Grow Learning 是朝着“随经验成长”而非“无限从零重训练”的机器人迈出的一步。这种架构对工业和服务机器人领域尤其有前景,因为在这些领域中环境不断变化,而设备每停机一分钟都在消耗成本。如果幂律规模化假设得到证实,部署新机器人任务的成本可能会降低几个数量级——届时自适应机器将不再是小众产品。



