机器人学习正在走到一个很关键的分岔口:机器人的能力,究竟应该以“冻结权重”的形式交付,还是以“可检查、可修改、可复用的技能程序”形式交付?前者对应端到端视觉-语言-动作模型,典型路线是把大规模观测、语言指令和动作轨迹压进一个策略网络;后者对应 code-as-policy 和技能库路线,机器人不只是执行模型输出的动作,而是能生成、运行、修复和积累可执行技能。

这篇题为《Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills》的综述,正是围绕这条“权重-技能”轴来重新组织近十年机器人学习研究。论文不是做泛泛的机器人学习总览,而是聚焦 77 个代表性系统,并把附录中的 225 项工作纳入背景景观,总覆盖 302 个系统、310 篇参考文献,时间跨度为 2016 至 2026 年。

论文最有价值的地方,在于它把“机器人是否真的会自我改进技能”拆成可比较的层级:从零样本程序生成,到闭环自修复、技能库积累、进化式搜索,再到同时具备反馈、记忆和搜索的完整自改进闭环。作者指出,真正落在最高层级的系统仍然很少,目前主要是 ASPIRE、ENPIRE 和 RoboClaw。与此同时,商业机器人技能商店已经开始出现,但很多“技能”仍然只是静态动作包,离可迁移、可验证、可组合的开放技能经济还有很长距离。

因此,这篇综述适合三类读者:关注具身智能和机器人基础模型的研究者,可以从中理解端到端权重路线与技能路线的互补关系;关注大模型智能体的读者,可以看到代码生成、反思、记忆、工具调用如何进入物理机器人;关注机器人产业落地的人,则可以借此把握技能市场、跨本体迁移、安全验证和技能组合这些即将变得非常现实的问题。

论文信息

论文标题:Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills 作者:Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das 机构:UC Berkeley, San Jose State University, Meta, Apple, PocketFM, Pragya Lab/BITS Pilani Goa 论文链接:https://arxiv.org/abs/2608.01851 发布时间:2026 年 8 月 3 日 论文类型:机器人学习综述

引言:权重还是技能

论文开篇提出一个非常直接的问题:机器人学习系统最终“交付”的是什么?如果交付的是一个端到端策略网络,那么能力主要存在于冻结权重中;如果交付的是可执行程序、可调用工具、可扩展技能库,那么能力就更接近可检查、可编辑、可分发的技能。 作者用 Figure 1 展示了这条轴的两端。左侧是 RT-1、RT-2、Octo、OpenVLA、Pi-0、CogACT、Gemini Robotics 等 VLA 或通用策略模型,它们通常把观察映射到动作,优势是可从大规模数据中获得强泛化能力;右侧是 ProgPrompt、VoxPoser、REFLECT、TidyBot、Instruct2Act、Prompt2Walk、DoReMi、CaP-X 等 code-as-policy 系统,它们让大模型生成可执行程序,并在部分系统中利用失败反馈继续修复或扩展技能。

图1 权重还是技能:论文用真实系统展示机器人学习的核心组织轴,左侧是冻结权重策略,右侧是可执行且可自改进的技能程序。 作者强调,这篇综述的目标不是穷尽所有机器人学习论文,而是构建一张可解释的“技术地图”。它的贡献包括:提出权重与技能的组织轴;把 code-as-policy 按自改进程度细分;梳理“技能”在文献中的多重含义;比较不同技术家族的优势、限制和失败模式;并把学术分类法连接到正在形成的机器人技能经济。

机器人学习技术分类

论文第二部分先说明语料构建方法。作者采用两条路径:一条是围绕权重与技能分类法精选的 77 个系统,要求每个系统能被明确放在坐标轴上、机制足够独特、信息足够完整;另一条是更宽的 225 项景观语料,用来展示近十年机器人学习研究的整体分布。两者合计覆盖 302 个系统和 310 篇参考文献。 在分类法上,论文把机器人学习技术划分为六个分支:一是 code-as-policy,即由大模型生成或维护可执行机器人技能;二是端到端 VLA 或通用策略;三是由大模型编写奖励函数、课程或训练任务;四是机器人技能库与终身学习;五是仿真到现实和跨本体迁移;六是具身基准与模拟器。

图2 机器人学习的权重与技能分类树:77 个代表性系统被放入六个技术分支,其中代码策略分支进一步按自改进程度分层。 从语料分布看,2023 至 2024 年是相关工作增长最明显的阶段;评测场景中仿真和真实机器人都占有较大比例;学习信号既包括模仿学习、强化学习,也包括大模型规划、自监督和离线强化学习。论文也特别提醒,这些统计反映的是综述语料,而不是整个领域的绝对总体。

图3 综述语料概览:论文统计了系统数量、参考文献、技术分支、自改进层级和年度分布等信息。

技术家族

第三部分是全文主体。作者依次讨论六类技术家族,并把每一类放回“权重还是技能”的主线中。 第一类是代码策略。它的基本想法是让语言模型把任务指令、场景描述、可用工具和机器人 API 转化为可执行程序。最低层级是零样本合成,例如 Code-as-Policies、ProgPrompt、VoxPoser、Instruct2Act 等系统,可以生成控制代码或任务计划,但不会把执行结果反馈给代码生成过程。下一层是闭环自修复,系统开始利用失败轨迹、视觉检查或人类反馈来修改计划。再往上是技能库积累,机器人把成功的程序、修复经验或抽象技能保存下来,供后续任务检索复用。进化式搜索则进一步维护多个候选程序,通过评估和选择迭代产生更好的技能。 最高层级是完整自改进闭环。论文把它定义为反馈、记忆和搜索三者的结合:系统要能从执行中获得可操作反馈,要能把技能或经验长期保存,还要能在候选空间中搜索更优程序。作者指出,这个最高层级目前非常稀疏,典型系统包括 ASPIRE、ENPIRE 和 RoboClaw。也就是说,“机器人能写自己的技能”已经不是口号,但真正持续自我改进的系统仍处在早期。

图4 完整自改进闭环:执行反馈、技能记忆和进化搜索共同构成开放式技能改进循环。 第二类是端到端 VLA 和通用策略。RT-1、RT-2、Octo、OpenVLA、Pi-0、Pi-0.5、CogACT、SpatialVLA、GROOT N1、Gemini Robotics 等系统把视觉、语言和动作统一到一个大模型或策略网络中。它们的优势是可以利用大规模遥操作数据、网络知识和跨任务训练,在多任务场景中展现强大的即时执行能力。限制也很清楚:能力主要封装在权重里,行为难以直接检查和编辑,失败原因不透明,部署后的自我修复通常不如程序技能路线自然。 第三类是大模型编写奖励、课程和训练任务。Eureka、DrEureka、Text2Reward、Language-to-Rewards、Eurekaverse、RoboGen、Auto MC-Reward 等工作让大模型生成奖励函数、环境课程或训练脚本,再通过强化学习或仿真训练得到策略。这条路线很重要,因为它把语言模型的结构化知识用于“塑造学习信号”,而不是直接控制机器人。但论文也指出,这些系统最终交付的常常仍是训练出的策略或奖励机制,并不必然产生可复用、可自改进的机器人技能。 第四类是技能库与终身学习。这里的“技能”一词尤其容易混淆。论文把它拆成至少五种含义:潜变量策略、选项或原语、可执行代码、机器人应用包、市场商品。只有代码意义上的技能同时具备较强的可检查性、可适应性和可组合性;而机器人应用包和市场商品更容易分发,却往往不可编辑、不可解释、也难以跨机器人组合。

图5 技能概念的五种含义:潜变量策略、选项原语、可执行代码、机器人应用包和市场商品在可检查性、适应性、组合性、分发性上差异明显。 在技能库内部,论文进一步区分无监督潜技能发现、技能空间和层级强化学习、大模型和代码技能库、开放世界智能体技能库等方向。DIAYN、DADS、LSD、CIC、METRA 等工作关注无需奖励或弱监督下发现多样技能;SPiRL、OPAL、PARROT、SkiMo 等方法把技能作为层级规划和强化学习的中间表示;Voyager、LOTUS、LRLL、BOSS、SPRINT、Uni-Skill、SkillFlow 等系统则更接近可检索、可增长的技能库。开放世界智能体如 GITM、JARVIS-1、ExpeL、Optimus-1、Odyssey,则展示了技能如何在长期任务和记忆机制中不断积累。 第五类是仿真到现实和跨本体迁移。Open X-Embodiment、CrossFormer、RoboCat、Mirage 等系统尝试让策略或技能跨任务、跨机器人、跨数据来源迁移。这类工作与技能经济关系密切:如果一个技能只能在原始机器人上运行,它就很难成为可交易、可复用的商品;如果没有统一动作接口、本体描述和能力约束,跨平台技能分发就缺少可靠保证。 第六类是具身基准与模拟器。LIBERO、robosuite、BEHAVIOR-1K、Meta-World、RLBench、ManiSkill2、CALVIN 等基准,为多任务学习、长程任务、语言条件控制和终身学习提供了评估环境。论文认为,现有基准更多衡量一次性成功率,而未来需要更直接衡量自改进:机器人是否随着交互次数增加而提升,技能库是否带来复用收益,跨本体部署会损失多少性能,分发技能是否带有可验证来源和测试记录。

技能经济:开放问题

第四部分把学术分类法推向产业场景。论文以机器人技能商店为例指出,现实中已经出现面向消费者或开发者的“技能分发”模式,但这类技能常常更像静态动作包:用户一键下载,机器人播放预设行为。它们具备分发便利性,却不一定具备自适应、可检查、可组合和跨本体迁移能力。 作者提出的第一个问题是部署后适应。真实家庭、办公室和工厂环境差异巨大,桌面高度、物体形状、光照、障碍物、机器人夹爪和传感器都可能不同。如果下载的技能不能针对本地环境持续调整,它就很难超越演示动作包。 第二个问题是跨本体可移植性。同样是“拿起杯子”,不同机器人有不同自由度、末端执行器、相机视角和动力学限制。技能市场如果要成立,就需要声明技能的前置条件、动作接口、可替换硬件能力和失败边界。 第三个问题是来源与信任。机器人技能运行在物理世界中,错误可能造成财产损失甚至安全风险。因此,技能不能只带一个名字和下载链接,还应包含作者、训练数据、验证环境、测试记录、版本变更和安全约束。论文把 provenance 视为技能经济的基础设施,而不是普通元数据。 第四个问题是安全验证。对于可执行代码技能,验证并不只是检查语法或跑一次仿真。技能行为取决于场景输入、感知误差和运行时状态,实际部署需要沙盒、前置条件、运行时监控、异常回退和可审计日志。 第五个问题是技能组合。理想情况下,“做咖啡”和“清理桌面”应能组合成更长的早晨例程。但组合要求共享接口、前置条件、后置效果和冲突处理机制。当前很多机器人应用包是封闭的,很难像软件库一样自由组合。

图6 技术家族对比矩阵:不同路线在数据需求、任务长度、迁移、可解释性、安全性和失败模式上各有优势与短板。

综述局限

第五部分讨论论文自身边界。作者承认,本文的组织轴偏向代码中心,尤其强调自改进程序技能,因此它会把权重策略、强化学习技能发现和表征学习更多作为对照背景,而不是所有方向都平均展开。换句话说,如果从视觉表征、机器人数据收集或运动控制角度重新写一篇综述,技术地图会有所不同。 论文还指出,最高自改进层级上的系统非常新,有些工作几乎是同时期出现,因此很难用统一 benchmark 做严格排名。现有结论更适合理解机制差异,而不是给出绝对优劣。最后,技能经济本身还处于萌芽阶段,论文把它作为开放问题的动机,而不是成熟产业模式的定论。

未来方向

第六部分给出一个更可操作的未来评估框架。作者建议用四个可测量指标来推动领域前进:第一是成功率随交互次数的变化曲线,真正自改进系统应随着自主经验增加而提升,而静态播放技能应基本持平;第二是技能库复用率,随着任务增多,已有技能被调用和组合的比例应上升;第三是跨本体迁移损失,用训练本体和未见本体之间的成功率差距衡量可移植性;第四是来源覆盖度,即分发技能是否包含可验证来源、训练数据说明和可复现实验记录。

图7 未来评估协议:论文建议用成功率交互曲线、技能库复用率、跨本体迁移损失和来源覆盖度衡量开放技能系统。 基于这些指标,论文提出三条研究方向。其一是标准化自改进评估,让“会自我改进”变成可报告、可比较的数字,而不是宣传说法。其二是把适应能力作为技能市场的一等公民,下载技能不应是终点,而应是本地机器人继续特化的起点。其三是连接强化学习技能和代码技能:潜变量策略适合低层控制,代码技能适合解释、组合和修复,未来系统很可能需要把两者包装在统一接口之下。

结论

论文最后回到开篇问题:机器人学习的能力究竟应该作为权重交付,还是作为技能交付?作者的答案并不是二选一。端到端权重模型擅长从大规模数据中学习感知和动作映射,代码技能则擅长检查、编辑、修复、分发和组合。真正有前景的机器人系统,可能需要把二者结合起来:用权重获得强大的感知和低层控制能力,用技能程序承载可解释、可迁移、可验证的长期能力。 这篇综述的核心判断是:当前机器人学习已经不只是“把观察映射到动作”的问题,而是在形成一种新的技能生态。今天的许多商业技能仍是静态播放包,今天的许多学术系统也只在小范围内验证自我改进;但从 code-as-policy、自修复、技能库、进化搜索到完整反馈-记忆-搜索闭环,研究路线已经逐渐清晰。对于未来物理智能来说,如何让机器人不仅会执行任务,而且会生成、保存、验证、迁移和组合自己的技能,将是一个长期而关键的方向。

成为VIP会员查看完整内容
0

相关内容

基于神经网络的机器人学习与控制:回顾与展望
专知会员服务
33+阅读 · 2023年9月10日
【干货书】基于深度学习的机器人感知与认知,638页pdf
专知会员服务
114+阅读 · 2022年7月29日
【硬核书】机器人中的大脑和认知智能控制,110页pdf
专知会员服务
66+阅读 · 2022年6月6日
Python机器学习课程(代码与教程)
专知
37+阅读 · 2019年5月13日
【综述】自动机器学习AutoML最新65页综述,带你了解最新进展
中国人工智能学会
48+阅读 · 2019年5月3日
机器学习必备手册
机器学习研究会
20+阅读 · 2017年10月24日
国家自然科学基金
15+阅读 · 2016年12月31日
国家自然科学基金
11+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
21+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
国家自然科学基金
23+阅读 · 2009年12月31日
国家自然科学基金
50+阅读 · 2009年12月31日
VIP会员
相关主题
最新内容
面向2027年及未来的海军情报改革
专知会员服务
3+阅读 · 8月5日
《无人机蜂群:释放人类-蜂群编队的潜能》
专知会员服务
6+阅读 · 8月5日
《战略战术化:一项综合性述评》
专知会员服务
5+阅读 · 8月5日
相关基金
国家自然科学基金
15+阅读 · 2016年12月31日
国家自然科学基金
11+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
21+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
国家自然科学基金
23+阅读 · 2009年12月31日
国家自然科学基金
50+阅读 · 2009年12月31日
微信扫码咨询专知VIP会员