综述 | 世界—动作模型:从预测未来到机器人闭环控制

导读

机器人不仅需要理解“现在看到了什么”和“人希望做什么”,还要判断:如果执行某个动作,环境将怎样变化,这种变化是否有利于完成后续任务?视觉—语言—动作模型推动了通用机器人策略的发展,但在长时序操作、遮挡、接触交互和延迟效应场景中,仅根据当前观测生成动作仍然面临局限。 《World-Action Models for Robot Learning and Control: A Survey》围绕世界—动作模型(World-Action Models,WAMs)梳理这一问题。作者将其核心概括为:**把未来世界预测与可执行动作生成连接起来,使预测能够服务于真实控制。**文章依次讨论技术背景、架构分类、应用、数据与评测,以及开放挑战。 这篇综述值得关注的地方,不只是汇集视频生成与机器人策略方法,而是明确区分“预测看起来合理”与“预测有助于控制”。读者可以据此判断一个系统究竟在学习视觉先验、生成行动计划、合成训练轨迹,还是通过想象交互改善策略;这些用途需要不同的接口和验证证据。 本文按原论文七个主体章节组织,配图截取自原文,图内文字保留原样,图注采用中文。论文为 arXiv 预印本,以下介绍不将其中不同来源的方法结果视为统一条件下的性能排名。 论文信息

英文题名:World-Action Models for Robot Learning and Control: A Survey 作者:Zuxing Lu、Hongjia Zhai、Guanzhi Wang、Huajian Zeng、Jiaqi Yang、Jingyu Liu、Lei Cheng、Yuantai Zhang、Yuheng Qiu、Zezhou Cheng、Ivan Laptev、Danfei Xu、Benjamin Riviere、Giuseppe Loianno、Eric Xing、Xingxing Zuo。 作者单位包括 MBZUAI、Caltech、Amazon FAR、弗吉尼亚大学、佐治亚理工学院、纽约大学和加州大学伯克利分校。首次提交日期为 2026 年 9 月 13 日,论文共 19 页。 论文主页:https://arxiv.org/abs/2609.16074 原文 PDF:https://arxiv.org/pdf/2609.16074 项目资源:https://rcl-robotics.github.io/Awesome-World-Action-Models

I. Introduction | 引言

传统机器人系统通常将感知、状态估计、规划与底层控制分开实现。模块化设计便于诊断和替换,在目标、动力学和环境结构能够明确建模时仍然有效。然而,面对开放世界操作和多任务交互,手工表示可能难以适应分布变化,模块之间也可能传递和放大误差。 视觉—语言—动作模型(VLA)将视觉观测、语言指令和动作输出纳入统一策略。RT-1、RT-2、Octo、OpenVLA 等工作展示了大规模预训练与跨任务数据聚合的价值。但许多 VLA 仍主要学习“当前观测或短历史加指令到下一步动作”的映射,没有显式比较不同动作所导致的未来。 世界模型补充了这部分能力:学习环境状态如何随动作演化,从而支持想象、规划、反事实评估和策略训练。问题是,世界模型本身不等于控制系统。预测模型、规划器和策略若独立设计,可能出现预测质量与控制价值之间的错位;显式搜索也会带来计算开销和模型偏差。 WAM 试图把这些环节连接起来,可以联合生成未来状态与动作,也可以先预测未来,再通过逆动力学将状态变化转换为动作。综述因此强调四项任务:澄清概念边界,建立多轴分类,分析不同机器人领域的用途,以及整理能够验证控制价值的评测方法。

图1|世界—动作模型的发展脉络。原论文将潜在世界模型强化学习、基础视觉—语言—动作模型、视频—动作模型及近期统一模型置于同一时间线,展示预测与动作生成逐步汇合的过程。来源:原文图1。

II. Background | 从世界模型到世界—动作模型

1. 定义与概念边界

论文用部分可观测马尔可夫决策过程描述机器人与环境交互。机器人获得的是图像、本体状态和历史等有限观测,不能直接读取完整环境状态,因此需要从历史中构建可用于预测的表示。 世界模型根据当前状态表示和动作预测下一状态。它回答“执行这个动作之后会发生什么”,其输出可以是潜在状态、图像、奖励或其他任务相关变量。 视觉—语言—动作模型根据观测历史和语言任务生成动作序列,主要回答“现在应该怎么做”,不必显式生成未来状态轨迹。 世界—动作模型把未来轨迹与动作序列放入共享的学习或推理过程。它关注动作与后果的连接,而不是简单地给策略附加一个与控制无关的视频生成器。未来世界也不必以完整 RGB 视频呈现,可以在潜在特征或结构化状态空间中建模。

2. 四条基础研究路线

第一条是世界模型与基于模型的强化学习。PlaNet、Dreamer、TD-MPC 等方法学习状态转移并支持规划或策略优化。循环状态空间模型通过确定性与随机性状态共同表示历史和不确定性,既可预测观测,也可预测奖励。 第二条是视频生成模型。它们从视频历史、图像或文本生成未来视觉序列,为机器人提供丰富的场景演化先验。但视觉未来不自动构成准确的物理动力学,更不自动提供对应的机器人控制量。 第三条是潜在动作预训练。大量互联网视频没有关节、速度或末端位姿标签,潜在动作模型因此从相邻视觉状态的变化中推断抽象行为。这样的表示可能跨场景或跨机器人复用,之后仍需与目标机器人的真实动作空间对齐。 第四条是视觉—语言—动作模型。动作可以通过离散标记的自回归预测产生,也可以通过扩散或流匹配在连续空间生成。它们提供任务条件下的动作接口,与世界预测形成互补。

3. 统一生成视角

综述将相关功能拆为四项:策略生成、正向动力学、逆动力学和视觉规划。策略生成根据历史与指令预测动作;正向动力学根据动作预测未来;逆动力学根据当前与目标未来推断动作;视觉规划根据任务生成目标未来。 这四项功能不要求全部由同一个网络承担。两条主要实现路径分别是:联合建模未来观测与动作的条件分布,以及先生成未来视觉计划,再通过逆动力学推断可执行动作。这一差别贯穿后续架构、训练和部署讨论。

III. Architecture Design & Model Taxonomy | 架构设计与模型分类

1. 模型组件

论文将 WAM 分解为语言接口、视觉编码器、预测骨干和动作解码器四个功能模块。 语言编码器决定任务条件如何进入模型。CLIP 提供全局语义表示,T5 提供细粒度序列特征,自回归大语言模型则可以引入任务理解与推理能力。选择取决于任务所需的语义粒度和计算预算。 视觉编码器决定模型在什么空间预测。二维 VAE 可压缩单帧图像,但时间一致性有限;视频 VAE 联合编码时空结构;DINO、CLIP、SigLIP、视频联合嵌入表示等可用于特征空间预测。点云、占用网格和鸟瞰特征则显式表达几何结构。部分系统直接复用视觉—语言模型的骨干表示。 预测骨干可以从头训练统一 Transformer,也可以借助预训练视频生成模型。后一类方法继承丰富时序先验,但研究重点随之转向如何把生成式视觉动力学与特定机器人的控制空间对齐。 动作解码器包括三类:离散动作标记便于序列建模,但可能损失精度;潜在动作将行为与硬件控制分离,便于使用无动作标签视频;扩散与流匹配动作头直接生成连续控制,能够表达多种行为模式,但通常存在采样开销。

图2|世界—动作模型的组件级框架。语言接口提供任务条件,视觉编码器构建预测状态,预测骨干学习动态变化,动作解码器输出机器人控制。来源:原文图3。

2. 状态转移建模范式

联合预测在共享过程中生成动作与未来观测。GR-1、GR-2 采用序列建模,UWM 等采用视频与动作的扩散建模,WorldVLA 等探索统一标记空间。未来预测既可能用于执行时的前瞻,也可能作为训练辅助信号改善动作表示。 这一范式的关键是平衡不同模态:视频生成占用的计算量和学习信号可能远大于动作输出,视觉改善也不一定带来动作精度提升。因此需要核对预测任务是否真正约束了可执行行为。 逆动力学范式先预测未来状态,再由当前状态与预测状态推断动作。它使任务级未来规划与底层控制接口相对分离。Pathdreamer、Seer、DreamZero 等体现不同程度的“先预测、后行动”设计。 论文还讨论隐式逆动力学变体。Fast-WAM、GigaWorld-Policy 等可以在训练时使用预测结构,而在推理时直接解码动作,减少在线视频生成开销。目标条件模型进一步从“下一步状态”转向更远的目标状态。由此可见,训练中引入未来预测,并不意味着部署时每次都要生成完整未来视频。

3. 架构结构

端到端系统让语言、视觉、本体状态与动作共享骨干,强调统一表示和共同优化。它便于继承大规模预训练先验,但必须处理异构标记之间的对齐,防止某种模态主导训练。 双系统将世界预测与动作生成交给不同模块,通过中间表示连接。接口可以是混合 Transformer 中的模态专属投影和共享注意力,也可以是向动作专家注入预测特征的交叉注意力。模块化有利于调整不同计算频率和平台接口,但增加了接口设计与误差协调的复杂度。 这与联合预测、逆动力学是两个独立维度:统一骨干可以实现两种转移范式,双系统也可以采用联合或分解式建模。不能把“端到端”等同于“联合预测”,或把“双系统”等同于“逆动力学”。

图3|架构与转移范式的交叉分类。图中分别展示统一骨干与视觉/动作专家分离,以及联合预测与预测后动作生成的不同组合。来源:原文图5。

4. 策略训练流程

预训练包括时空表示、动作表示以及视频—动作对齐。大规模视频提供对象交互与场景变化先验,多视角预训练进一步提供几何约束。动作表示可通过离散化、频率分解或潜在动作学习获得。对齐则可以同时利用正向动力学、逆动力学、动作生成和视频生成目标。 后训练包括策略微调、数据增强和强化学习。微调将通用表示适配到目标机器人的传感器、动作空间与部署条件,LoRA、轻量适配器和残差动作头可以降低调整成本。逆动力学路线还需控制预测计划与真实执行之间的偏差。 数据增强有两种不同用途。一种改变原轨迹的外观、照明或风格,同时保留任务语义及有效动作对应关系;另一种生成新轨迹,再用逆动力学或潜在动作接口恢复伪动作标签。后一种会引入额外的动作推断误差,不能仅凭视频逼真度判断合成数据质量。 强化学习可在物理仿真、真实机器人或学习到的世界模型中进行。真实交互直接面对执行条件,但成本高;物理仿真存在迁移差距;想象交互减少物理采样,却可能让策略利用模型错误。World4RL、World-VLA-Loop 等代表预测环境与策略改进的连接方向,其可扩展性仍有待研究。

图4|预训练与后训练流程。前者学习时空先验、动作表示及二者对齐;后者通过微调、数据增强和不同环境中的强化学习适配策略。来源:原文图6。

5. 数据模态、规模与混合

语言描述高层意图;多视角视频提供环境线索;三维结构支持空间推理;触觉和声音揭示接触、柔顺性与事件;本体状态提供关节和末端等直接物理信息。模态选择会决定模型能否识别视觉难以辨认、却直接影响动作的状态。 数据来源形成一个金字塔:大量互联网视频提供宽泛世界先验,第一人称人类示范提供更接近任务的运动与交互信息,规模较小的机器人轨迹提供精确动作监督。DROID、BridgeData、Open X-Embodiment 等因此是将视觉知识落到可控执行的重要资源。 扩展数据不能只增加视频数量。无动作标签视频、任务相关示范和具身轨迹的混合比例,以及视觉变化与控制标签的对应质量,会直接影响模型学到的是一般运动规律,还是可执行的动作后果。

图5|数据模态与数据金字塔。左侧列出语言、多视角、三维、接触/声音及本体状态的互补作用;右侧强调大量无动作标签视频与少量具身轨迹分别贡献先验和动作落地监督。来源:原文图7。

IV. Applications | 应用

1. 机器人操作

操作任务要求预测对象状态、遮挡、接触动力学和任务进展。论文按三组介绍方法。 第一组是视频—动作与统一策略,通过未来预测塑造轨迹级动作表示,或在推理时使用预测目标。第二组是结构化状态模型,如点云、粒子和高斯表示,将预测空间向几何与物理控制变量靠近;触觉与声音进一步补充接触和材料交互。第三组将世界模型视为想象环境,用于策略优化、评估及合成失败恢复轨迹。 三组方法的共同检验标准是:预测是否改善了真实可执行控制,特别是在接触丰富、分布变化和长时序任务中。训练辅助预测有效与在线规划有效是不同结论,需要分别验证。

2. 导航

导航相对少受细粒度接触影响,却更依赖部分可观测条件下的长距离空间推理。世界模型可预测未来第一人称视图、语义地图或潜在状态,帮助选择路点。 前瞻规划方法让世界模型产生候选未来,再交给搜索或规划器选择动作。潜在规划与世界模型强化学习则减少显式图像生成,用紧凑表示支持实时命令或想象训练。腿式机器人还需要结合地形、本体状态和候选速度,预测运动结果与失败风险。 这一领域的价值体现在路点选择、长时序一致性和遮挡条件下的鲁棒性。是否输出精美图像并非判断导航能力的必要条件。

3. 自动驾驶

驾驶同时受到实时性、安全和多智能体交互约束。综述首先讨论可控视频生成及结构化场景预测:前者支持交通场景合成、数据增强与策略条件评估,后者使用占用表示预测自由空间、动态主体和潜在碰撞。 其次,统一驾驶模型连接场景预测与轨迹/动作生成,世界模型强化学习则通过想象交互改进策略。对稀有危险事件,这种能力具有吸引力,但前提是模型对动作后果及其他交通参与者反应保持可信。 因此,驾驶评测必须将视频真实感、交通一致性和闭环安全结合。记录数据上的轨迹拟合不能替代反馈执行中的碰撞、违规和舒适度评估。

V. Datasets, Benchmarks, and Evaluation Metrics | 数据集、基准与评测指标

1. 指标家族与评测协议

任务级指标包括成功率、路线完成度、驾驶分数、回合回报与任务链长度,最接近最终控制目标。但成功率提高仍需分析来自更好的预测、更强的模仿先验,还是额外训练数据。 轨迹指标包括平均/最终位移误差、导航误差、路径长度加权成功率、归一化动态时间规整,以及绝对/相对位姿误差。它们描述路径一致性,但不能单独保证闭环安全。 生成指标包括 FID、FVD、LPIPS、PSNR 和 SSIM,衡量图像或视频质量。语义、语言和占用指标用于结构化输出。延迟、碰撞、舒适度和违规次数则反映部署约束。最有解释力的报告应同时呈现预测质量、动作对应关系和下游控制效果。

2. 机器人示范与人类视频语料

DROID、BridgeData V2、Open X-Embodiment 和 AgiBot-World 主要提供动作落地监督,支持预训练和平台适配。它们与单独定义测试协议的基准并不是同一类资源。 Something-Something v2、Ego4D、EgoDex、Kinetics-700 和 HowTo100M 扩展了运动、交互与语言先验,但没有直接指定目标机器人的控制动作,其贡献通常要在动作对齐和下游微调之后衡量。不同资源以轨迹、小时、片段或类别统计规模,不能直接按数字大小比较。

3. 仿真操作任务套件

LIBERO、CALVIN、MetaWorld、RLBench、ManiSkill、RoboTwin、RoboCasa、SimplerEnv、Push-T 等覆盖语言条件、长任务链、双臂、厨房场景泛化和接触行为等不同设置。CALVIN 强调长时序任务链,Push-T 等则提供更聚焦的交互测试。 这些任务并不可互换。短时序单物体成功不等于跨场景泛化或长链可靠性。对于视频式 WAM,还需将任务成功与预测质量共同报告,避免仅展示其中一项。

4. 自动驾驶数据与仿真器

nuScenes、Waymo Open Motion、BDD100K、KITTI、Argoverse、OpenDV 等记录数据支持视觉生成、轨迹、占用和感知评估。CARLA、Bench2Drive 等用于反馈执行;NAVSIM 则采用数据驱动的非反应式/伪仿真协议,应与完整交互式仿真区分。 选择指标决定结论的含义。视觉距离改善说明生成分布更接近参考数据,轨迹误差改善说明结构预测更准确,而驾驶分数、碰撞、违规和舒适度才能进一步说明执行效用。应同时注明测试环境和协议边界。

5. 导航环境、数据与基准

Matterport3D 提供空间扫描,Habitat 提供具身仿真环境,R2R、RxR 及连续环境变体定义语言导航协议,ScaleVLN 扩展训练轨迹。真实轨迹资源则补充平台与环境差异。 成功率需要结合路径效率、目标距离与参考路径一致性解读。模型既要到达正确目标,也要在未见环境和有限观测下合理选择路径,才能体现预测规划的价值。

6. 基础强化学习基准

DMControl、Atari、Craftax、Procgen 和 BSuite 等帮助检验预测模型是否支持规划、价值学习及策略改进。但它们简化了真实机器人的传感器、接触、硬件和安全约束,不能替代具身评估。FMB 等真实操作资源通过成功率与周期时间,把方法验证重新连接到物理执行。

VI. Open Challenges and Future Directions | 开放挑战与未来方向

1. 运动意图与动作对齐

“希望发生什么变化”与“机器人怎样完成变化”是两项任务。互联网视频充足,而精确动作标签稀缺,适合先学习运动意图,再用具身数据对齐执行接口。但分阶段训练必须防止计划不可达或动作解码不准确。 同时,动作对齐可能破坏预训练视觉先验。冻结参数、对齐层和残差动作头可以限制控制相关更新,更强的抗遗忘机制仍值得研究。关键是让有限机器人数据补充执行知识,同时保留通用视觉动力学。

2. 世界与动作的因子分解

世界模型学习动作条件下的环境转移,策略学习能够提高累计收益的动作选择,两者目标不同。论文因此讨论分别训练和推理的价值:世界模型可持续改进并复用于离线强化学习、运行时规划或模型预测控制。 共同优化也可能产生问题:模型生成过于乐观的未来,策略利用这些错误而在真实环境失效。因子分解提供了控制和诊断接口,但并不自动消除模型偏差,还需要协调世界模型与策略的数据覆盖和更新过程。

3. 空间与多视角一致性

视频骨干可能在单视角上合理,却无法保持对象恒存、遮挡关系与跨视角几何一致性。这会同时破坏状态估计、规划及逆动力学解码。 点云、占用场和三维高斯等显式表示有助于把预测约束到空间结构,但要与大规模生成骨干及高效动作解码连接。第一人称示范提供手物交互线索,固定相机外参也有助于施加跨视角约束。未来方向是让不同视图描述同一个可行动的三维世界。

4. 长时序记忆

长任务需要保留进展、过去交互和暂时被遮挡的信息。简单扩大视觉窗口会增加成本并引入冗余,因此需要紧凑、选择性的记忆。 模型内记忆可以组合视频短期记忆、文本长期记忆或关键事件存储,并同时影响未来预测与动作解码。另一条路线在策略外部维护执行记录、成功规则和失败模型,支持验证与恢复。前者通常需要专门训练,后者强调模块化组织,二者都必须检验记忆是否改善长链执行。

5. 神经仿真器与闭环策略学习

模仿学习擅长拟合专家行为,却可能缺少纠偏和从失败中改进的能力。神经仿真器通过学习动作条件动力学提供想象环境,使策略在不增加同等真实交互成本的情况下接受评估和优化。 困难在于想象误差随步数累积,以及奖励和长时序信用分配是否可靠。真实强化学习受样本成本约束,物理仿真受迁移差距约束,神经仿真则受模型偏差约束。利用任务奖励、目标条件和学习奖励模型改善闭环策略具有潜力,但大规模无奖励与离线学习仍是开放问题。

6. 推理延迟与计算效率

多步采样、长预测轨迹和动作解码可能让反馈到达过晚。在动态或接触场景中,延迟直接影响控制效果,因此必须作为系统能力的一部分评测。 少步生成、一致性模型、平均流和相关流方法可减少采样成本;量化、剪枝、算子融合、蒸馏及缓存复用可降低部署开销。系统还需共同选择预测长度、候选轨迹数量、重规划频率和动作块长度。加速后的模型必须保留动作条件转移和时间一致性,不能仅以吞吐量衡量改进。

VII. Conclusion | 总结

世界—动作模型希望缩小“预测环境变化”与“生成可执行控制”之间的距离。其核心价值在于让预测参与动作选择、策略学习或逆动力学解码,并在反馈中接受验证。 这篇综述提供了一套理解相关工作的框架:先看预测空间和动作接口,再看转移范式与架构,随后考察训练数据、应用用途及评测协议。可靠的未来预测应当与动作落地对应,保持空间和时间一致性,表达不确定性,支持闭环改进,并满足实时约束。 对机器人研究而言,更有说服力的进展将来自多模态与三维表示、动作对齐、神经仿真、强化学习和真实反馈之间的协同,以及能够同时衡量任务成功、安全、鲁棒性和跨平台迁移的基准。 原文链接:https://arxiv.org/abs/2609.16074 PDF 下载:https://arxiv.org/pdf/2609.16074

成为VIP会员查看完整内容
1

相关内容

综述 | 世界动作模型:少做梦,多行动
专知会员服务
15+阅读 · 6月23日
世界动作模型: 具身AI的下一个前沿
专知会员服务
24+阅读 · 5月13日
【综述】 机器人学习中的世界模型:全面综述
专知会员服务
22+阅读 · 5月4日
自动驾驶的世界模型综述
专知会员服务
49+阅读 · 2025年1月22日
理解世界还是预测未来?世界模型的综合综述
专知会员服务
79+阅读 · 2024年11月26日
绝对干货!NLP预训练模型:从transformer到albert
新智元
15+阅读 · 2019年11月10日
【机器人】机器人PID控制
产业智能官
10+阅读 · 2018年11月25日
报名 | 让机器读懂你的意图——人体姿态估计入门
人工智能头条
10+阅读 · 2017年9月19日
国家自然科学基金
15+阅读 · 2016年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
8+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
VIP会员
最新内容
致命七类无人机:无人机时代的演进型合成兵种
《异构无人水面艇集群作战自主制导算法》130页
《人工智能能通过美国陆军战争学院吗?》报告
军事域人工智能驱动系统的治理
专知会员服务
4+阅读 · 9月14日
相关VIP内容
相关基金
国家自然科学基金
15+阅读 · 2016年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
8+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员