Robot learning requires adaptation methods that improve reliably from limited, mixed-quality interaction data. This is especially challenging in long-horizon, contact-rich tasks, where end-to-end policy finetuning remains inefficient and brittle. World models offer a compelling alternative: by predicting the outcomes of candidate action sequences, they enable online planning through counterfactual reasoning. However, training action-conditioned robotic world models directly in the real world requires diverse data at impractical scale. We introduce Simulation Distillation (SimDist), a framework that uses physics simulators as a scalable source of action-conditioned robot experience. During pretraining, SimDist distills structural priors from the simulator into a world model that enables planning from raw real-world observations. During real-world adaptation, SimDist transfers the encoder, reward model, and value function learned in simulation, and updates only the latent dynamics model using real-world prediction losses. This reduces adaptation to supervised system identification while preserving dense, long-horizon planning signals for online improvement. Across contact-rich manipulation and quadruped locomotion tasks, SimDist rapidly improves with experience, while prior adaptation methods struggle to make progress or degrade during online finetuning. Project website and code: https://sim-dist.github.io


翻译:机器人学习需要一种能够从有限且质量参差的交互数据中可靠提升性能的自适应方法。这在长时域、高接触任务中尤为困难——端到端策略微调效率低下且极不稳定。世界模型提供了极具竞争力的替代方案:通过预测候选动作序列的结果,世界模型能够利用反事实推理实现在线规划。然而,直接在现实世界中训练基于动作条件的机器人世界模型,需要规模难以企及的多样化数据。我们提出"模拟蒸馏"(SimDist)框架——该框架利用物理仿真器作为可扩展的、基于动作条件的机器人经验来源。在预训练阶段,SimDist将仿真器中的结构化先验蒸馏至世界模型,使其能基于原始现实观测进行规划。在现实世界自适应阶段,SimDist迁移仿真环境中学习到的编码器、奖励模型与价值函数,仅通过现实世界中的预测损失更新潜态动力学模型。这种设计将自适应过程简化为有监督的系统辨识,同时保留密集的长时域规划信号用于在线优化。在接触丰富的操控任务与四足机器人运动任务中,SimDist能随经验快速提升性能,而现有自适应方法却难以取得进展,甚至在线微调阶段出现性能退化。项目网站及代码:https://sim-dist.github.io

0
下载
关闭预览

相关内容

ACM/IEEE第23届模型驱动工程语言和系统国际会议,是模型驱动软件和系统工程的首要会议系列,由ACM-SIGSOFT和IEEE-TCSE支持组织。自1998年以来,模型涵盖了建模的各个方面,从语言和方法到工具和应用程序。模特的参加者来自不同的背景,包括研究人员、学者、工程师和工业专业人士。MODELS 2019是一个论坛,参与者可以围绕建模和模型驱动的软件和系统交流前沿研究成果和创新实践经验。今年的版本将为建模社区提供进一步推进建模基础的机会,并在网络物理系统、嵌入式系统、社会技术系统、云计算、大数据、机器学习、安全、开源等新兴领域提出建模的创新应用以及可持续性。 官网链接:http://www.modelsconference.org/
【综述】 机器人学习中的世界模型:全面综述
专知会员服务
21+阅读 · 5月4日
《图世界模型:概念、分类体系与未来方向》
专知会员服务
22+阅读 · 5月1日
智能体化世界建模:基础、能力、规律及展望
专知会员服务
24+阅读 · 4月28日
【MIT博士论文】通过神经物理构建世界模型
专知会员服务
36+阅读 · 2025年4月3日
自动驾驶的世界模型综述
专知会员服务
48+阅读 · 2025年1月22日
多模态预训练模型简述
专知会员服务
115+阅读 · 2021年4月27日
绝对干货!NLP预训练模型:从transformer到albert
新智元
14+阅读 · 2019年11月10日
深度学习时代的图模型,清华发文综述图网络
GAN生成式对抗网络
13+阅读 · 2018年12月23日
展望:模型驱动的深度学习
人工智能学家
12+阅读 · 2018年1月23日
国家自然科学基金
43+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
国家自然科学基金
16+阅读 · 2013年12月31日
国家自然科学基金
19+阅读 · 2012年12月31日
国家自然科学基金
23+阅读 · 2009年12月31日
VIP会员
最新内容
《无人机脆弱性利用:网络空间力量的新域》
专知会员服务
2+阅读 · 今天4:08
美空军如何将人工智能从战场部署至后方机关
专知会员服务
11+阅读 · 7月31日
《史诗怒火行动:多域前瞻评估》49页报告
专知会员服务
7+阅读 · 7月31日
《英国防部:未来空战系统数字化战略》33页
专知会员服务
5+阅读 · 7月31日
《面向自主飞行网络的智能体人工智能架构》
专知会员服务
7+阅读 · 7月31日
“史诗怒火”行动:现代多域作战的重要节点
专知会员服务
8+阅读 · 7月30日
《下一代无线网络中的多无人机通信资源管理》
相关VIP内容
【综述】 机器人学习中的世界模型:全面综述
专知会员服务
21+阅读 · 5月4日
《图世界模型:概念、分类体系与未来方向》
专知会员服务
22+阅读 · 5月1日
智能体化世界建模:基础、能力、规律及展望
专知会员服务
24+阅读 · 4月28日
【MIT博士论文】通过神经物理构建世界模型
专知会员服务
36+阅读 · 2025年4月3日
自动驾驶的世界模型综述
专知会员服务
48+阅读 · 2025年1月22日
多模态预训练模型简述
专知会员服务
115+阅读 · 2021年4月27日
相关基金
国家自然科学基金
43+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
国家自然科学基金
16+阅读 · 2013年12月31日
国家自然科学基金
19+阅读 · 2012年12月31日
国家自然科学基金
23+阅读 · 2009年12月31日
Top
微信扫码咨询专知VIP会员