HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations - 专知论文

会员服务 ·

0

操作 · 演示 · 机器人 · 接口 · 设计 ·

HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations

翻译：HoMMI：从人类演示中学习全身移动操作

Xiaomeng Xu,Jisang Park,Han Zhang,Eric Cousineau,Aditya Bhat,Jose Barreiros,Dian Wang,Shuran Song

We present Whole-Body Mobile Manipulation Interface (HoMMI), a data collection and policy learning framework that learns whole-body mobile manipulation directly from robot-free human demonstrations. We augment UMI interfaces with egocentric sensing to capture the global context required for mobile manipulation, enabling portable, robot-free, and scalable data collection. However, naively incorporating egocentric sensing introduces a larger human-to-robot embodiment gap in both observation and action spaces, making policy transfer difficult. We explicitly bridge this gap with a cross-embodiment hand-eye policy design, including an embodiment agnostic visual representation; a relaxed head action representation; and a whole-body controller that realizes hand-eye trajectories through coordinated whole-body motion under robot-specific physical constraints. Together, these enable long-horizon mobile manipulation tasks requiring bimanual and whole-body coordination, navigation, and active perception. Results are best viewed on: https://hommi-robot.github.io

翻译：本文提出全身移动操作接口（HoMMI），一种直接从无机器人参与的人类演示中学习全身移动操作的数据收集与策略学习框架。我们通过自我中心感知增强UMI接口，以捕捉移动操作所需的全局环境信息，从而实现便携、无需机器人参与且可扩展的数据收集。然而，简单引入自我中心感知会在观测空间与动作空间引入更大的人-机器人具身差异，导致策略迁移困难。我们通过跨具身手眼策略设计显式弥合这一差异，包括：具身无关的视觉表征；宽松化的头部动作表征；以及通过机器人特定物理约束下的协调全身运动实现手眼轨迹的全身控制器。这些设计共同实现了需要双手协调、全身协同、导航与主动感知的长时程移动操作任务。完整结果请参阅：https://hommi-robot.github.io

0

相关内容

大语言模型在人类移动性领域的应用：机遇、挑战与未来方向

大语言模型在人类移动性领域的应用：机遇、挑战与未来方向

专知会员服务

15+阅读 · 3月17日

【斯坦福博士论文】移动操作机器人的学习系统构建研究

【斯坦福博士论文】移动操作机器人的学习系统构建研究

专知会员服务

14+阅读 · 2025年11月14日

面向具身操作的视觉-语言-动作模型综述

面向具身操作的视觉-语言-动作模型综述

专知会员服务

28+阅读 · 2025年8月23日

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

专知会员服务

34+阅读 · 2025年8月19日

具身智能学习综述：基于物理模拟器与世界模型的方法

具身智能学习综述：基于物理模拟器与世界模型的方法

专知会员服务

35+阅读 · 2025年7月2日

大规模语言模型智能体的终身学习：发展路线图

大规模语言模型智能体的终身学习：发展路线图

专知会员服务

46+阅读 · 2025年1月16日

EAI（具身智能）：驱动通用人工智能与机器人产业的关键技术

EAI（具身智能）：驱动通用人工智能与机器人产业的关键技术

专知会员服务

56+阅读 · 2024年11月28日

《Swarm-GPT：将大型语言模型与无人机蜂群编排设计的安全运动规划相结合》最新论文

《Swarm-GPT：将大型语言模型与无人机蜂群编排设计的安全运动规划相结合》最新论文

专知会员服务

103+阅读 · 2024年1月20日

MM-REACT:提示ChatGPT进行多模态推理和行动

MM-REACT:提示ChatGPT进行多模态推理和行动

专知会员服务

35+阅读 · 2023年3月26日

最新《模仿学习(Imitation Learning》进展报告, 加州理工Yisong Yue教授，附下载

最新《模仿学习(Imitation Learning》进展报告, 加州理工Yisong Yue教授，附下载

专知会员服务

41+阅读 · 2020年12月6日

精通ChatGPT等大模型，掌握最前沿技术，这有份绝佳资源

精通ChatGPT等大模型，掌握最前沿技术，这有份绝佳资源

机器之心

15+阅读 · 2023年4月12日

推荐！【DARPA终身学习机器（L2M）】《自主系统中用于感知和行动的终身学习》美空军、宾大2022最新234页技术报告

推荐！【DARPA终身学习机器（L2M）】《自主系统中用于感知和行动的终身学习》美空军、宾大2022最新234页技术报告

专知

27+阅读 · 2022年11月24日

浅谈主动学习（Active Learning）

浅谈主动学习（Active Learning）

凡人机器学习

32+阅读 · 2020年6月18日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

八千字长文深度解读，迁移学习在强化学习中的应用及最新进展

八千字长文深度解读，迁移学习在强化学习中的应用及最新进展

机器之心

13+阅读 · 2019年10月17日

概述自动机器学习（AutoML）

概述自动机器学习（AutoML）

人工智能学家

19+阅读 · 2019年8月11日

从虚拟到现实，北大等提出基于强化学习的端到端主动目标跟踪方法

从虚拟到现实，北大等提出基于强化学习的端到端主动目标跟踪方法

机器之心

23+阅读 · 2019年4月13日

FAGAN：完全注意力机制（Full Attention）GAN，Self-attention+GAN

FAGAN：完全注意力机制（Full Attention）GAN，Self-attention+GAN

专知

32+阅读 · 2018年8月14日

变分自编码器（Variational Autoencoder, VAE）通俗教程，细节、基础、符号解释很齐全

变分自编码器（Variational Autoencoder, VAE）通俗教程，细节、基础、符号解释很齐全

CreateAMind

12+阅读 · 2018年4月7日

深度 | 迁移学习全面概述：从基本概念到相关研究

深度 | 迁移学习全面概述：从基本概念到相关研究

七月在线实验室

15+阅读 · 2017年8月15日

基于单目RGB/RGBD相机的身体运动和面部运动同步捕获方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

基于人机交互的数据驱动式人群行为建模与仿真研究

国家自然科学基金

4+阅读 · 2015年12月31日

移动增强现实中基于视觉—惯性传感器的混合跟踪方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

仿人轻型机械臂人机协作模式关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向人体运动干扰和生物安全的无线体域网协作通信技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

局部可视环境中基于视觉和触觉感知的灵巧手精细操作的方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

移动与可穿戴计算中Eyes-Free交互界面研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于深度学习的特征融合在移动机器人视觉中的场景理解及研究

国家自然科学基金

12+阅读 · 2014年12月31日

基于逆向强化学习和人工智能的移动机器人自主学习方法研究

国家自然科学基金

12+阅读 · 2013年12月31日

数据和模型混合驱动的虚拟人群行为仿真技术研究及其在军事中的应用

国家自然科学基金

10+阅读 · 2011年12月31日

UniPrototype: Humn-Robot Skill Learning with Uniform Prototypes

Arxiv

0+阅读 · 3月14日

HumDex:Humanoid Dexterous Manipulation Made Easy

Arxiv

0+阅读 · 3月12日

TeamHOI: Learning a Unified Policy for Cooperative Human-Object Interactions with Any Team Size

Arxiv

0+阅读 · 3月9日

LHM-Humanoid: Learning a Unified Policy for Long-Horizon Humanoid Whole-Body Loco-Manipulation in Diverse Messy Environments

Arxiv

0+阅读 · 3月5日

EgoPush: Learning End-to-End Egocentric Multi-Object Rearrangement for Mobile Robots

Arxiv

0+阅读 · 2月20日

AdaptManip: Learning Adaptive Whole-Body Object Lifting and Delivery with Online Recurrent State Estimation

Arxiv

0+阅读 · 2月16日

Humanoid Manipulation Interface: Humanoid Whole-Body Manipulation from Robot-Free Demonstrations

Arxiv

0+阅读 · 2月12日

HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba

Arxiv

0+阅读 · 2月11日

TeleGate: Whole-Body Humanoid Teleoperation via Gated Expert Selection with Motion Prior

Arxiv

0+阅读 · 2月10日

InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object Interactions

Arxiv

0+阅读 · 2月1日

VIP会员

文章信息

相关主题

最新内容

具身智能安全综述：风险、攻击与防御的多层分类框架

具身智能安全综述：风险、攻击与防御的多层分类框架

专知会员服务

0+阅读 · 4分钟前

【ICML 2026】GLANCE：用视觉-语言好奇心驱动VLM智能体主动探索

【ICML 2026】GLANCE：用视觉-语言好奇心驱动VLM智能体主动探索

专知会员服务

2+阅读 · 59分钟前

具身AI安全综述：风险、攻击与防御

具身AI安全综述：风险、攻击与防御

专知会员服务

2+阅读 · 今天12:02

DeepSeek 版Claude Code，免费小白安装教程来了！

DeepSeek 版Claude Code，免费小白安装教程来了！

专知会员服务

13+阅读 · 5月5日

【ICML Spotlight 2026】 T²PO: 不确定性引导的探索控制框架，实现稳定多轮Agentic强化学习

【ICML Spotlight 2026】 T²PO: 不确定性引导的探索控制框架，实现稳定多轮Agentic强化学习

专知会员服务

6+阅读 · 5月5日

基础模型驱动的工业智能体：技术成熟度、能力变迁与未竟之挑战

基础模型驱动的工业智能体：技术成熟度、能力变迁与未竟之挑战

专知会员服务

8+阅读 · 5月5日

《机动炮兵的演进与未来：技术进步、历史沿革与炮兵作战前瞻》

《机动炮兵的演进与未来：技术进步、历史沿革与炮兵作战前瞻》

专知会员服务

8+阅读 · 5月5日

《火炮弹药快速效能建模：提升互操作性与技术优势》（报告）

《火炮弹药快速效能建模：提升互操作性与技术优势》（报告）

专知会员服务

10+阅读 · 5月5日

《美空军条令出版物 2-0：情报（2026版）》

《美空军条令出版物 2-0：情报（2026版）》

专知会员服务

15+阅读 · 5月5日

美陆军“飞蝇陷阱5.0”项目将新兴技术交到作战人员手中

美陆军“飞蝇陷阱5.0”项目将新兴技术交到作战人员手中

专知会员服务

7+阅读 · 5月5日

帕兰提尔 Gotham：一个游戏规则改变器

帕兰提尔 Gotham：一个游戏规则改变器

专知会员服务

9+阅读 · 5月5日

【ICML 2026】用测试时训练线性化视觉Transformer：T⁵ 实现 Softmax 注意力到线性复杂度的快速转换

【ICML 2026】用测试时训练线性化视觉Transformer：T⁵ 实现 Softmax 注意力到线性复杂度的快速转换

专知会员服务

3+阅读 · 5月5日

【AAAI 2026】大模型做知识蒸馏：CMM将LLM特征拆解给小模型协同学习

【AAAI 2026】大模型做知识蒸馏：CMM将LLM特征拆解给小模型协同学习

专知会员服务

3+阅读 · 5月5日

【ICML Spotlight 2026 】NonZero：交互引导探索的多智能体蒙特卡洛树搜索

【ICML Spotlight 2026 】NonZero：交互引导探索的多智能体蒙特卡洛树搜索

专知会员服务

8+阅读 · 5月4日

【综述】机器人学习中的世界模型：全面综述

【综述】机器人学习中的世界模型：全面综述

专知会员服务

14+阅读 · 5月4日

相关VIP内容

大语言模型在人类移动性领域的应用：机遇、挑战与未来方向

大语言模型在人类移动性领域的应用：机遇、挑战与未来方向

专知会员服务

15+阅读 · 3月17日

【斯坦福博士论文】移动操作机器人的学习系统构建研究

【斯坦福博士论文】移动操作机器人的学习系统构建研究

专知会员服务

14+阅读 · 2025年11月14日

面向具身操作的视觉-语言-动作模型综述

面向具身操作的视觉-语言-动作模型综述

专知会员服务

28+阅读 · 2025年8月23日

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

专知会员服务

34+阅读 · 2025年8月19日

具身智能学习综述：基于物理模拟器与世界模型的方法

具身智能学习综述：基于物理模拟器与世界模型的方法

专知会员服务

35+阅读 · 2025年7月2日

大规模语言模型智能体的终身学习：发展路线图

大规模语言模型智能体的终身学习：发展路线图

专知会员服务

46+阅读 · 2025年1月16日

EAI（具身智能）：驱动通用人工智能与机器人产业的关键技术

EAI（具身智能）：驱动通用人工智能与机器人产业的关键技术

专知会员服务

56+阅读 · 2024年11月28日

《Swarm-GPT：将大型语言模型与无人机蜂群编排设计的安全运动规划相结合》最新论文

《Swarm-GPT：将大型语言模型与无人机蜂群编排设计的安全运动规划相结合》最新论文

专知会员服务

103+阅读 · 2024年1月20日

MM-REACT:提示ChatGPT进行多模态推理和行动

MM-REACT:提示ChatGPT进行多模态推理和行动

专知会员服务

35+阅读 · 2023年3月26日

最新《模仿学习(Imitation Learning》进展报告, 加州理工Yisong Yue教授，附下载

最新《模仿学习(Imitation Learning》进展报告, 加州理工Yisong Yue教授，附下载

专知会员服务

41+阅读 · 2020年12月6日

热门VIP内容

开通专知VIP会员享更多权益服务

【ICML 2026】GLANCE：用视觉-语言好奇心驱动VLM智能体主动探索

DeepSeek 版Claude Code，免费小白安装教程来了！

具身智能安全综述：风险、攻击与防御的多层分类框架

具身AI安全综述：风险、攻击与防御

相关资讯

精通ChatGPT等大模型，掌握最前沿技术，这有份绝佳资源

精通ChatGPT等大模型，掌握最前沿技术，这有份绝佳资源

机器之心

15+阅读 · 2023年4月12日

推荐！【DARPA终身学习机器（L2M）】《自主系统中用于感知和行动的终身学习》美空军、宾大2022最新234页技术报告

推荐！【DARPA终身学习机器（L2M）】《自主系统中用于感知和行动的终身学习》美空军、宾大2022最新234页技术报告

专知

27+阅读 · 2022年11月24日

浅谈主动学习（Active Learning）

浅谈主动学习（Active Learning）

凡人机器学习

32+阅读 · 2020年6月18日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

八千字长文深度解读，迁移学习在强化学习中的应用及最新进展

八千字长文深度解读，迁移学习在强化学习中的应用及最新进展

机器之心

13+阅读 · 2019年10月17日

概述自动机器学习（AutoML）

概述自动机器学习（AutoML）

人工智能学家

19+阅读 · 2019年8月11日

从虚拟到现实，北大等提出基于强化学习的端到端主动目标跟踪方法

从虚拟到现实，北大等提出基于强化学习的端到端主动目标跟踪方法

机器之心

23+阅读 · 2019年4月13日

FAGAN：完全注意力机制（Full Attention）GAN，Self-attention+GAN

FAGAN：完全注意力机制（Full Attention）GAN，Self-attention+GAN

专知

32+阅读 · 2018年8月14日

变分自编码器（Variational Autoencoder, VAE）通俗教程，细节、基础、符号解释很齐全

变分自编码器（Variational Autoencoder, VAE）通俗教程，细节、基础、符号解释很齐全

CreateAMind

12+阅读 · 2018年4月7日

深度 | 迁移学习全面概述：从基本概念到相关研究

深度 | 迁移学习全面概述：从基本概念到相关研究

七月在线实验室

15+阅读 · 2017年8月15日

相关论文

UniPrototype: Humn-Robot Skill Learning with Uniform Prototypes

Arxiv

0+阅读 · 3月14日

HumDex:Humanoid Dexterous Manipulation Made Easy

Arxiv

0+阅读 · 3月12日

TeamHOI: Learning a Unified Policy for Cooperative Human-Object Interactions with Any Team Size

Arxiv

0+阅读 · 3月9日

LHM-Humanoid: Learning a Unified Policy for Long-Horizon Humanoid Whole-Body Loco-Manipulation in Diverse Messy Environments

Arxiv

0+阅读 · 3月5日

EgoPush: Learning End-to-End Egocentric Multi-Object Rearrangement for Mobile Robots

Arxiv

0+阅读 · 2月20日

AdaptManip: Learning Adaptive Whole-Body Object Lifting and Delivery with Online Recurrent State Estimation

Arxiv

0+阅读 · 2月16日

Humanoid Manipulation Interface: Humanoid Whole-Body Manipulation from Robot-Free Demonstrations

Arxiv

0+阅读 · 2月12日

HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba

Arxiv

0+阅读 · 2月11日

TeleGate: Whole-Body Humanoid Teleoperation via Gated Expert Selection with Motion Prior

Arxiv

0+阅读 · 2月10日

InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object Interactions

Arxiv

0+阅读 · 2月1日

相关基金

基于单目RGB/RGBD相机的身体运动和面部运动同步捕获方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

基于人机交互的数据驱动式人群行为建模与仿真研究

国家自然科学基金

4+阅读 · 2015年12月31日

移动增强现实中基于视觉—惯性传感器的混合跟踪方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

仿人轻型机械臂人机协作模式关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向人体运动干扰和生物安全的无线体域网协作通信技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

局部可视环境中基于视觉和触觉感知的灵巧手精细操作的方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

移动与可穿戴计算中Eyes-Free交互界面研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于深度学习的特征融合在移动机器人视觉中的场景理解及研究

国家自然科学基金

12+阅读 · 2014年12月31日

基于逆向强化学习和人工智能的移动机器人自主学习方法研究

国家自然科学基金

12+阅读 · 2013年12月31日

数据和模型混合驱动的虚拟人群行为仿真技术研究及其在军事中的应用

国家自然科学基金

10+阅读 · 2011年12月31日

微信扫码咨询专知VIP会员