Robo3R：通过精确前馈三维重建增强机器人操作能力 (Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction) - 专知论文

会员服务 ·

0

重建 · 操作 · 机器人操作 · 前馈 · 机器人 ·

Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction

翻译：Robo3R：通过精确前馈三维重建增强机器人操作能力

Sizhe Yang,Linning Xu,Hao Li,Juncheng Mu,Jia Zeng,Dahua Lin,Jiangmiao Pang

3D spatial perception is fundamental to generalizable robotic manipulation, yet obtaining reliable, high-quality 3D geometry remains challenging. Depth sensors suffer from noise and material sensitivity, while existing reconstruction models lack the precision and metric consistency required for physical interaction. We introduce Robo3R, a feed-forward, manipulation-ready 3D reconstruction model that predicts accurate, metric-scale scene geometry directly from RGB images and robot states in real time. Robo3R jointly infers scale-invariant local geometry and relative camera poses, which are unified into the scene representation in the canonical robot frame via a learned global similarity transformation. To meet the precision demands of manipulation, Robo3R employs a masked point head for sharp, fine-grained point clouds, and a keypoint-based Perspective-n-Point (PnP) formulation to refine camera extrinsics and global alignment. Trained on Robo3R-4M, a curated large-scale synthetic dataset with four million high-fidelity annotated frames, Robo3R consistently outperforms state-of-the-art reconstruction methods and depth sensors. Across downstream tasks including imitation learning, sim-to-real transfer, grasp synthesis, and collision-free motion planning, we observe consistent gains in performance, suggesting the promise of this alternative 3D sensing module for robotic manipulation.

翻译：三维空间感知是实现可泛化机器人操作的基础，然而获取可靠、高质量的三维几何信息仍具挑战性。深度传感器受噪声和材料敏感性影响，而现有重建模型缺乏物理交互所需的精度与度量一致性。我们提出Robo3R——一种前馈式、即插即用的三维重建模型，能够直接从RGB图像和机器人状态实时预测精确的度量级场景几何。Robo3R联合推断尺度不变的局部几何与相对相机位姿，并通过学习的全局相似变换将其统一到规范机器人坐标系下的场景表示中。为满足操作任务对精度的要求，Robo3R采用掩码点云头部生成锐利细粒度点云，并基于关键点的透视n点（PnP）公式优化相机外参与全局对齐。通过在Robo3R-4M数据集（包含四百万帧高保真标注帧的精选大规模合成数据集）上进行训练，Robo3R在各项指标上持续超越最先进的重建方法与深度传感器。在模仿学习、仿真到现实迁移、抓取合成及无碰撞运动规划等下游任务中，我们观察到性能的持续提升，这预示着该替代性三维感知模块在机器人操作领域的应用前景。

0

相关内容

《机器人弹性物体感知技术研究》227页

《机器人弹性物体感知技术研究》227页

专知会员服务

15+阅读 · 2025年11月20日

《自主机器人系统帕累托最优感知架构的多目标生成》2025最新100页

《自主机器人系统帕累托最优感知架构的多目标生成》2025最新100页

专知会员服务

22+阅读 · 2025年11月10日

深度学习的多视角三维重建技术综述

深度学习的多视角三维重建技术综述

专知会员服务

20+阅读 · 2025年6月7日

《基于机器人操作系统（ROS）2 Humble的自主作战机器人开发》最新103页报告（含核心代码）

《基于机器人操作系统（ROS）2 Humble的自主作战机器人开发》最新103页报告（含核心代码）

专知会员服务

24+阅读 · 2025年5月28日

【CVPR2025】CrayonRobo：面向机器人操作的以对象为中心的提示驱动视觉-语言-动作模型

【CVPR2025】CrayonRobo：面向机器人操作的以对象为中心的提示驱动视觉-语言-动作模型

专知会员服务

10+阅读 · 2025年5月6日

【CVPR2025】RoboTwin：具备生成式数字孪生的双臂机器人基准平台

【CVPR2025】RoboTwin：具备生成式数字孪生的双臂机器人基准平台

专知会员服务

12+阅读 · 2025年4月19日

Robotaxi的商业模式前景展望

Robotaxi的商业模式前景展望

专知会员服务

17+阅读 · 2024年9月21日

人形机器人深度：产业化渐行渐近，未来前景广阔

人形机器人深度：产业化渐行渐近，未来前景广阔

专知会员服务

39+阅读 · 2024年7月17日

【含源代码】《用机器学习提高超视距空战中的态势感知能力》最新论文，巴西空军高级研究学院、卡内基梅隆大学机器人研究所

【含源代码】《用机器学习提高超视距空战中的态势感知能力》最新论文，巴西空军高级研究学院、卡内基梅隆大学机器人研究所

专知会员服务

117+阅读 · 2022年6月20日

基于深度强化学习的机器人运动控制研究进展

专知会员服务

65+阅读 · 2021年4月22日

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

3D Human相关研究总结：人体、姿态估计、人体重建等

3D Human相关研究总结：人体、姿态估计、人体重建等

PaperWeekly

27+阅读 · 2021年3月1日

三维重建 3D reconstruction 有哪些实用算法？

三维重建 3D reconstruction 有哪些实用算法？

极市平台

13+阅读 · 2020年2月23日

计算机视觉方向简介 | 三维重建技术概述

计算机视觉方向简介 | 三维重建技术概述

计算机视觉life

26+阅读 · 2019年6月13日

三维感知与三维数据分析最新进展 - 3D传感&人工智能前沿科技论坛

三维感知与三维数据分析最新进展 - 3D传感&人工智能前沿科技论坛

AI科技评论

10+阅读 · 2019年2月2日

SkeletonNet：完整的人体三维位姿重建方法

SkeletonNet：完整的人体三维位姿重建方法

计算机视觉life

21+阅读 · 2019年1月21日

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

产业智能官

13+阅读 · 2019年1月17日

无人机图像处理技术精髓汇总 (一) 三维还原重建技术简介

无人机图像处理技术精髓汇总 (一) 三维还原重建技术简介

深度学习

13+阅读 · 2018年12月18日

【泡泡机器人公开课】第九十六课：单目相机动态场景三维重建 ‐‐ 从几何驱动到学习驱动--戴玉超

【泡泡机器人公开课】第九十六课：单目相机动态场景三维重建 ‐‐ 从几何驱动到学习驱动--戴玉超

泡泡机器人SLAM

12+阅读 · 2018年9月1日

计算机视觉方向简介 | 深度相机室内实时稠密三维重建

计算机视觉方向简介 | 深度相机室内实时稠密三维重建

计算机视觉life

17+阅读 · 2018年5月23日

基于多芯光纤的高精度三维姿态测量关键技术研究

国家自然科学基金

0+阅读 · 2017年12月31日

融合人脑意图与力觉反馈的外骨骼机器人步态控制CPG模型及调节方法

国家自然科学基金

0+阅读 · 2015年12月31日

重载灵巧高刚度搅拌摩擦焊机器人动态特性分析及优化设计

国家自然科学基金

0+阅读 · 2015年12月31日

动态环境下的实时高清大规模三维地形重建研究

国家自然科学基金

3+阅读 · 2015年12月31日

网络化遥操作多机器人系统时滞相关控制研究

国家自然科学基金

0+阅读 · 2015年12月31日

无力传感器策略和可逆向驱动机构并用提高手术机器人触觉感知性能的新方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于增强现实的主从遥操作手术机器人系统中的力反馈问题研究

国家自然科学基金

2+阅读 · 2015年12月31日

非结构环境下基于三维肢体动作理解的工业机器人交互技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

复杂场景点线光流三维重建模型的建立及鲁棒性分析

国家自然科学基金

2+阅读 · 2014年12月31日

Benchmarking the Effects of Object Pose Estimation and Reconstruction on Robotic Grasping Success

Arxiv

0+阅读 · 2月19日

RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics

Arxiv

0+阅读 · 2月18日

MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction

Arxiv

0+阅读 · 2月17日

Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation

Arxiv

0+阅读 · 2月9日

S-MUSt3R: Sliding Multi-view 3D Reconstruction

Arxiv

0+阅读 · 2月4日

Hand3R: Online 4D Hand-Scene Reconstruction in the Wild

Arxiv

0+阅读 · 2月3日

Learning Geometrically-Grounded 3D Visual Representations for View-Generalizable Robotic Manipulation

Arxiv

0+阅读 · 1月30日

RoboStriker: Hierarchical Decision-Making for Autonomous Humanoid Boxing

Arxiv

0+阅读 · 1月30日

VersaQ-3D: A Reconfigurable Accelerator Enabling Feed-Forward and Generalizable 3D Reconstruction via Versatile Quantization

Arxiv

0+阅读 · 1月28日

RoboBrain 2.5: Depth in Sight, Time in Mind

Arxiv

0+阅读 · 1月20日

VIP会员

文章信息

相关主题

机器人操作

相关VIP内容

《机器人弹性物体感知技术研究》227页

《机器人弹性物体感知技术研究》227页

专知会员服务

15+阅读 · 2025年11月20日

《自主机器人系统帕累托最优感知架构的多目标生成》2025最新100页

《自主机器人系统帕累托最优感知架构的多目标生成》2025最新100页

专知会员服务

22+阅读 · 2025年11月10日

深度学习的多视角三维重建技术综述

深度学习的多视角三维重建技术综述

专知会员服务

20+阅读 · 2025年6月7日

《基于机器人操作系统（ROS）2 Humble的自主作战机器人开发》最新103页报告（含核心代码）

《基于机器人操作系统（ROS）2 Humble的自主作战机器人开发》最新103页报告（含核心代码）

专知会员服务

24+阅读 · 2025年5月28日

【CVPR2025】CrayonRobo：面向机器人操作的以对象为中心的提示驱动视觉-语言-动作模型

【CVPR2025】CrayonRobo：面向机器人操作的以对象为中心的提示驱动视觉-语言-动作模型

专知会员服务

10+阅读 · 2025年5月6日

【CVPR2025】RoboTwin：具备生成式数字孪生的双臂机器人基准平台

【CVPR2025】RoboTwin：具备生成式数字孪生的双臂机器人基准平台

专知会员服务

12+阅读 · 2025年4月19日

Robotaxi的商业模式前景展望

Robotaxi的商业模式前景展望

专知会员服务

17+阅读 · 2024年9月21日

人形机器人深度：产业化渐行渐近，未来前景广阔

人形机器人深度：产业化渐行渐近，未来前景广阔

专知会员服务

39+阅读 · 2024年7月17日

【含源代码】《用机器学习提高超视距空战中的态势感知能力》最新论文，巴西空军高级研究学院、卡内基梅隆大学机器人研究所

【含源代码】《用机器学习提高超视距空战中的态势感知能力》最新论文，巴西空军高级研究学院、卡内基梅隆大学机器人研究所

专知会员服务

117+阅读 · 2022年6月20日

基于深度强化学习的机器人运动控制研究进展

专知会员服务

65+阅读 · 2021年4月22日

热门VIP内容

开通专知VIP会员享更多权益服务

《可信人工智能赋能系统的支柱》

《从经典神经网络到不确定性下的拓扑神经网络：军事应用》2026最新40页报告

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

《人工智能：对战略与力量的影响》slides

相关资讯

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

3D Human相关研究总结：人体、姿态估计、人体重建等

3D Human相关研究总结：人体、姿态估计、人体重建等

PaperWeekly

27+阅读 · 2021年3月1日

三维重建 3D reconstruction 有哪些实用算法？

三维重建 3D reconstruction 有哪些实用算法？

极市平台

13+阅读 · 2020年2月23日

计算机视觉方向简介 | 三维重建技术概述

计算机视觉方向简介 | 三维重建技术概述

计算机视觉life

26+阅读 · 2019年6月13日

三维感知与三维数据分析最新进展 - 3D传感&人工智能前沿科技论坛

三维感知与三维数据分析最新进展 - 3D传感&人工智能前沿科技论坛

AI科技评论

10+阅读 · 2019年2月2日

SkeletonNet：完整的人体三维位姿重建方法

SkeletonNet：完整的人体三维位姿重建方法

计算机视觉life

21+阅读 · 2019年1月21日

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

【协作机器人】人机协作机器人的核心是多传感器技术与智能控制算法、工业机器人协作应用挑战

产业智能官

13+阅读 · 2019年1月17日

无人机图像处理技术精髓汇总 (一) 三维还原重建技术简介

无人机图像处理技术精髓汇总 (一) 三维还原重建技术简介

深度学习

13+阅读 · 2018年12月18日

【泡泡机器人公开课】第九十六课：单目相机动态场景三维重建 ‐‐ 从几何驱动到学习驱动--戴玉超

【泡泡机器人公开课】第九十六课：单目相机动态场景三维重建 ‐‐ 从几何驱动到学习驱动--戴玉超

泡泡机器人SLAM

12+阅读 · 2018年9月1日

计算机视觉方向简介 | 深度相机室内实时稠密三维重建

计算机视觉方向简介 | 深度相机室内实时稠密三维重建

计算机视觉life

17+阅读 · 2018年5月23日

相关论文

Benchmarking the Effects of Object Pose Estimation and Reconstruction on Robotic Grasping Success

Arxiv

0+阅读 · 2月19日

RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics

Arxiv

0+阅读 · 2月18日

MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction

Arxiv

0+阅读 · 2月17日

Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation

Arxiv

0+阅读 · 2月9日

S-MUSt3R: Sliding Multi-view 3D Reconstruction

Arxiv

0+阅读 · 2月4日

Hand3R: Online 4D Hand-Scene Reconstruction in the Wild

Arxiv

0+阅读 · 2月3日

Learning Geometrically-Grounded 3D Visual Representations for View-Generalizable Robotic Manipulation

Arxiv

0+阅读 · 1月30日

RoboStriker: Hierarchical Decision-Making for Autonomous Humanoid Boxing

Arxiv

0+阅读 · 1月30日

VersaQ-3D: A Reconfigurable Accelerator Enabling Feed-Forward and Generalizable 3D Reconstruction via Versatile Quantization

Arxiv

0+阅读 · 1月28日

RoboBrain 2.5: Depth in Sight, Time in Mind

Arxiv

0+阅读 · 1月20日

相关基金

基于多芯光纤的高精度三维姿态测量关键技术研究

国家自然科学基金

0+阅读 · 2017年12月31日

融合人脑意图与力觉反馈的外骨骼机器人步态控制CPG模型及调节方法

国家自然科学基金

0+阅读 · 2015年12月31日

重载灵巧高刚度搅拌摩擦焊机器人动态特性分析及优化设计

国家自然科学基金

0+阅读 · 2015年12月31日

动态环境下的实时高清大规模三维地形重建研究

国家自然科学基金

3+阅读 · 2015年12月31日

网络化遥操作多机器人系统时滞相关控制研究

国家自然科学基金

0+阅读 · 2015年12月31日

无力传感器策略和可逆向驱动机构并用提高手术机器人触觉感知性能的新方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于增强现实的主从遥操作手术机器人系统中的力反馈问题研究

国家自然科学基金

2+阅读 · 2015年12月31日

非结构环境下基于三维肢体动作理解的工业机器人交互技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

复杂场景点线光流三维重建模型的建立及鲁棒性分析

国家自然科学基金

2+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员