综述 | Learning Physical Interaction:触觉与力觉感知机器人学习综述

论文题目: Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning 作者: Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma 等 机构: Nanyang Technological University, Stanford University, University of California Berkeley, MIT, National University of Singapore, Georgia Institute of Technology, University of Tokyo, ETH Zurich, Harvard University, Imperial College London, KTH, Technical University of Darmstadt 等 论文链接: https://arxiv.org/pdf/2608.07558 项目链接: https://github.com/NTUMARS/Awesome-Tactile-Force-aware-Robot-Learning 关键词: 触觉感知、力觉感知、机器人学习、柔顺控制、多模态融合、接触丰富操作、具身智能

导读

机器人要从“看见世界”走向“接触世界”,关键能力不只是视觉识别和轨迹生成,而是感知、推理并调节与物理环境之间的交互。抓取、插孔、擦拭、拧盖、开门、柔性物体操作等任务都高度依赖接触信息:物体可能被遮挡,状态可能因接触而改变,成功与否取决于接触点、压力分布、摩擦、滑移和力的大小。 这篇 53 页综述系统梳理了触觉与力觉感知机器人学习。作者提出 TF-ART,也就是 Tactile/Force-Aware Robot learning Taxonomy,用统一层级框架整理 2024 年至 2026 年 4 月的 53 篇核心论文,并结合更广泛参考文献,讨论多模态感知、表示学习、动作生成、动作精修、末端控制和接触任务评测。 论文的核心观点是:触觉/力觉不应被视为视觉策略的附加输入,而应嵌入一个多阶段控制链条。高层策略负责语义理解和粗动作生成,中间阶段利用触觉、力觉、状态等模态修正动作,底层控制器再通过阻抗、导纳、混合力位控制等机制保证稳定接触。未来的物理交互智能,需要把学习方法和经典控制更紧密地连接起来。

Introduction:引言

近年来具身智能快速发展,视觉、语言和大规模策略模型推动了机器人在场景理解、目标识别和通用操作上的进步。但当机器人进入接触丰富任务时,视觉和语言往往不再足够。接触状态可能不可见,物体可能柔软或变形,执行过程需要实时响应滑移、碰撞和力变化。 力觉和触觉分别提供互补信息。力/力矩传感通常捕捉全局交互,例如末端受力、关节力矩和动态估计;触觉传感则捕捉局部接触,例如压力分布、接触点、纹理、剪切、滑移和形变。二者共同让机器人能够感知并调节物理交互,而不只是根据视觉预设轨迹执行。 作者指出,已有综述往往按传感器、控制方法或具体任务单独组织,缺少一个同时覆盖多模态感知和多阶段系统设计的统一视角。因此本文提出 TF-ART,把触觉/力觉机器人学习拆成四个阶段:多模态融合与表示学习、主动作生成、模态区分式动作精修、机器人末端控制。

Phase 0: Multimodal Fusion and Representation Learning:多模态融合与表示学习

接触模态

论文首先讨论输入模态。触觉模态包括视觉触觉、触觉矩阵和接触点表示。视觉触觉传感器通常把接触导致的表面形变转化为图像,适合学习局部接触几何、滑移和纹理;触觉阵列或 taxel 表示则更直接地提供压力分布或接触矩阵。 力/力矩模态包括腕部六轴力/力矩、关节力矩、动力学估计和电机电流等。末端腕部传感器能直接测量整体外部 wrench,适合插入、装配和柔顺控制;关节力矩能覆盖整条机械臂,但需要动力学模型来分离重力、惯性和外部接触。 非接触模态包括语言、视觉、机器人本体状态和潜在补充信号。语言用于任务指令和语义约束,视觉提供全局场景、局部视角、点云和深度,状态模态提供末端位姿、关节角、夹爪状态和物体位姿。声学、振动和任务标签等也可能成为补充信息。

表示学习

论文将表示学习方法分为辅助重建、掩码自编码、向量量化重建、多模态对比对齐和任务相关监督。辅助重建用于迫使编码器保留触觉、视觉或力觉中的结构信息;掩码自编码通过恢复缺失观测提升鲁棒性;对比对齐则把不同模态投到共享语义空间,便于跨模态检索和融合。 任务相关监督更直接,它用成功率、接触状态、动作误差或力控制目标约束表示,使表示学习服务于下游操作。但其泛化能力往往受任务分布影响。论文认为,触觉/力觉表示的核心难点在于:信号维度、频率、噪声和物理含义差异很大,简单拼接很难稳定工作。

融合机制

多模态融合包括 FiLM 注入、注意力条件化、专家混合和门控过滤。FiLM 通过条件缩放和偏移把一种模态注入另一模态;注意力机制适合学习跨模态依赖;专家混合能根据任务或观测选择不同模态专家;门控过滤可抑制噪声或无关模态。 作者强调,融合不一定越早越好。视觉和语言适合低频语义推理,触觉和力觉适合高频局部响应。合理系统往往需要在不同阶段保留不同模态,让高层策略和低层控制各取所需。

Phase 1: Primary Action Generation:主动作生成

主动作策略是 TF-ART 的核心决策模块。它接收多模态编码特征,输出可执行动作、粗轨迹、动作块,或下游控制器所需的参考力、控制刚度等中间量。多数机器人学习方法仍依赖这个阶段,把感知结果映射为动作或控制参数。 论文将主策略架构归纳为五类:回归策略、强化学习、扩散或流匹配策略、动作分块 Transformer,以及视觉语言动作模型。回归策略简单稳定,适合监督学习;强化学习适合探索和长期回报;扩散策略能建模多峰动作分布;动作分块 Transformer 适合长时间序列动作;视觉语言动作模型则能把任务语义和动作生成连接起来。 主策略输出并不只限于末端动作。它还可以输出参考力、控制刚度、动作块、缺失模态预测或中间隐变量。例如,在接触任务中,策略可以生成粗轨迹,同时预测期望接触力或刚度,让后续控制器在执行中调节柔顺性。 论文特别指出单阶段策略的局限。视觉和语言提供高层语义,但推理频率低、延迟高;触觉和力觉更直接关联接触状态,但常常局部、噪声大、任务相关。把所有模态塞进一个端到端策略,容易导致响应不及时或模态贡献难以解释。因此,多阶段架构变得必要。

Phase 2: Modality-Discriminative Action Refinement:模态区分式动作精修

第二阶段的目标是把主策略的粗动作或预测结果进一步修正为更适合接触执行的动作。这个阶段可以接收两类信息:一类是从融合阶段直接转发过来的触觉、力觉、状态或局部视觉信息,另一类是第一阶段产生的动作、参考力、控制刚度或潜变量。 论文把这种设计称为模态区分式注入。其核心思想是,不同模态不必在同一个策略中一次性融合,而可以按频率、物理含义和控制需求分配到不同阶段。比如视觉和语言在第一阶段生成粗操作计划,触觉和力觉在第二阶段负责局部调整,机器人状态则贯穿两个阶段以保证可执行性。 动作精修策略也可以采用扩散、动作分块 Transformer、强化学习、回归或模型算法。它的目标包括提高接触稳定性、减少执行偏差、补偿未观测扰动、修正接触力、预测缺失模态,以及为底层控制器提供更可靠的目标。 这种多阶段划分尤其适合精密装配、插孔、柔性材料、开门、擦拭等任务。因为这些任务既需要高层语义,又需要低延迟物理反馈,单一模型很难同时满足。

Phase 3: Robot-End Control:机器人末端控制

第三阶段把学习策略的输出连接到真实机器人硬件。论文讨论了机器人动力学、PD 控制、阻抗控制、导纳控制和混合力/位置控制,并强调接触任务必须把“动作生成”与“力控/柔顺控制”结合起来。 阻抗控制定义机器人运动和外部作用力之间的动态关系,使机器人在受到外力时表现出类似质量、阻尼和弹簧的响应。它不一定需要额外力传感器,可通过扭矩控制实现全身柔顺,但在精确位置跟踪任务中可能受建模误差影响。 导纳控制则把测得的外力映射为期望运动,适合需要根据外部力主动让步的场景。混合力/位置控制在部分方向上控制位置,在其他方向上控制力,适合擦拭、切割、装配等有明确约束方向的任务。PD 或 PID 控制仍常用于位置执行,但在复杂接触中需要与力反馈机制配合。 论文的一个重要提醒是,学习策略输出的动作并不等于机器人真实执行。实际效果取决于控制接口、机器人平台、末端执行器、传感频率、控制延迟、安全边界和硬件约束。未来触觉/力觉学习系统需要更透明地报告底层控制实现,否则方法间很难公平比较。

Contact-Rich Manipulation Tasks:接触丰富操作任务

论文将接触丰富任务分成四类:精密接触操作、可变形与表面接触操作、动态与多接触操作、家庭和长程操作。 精密接触包括插入、装配、旋盖、插销等,强调在狭小几何约束下进行力引导对齐。可变形和表面接触包括擦拭、剥皮、切割、柔性抓取等,强调材料顺应性和表面接触状态。动态与多接触包括移动捕捉、滑动、重定向、掌内操作等,需要快速反馈和多点协调。家庭与长程操作包括开门、拾取放置、倒液、推物等,更强调非结构化环境中的长期泛化。 从 53 篇论文分布看,研究明显集中在局部精密接触任务上。插孔类任务有 26 篇,表面擦拭和拾取放置也较多;动态多接触、长程家庭任务和复杂多阶段交互仍相对不足。作者认为,这说明当前领域更擅长评估局部接触精修,而对长期、多目标、开放环境中的物理交互推理研究不足。

传感设备

在传感器使用上,53 个方法中有 25 个使用腕部力/力矩或关节力矩,27 个使用触觉传感器,4 个结合力域传感器与触觉传感器,5 个既不使用力觉也不使用触觉,只依赖视觉或本体感知。 腕部力/力矩传感器安装方便,可直接测量末端六轴受力,但无法定位工具上的具体接触位置。关节力矩传感器覆盖整条手臂,有利于全身柔顺,但依赖准确动力学模型。静态触觉传感器能提供接触面、压力和剪切等局部信息,但受限于传感表面、分辨率、采样率和安装方式。 论文认为,传感器选择不能脱离任务。精密插入通常需要力反馈,灵巧手操作更依赖触觉阵列,柔性材料和表面交互需要接触分布,动态任务则需要更高频率和更低延迟。

Concluding Discussion and Future Directions:总结讨论与未来方向

作者围绕 TF-ART 提出多个挑战。 首先是力觉与触觉模态本身。当前传感器在空间分辨率、可靠性、耐久性、成本、安装位置和跨平台一致性上仍有限。不同设备输出格式差异大,使得大规模数据集和可迁移模型难以构建。 其次是表示学习和融合。触觉、力觉、视觉、语言、状态的物理含义不同,采样频率不同,噪声结构也不同。未来需要能够处理异步、多频、多尺度信号的模型,而不是仅在特征维度上拼接。 第三是分层策略设计。高层策略适合处理语义、任务目标和粗轨迹,低层策略适合处理高频接触反馈。如何自动决定哪些模态在何时进入哪一层,是多阶段机器人学习的核心问题。 第四是学习策略与机器人控制的整合。很多论文报告模型架构,却没有充分说明控制接口、柔顺参数、控制频率和安全机制。实际部署时,学习输出必须经过稳定、可解释、可约束的控制模块,才能在真实接触中可靠执行。 最后是任务、基准与评估。当前任务分布偏向短程、局部、结构化接触。未来需要更多长程、多接触、非结构化环境中的评估,并报告失败模式、泛化条件、硬件依赖和安全约束。

结论

这篇综述的贡献在于,把触觉/力觉机器人学习从零散方法列表整理成一个清晰的多阶段框架。TF-ART 将方法放入“多模态融合 - 主动作生成 - 动作精修 - 末端控制”的链条中,让我们能看到不同论文究竟在哪个环节使用触觉或力觉、以什么形式融合、产生什么动作或控制目标。 对机器人学习而言,触觉与力觉不是可有可无的补充,而是从自由空间运动走向真实物理交互的关键反馈。未来的接触智能机器人,需要同时具备语义理解、局部接触感知、分层动作生成和柔顺控制能力。 更大的趋势是,端到端大模型并不会替代控制理论和传感器工程。真正可靠的物理交互系统,往往来自学习模型、接触传感、经典控制和硬件约束之间的协同设计。TF-ART 提供的正是这样一张路线图。

成为VIP会员查看完整内容
0
VIP会员
最新内容
综述 | 触觉与力觉感知机器人学习
专知会员服务
0+阅读 · 今天15:36
综述 | AI科学家的过去与未来
专知会员服务
0+阅读 · 今天15:35
论文 | OmniScientist:全模态全学科AI科学家
专知会员服务
8+阅读 · 8月16日
无人机已改变战场,但并未解决指挥问题
专知会员服务
11+阅读 · 8月14日
微信扫码咨询专知VIP会员