综述 | 面向机器人的视觉触觉智能:感知、学习与具身操作

论文题目:Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation 作者:Peng Zhou、Jun Hu、Sihan Chen、Zeqing Zhang、Haofei Ma、Zhenyu Lu、Sichao Liu、Xueqian Wang、Pai Zheng、Xiang Li、Shan Luo、Jia Pan、David Navarro-Alarcon、Chenguang Yang、Michael Yu Wang 机构:Great Bay University、清华大学、香港大学、南洋理工大学、香港理工大学、华南理工大学、KTH Royal Institute of Technology、King's College London 论文链接:https://arxiv.org/pdf/2608.15490

导读

机器人要真正进入接触丰富的真实世界,不能只依赖视觉。抓取、插入、装配、滑移控制、柔性物体操作等任务都需要触觉反馈,因为许多关键变量发生在接触界面:受力、剪切、滑移、局部几何、材料纹理、接触状态和动态变化。传统电子触觉传感器已经推动了机器人抓取与操作,但往往受限于空间分辨率、信号维度和可表达信息。 视觉触觉传感器提供了另一条路线:它把软体弹性体的接触形变转换成图像。由于输出天然是图像或事件流,视觉触觉传感器可以直接连接现代计算机视觉、多模态学习、机器人学习和基础模型技术,从而把“触觉”纳入视觉-语言-动作系统。本文综述的重点也不只是传感器硬件,而是把硬件、AI感知学习、仿真平台和数据集视为一个完整的“感知-学习-具身操作”闭环。 这篇综述的价值在于三点。第一,它从可变形弹性体、传感器尺寸形态、光学系统三个维度系统整理视觉触觉硬件谱系。第二,它提出从低层触觉信号表征到任务级策略、再到触觉基础模型的层级学习视图。第三,它把仿真平台、触觉数据集、仿真到现实迁移和跨传感器适配视为规模化触觉智能的基础设施。对具身智能、机器人操作、多模态基础模型方向来说,这是一篇很适合作为领域地图的综述。

I. INTRODUCTION:引言

研究背景

接触丰富的机器人任务之所以困难,是因为物理交互具有不确定性和动态性,很多变量无法仅通过外部视觉推断。机器人看到物体外观,并不等于知道接触点是否稳定、夹持力是否合适、物体是否即将滑动、插孔是否已经对齐、柔性材料是否产生形变。触觉传感为这些任务提供了补充信息。 传统触觉传感器包括压阻式、电容式、磁式、仿生微机电、压电式、摩擦电式和电阻抗断层成像等类型。它们可以把机械刺激转换成电信号,但在空间分辨率、信号丰富度、几何和纹理表达方面常常有限。视觉触觉传感器则通过相机、弹性体、光源和光学结构,把接触造成的形变转换成高分辨率图像,使触觉数据更容易被图像学习模型处理。 该方向的早期工作包括基于图像的软膜几何重建、透明弹性体中彩色标记点跟踪、用于灵巧操作的透明弹性指尖等。随后,GelSight 展示了涂覆弹性膜结合结构光照明可以高精度重建表面几何;TacTip、DIGIT 以及大量面向特定任务的变体进一步扩展了视觉触觉传感器生态。

综述定位

已有综述通常分别讨论硬件设计、传感器分类、标记点与多模态融合、触觉数据生成、机器人学习部署或触觉集成。本文的不同之处在于,它强调视觉触觉不是孤立硬件,也不是单个学习模型,而是由物理感知、计算表征、仿真数据和机器人任务共同决定的系统。 因此,论文试图回答三个问题:如何设计能产生高质量触觉图像的传感器;如何把触觉图像转化为力、几何、语义和动作相关表征;如何利用仿真、数据集和跨传感器迁移支撑规模化训练、评测和部署。

II. FUNDAMENTALS OF VISION-BASED TACTILE SENSING:视觉触觉感知基础

基本结构

典型视觉触觉传感器包含四个核心组件。第一是可变形弹性体,它直接接触外界,并可集成反射涂层、嵌入式标记点或荧光层。第二是照明系统,通常使用彩色 LED 或可控光源产生稳定光照,以支持表面法线和形变估计。第三是成像光学结构,用于调节光路并聚焦触觉光学响应。第四是一个或多个图像传感器,用于捕获接触后的触觉图像。

工作流程

视觉触觉感知通常经历四个阶段。首先,外部接触使弹性体发生形变。其次,形变改变标记点位置、反射强度、阴影、颜色或多视角视差,形成可观测的光学响应。再次,内部相机捕获图像或事件流。最后,算法从图像中推断接触位置、接触面积、法向或切向力、滑移状态、局部几何、表面纹理、材料属性等物理或语义信息。 论文将视觉触觉信号中的信息分为三层。直接几何信息来自触觉图像的空间结构,包括接触位置、区域、局部朝向、形变几何和细粒度纹理。间接力学信息需要通过校准、接触力学模型或学习映射推断,包括力、扭矩、剪切和柔顺性等。序列信息来自连续触觉帧,刻画接触转移、初始滑移、持续滑动和操作状态变化。

III. HARDWARE DESIGN TAXONOMY OF VISION-BASED TACTILE SENSORS:视觉触觉传感器硬件设计分类

弹性体设计

弹性体是视觉触觉传感器的接触界面,其材料、几何、表面结构和嵌入特征决定接触信息如何被编码。论文将相关设计整理为三类路径:多模态皮肤、标记或图案编码、弹性体本体力学设计。 多模态皮肤通过叠加视觉、触觉、近场、力或其他传感模式,增强对接触状态的综合观测。标记或图案编码通过稀疏点、网格、彩色图案或密集编码结构,把局部形变转换成可跟踪视觉特征。弹性体本体设计则通过材料调节、表面微结构、接触结构和柔顺性设计,提高灵敏度、空间分辨率、滑移观测能力或耐久性。

尺寸与形态

传感器尺寸和形态决定其可以安装在哪里、能覆盖多大区域、是否适合灵巧手或特殊环境。宽覆盖传感器适合机器人皮肤、手掌、输送带或大面积接触场景;小型探针和薄型结构适合受限空间、医疗检查或远程光学路径;手指形、夹爪形和可集成结构则服务于机器人手和末端执行器。 不同形态之间存在明显取舍。高分辨率指尖传感器适合局部精细操作,但覆盖范围有限;大面积皮肤强调覆盖、耐久和分布式标定,但面临带宽和计算压力;微型传感器改善可达性,却可能牺牲成像质量和力学稳定性。

光学系统设计

光学系统负责把弹性体形变转换成可被相机捕捉的信号。照明工程可以通过多色光源、点光源建模、偏振、谱编码等方式提升几何重建和阴影处理能力。紧凑光学设计则通过镜面、棱镜、薄透镜、无镜头结构或远程光路,把传感器做得更薄、更小、更适合嵌入机器人手。 多通道采集包括多相机、多视角、光谱通道和可切换照明,可提高深度、力和材料估计能力。事件视觉和神经形态视觉则以异步像素变化记录接触,带来低延迟、低功耗和动态感知优势,但相关算法和硬件生态仍不如帧式视觉触觉成熟。

设计范式

论文强调,视觉触觉硬件并不存在唯一最优结构。有效设计需要联合优化弹性体力学、光学采集、形态封装、学习管线和目标平台。灵巧指尖可能优先考虑高分辨率局部形变和低延迟滑移检测;触觉皮肤可能优先考虑覆盖面积、耐用性和分布式标定;检测探针可能优先考虑薄型化和远程光学。

IV. AI BASED TACTILE PERCEPTION AND LEARNING:基于AI的触觉感知与学习

学习层级

给定硬件产生的触觉图像,核心计算问题是如何把原始传感器流转换成物理、语义和行动相关表征。论文将这一过程分成七个层级:触觉信号表征、低层物理动力学、几何姿态与三维重建、识别与属性推断、多模态融合、面向任务的触觉操作、可泛化触觉学习与基础模型。

触觉信号表征

视觉触觉原生输出图像式信号。光度立体类传感器产生 RGB 强度图,标记点传感器记录点阵或网格形变,多视角传感器提供视差估计,事件视觉传感器输出异步事件流。常见预处理包括背景减除、标记跟踪、光流估计和光照归一化。 除图像外,很多方法会把触觉信号提升为法线图、高度图、深度图、点云、隐式场、潜空间表征或生成式表示。生成模型可以根据接触条件合成触觉图像,跨传感器翻译可以把同一接触映射到另一种传感器域,潜在编码则为定位、控制和跨任务迁移提供紧凑表示。

低层物理动力学

低层物理动力学包括力、扭矩、形变、接触事件和滑移。它们通常需要从短时间触觉序列中快速推断,用于稳定抓取和反应式操作。力估计从早期卷积网络回归接触位置、面积和力分布,发展到三维力识别、连续接触时序建模、Transformer 力回归、密集力场重建和逆有限元估计。 滑移检测要求延迟足够低。标记点位移能直接反映剪切和滑动,高度不同的弹性结构可以在大幅滑动前暴露初始滑移,视觉-触觉分类器可融合外部视觉和触觉图像,时序模型可预测滑移方向和滑移发生。跨传感器标定和域适配是这一层的关键问题,因为同样的接触在不同传感器上可能呈现完全不同的图像分布。

几何、姿态与重建

触觉学习不仅估计力,也能恢复接触几何、局部表面、物体姿态和全局形状。单次触摸可从触觉图像估计深度或表面结构,多次触摸可以把局部接触片段拼接为完整形状。触觉三维重建尤其适合透明、反光、暗色或遮挡严重的物体,因为这些物体对视觉不友好,却仍然会在接触界面产生可观测形变。 触觉同步定位与建图进一步把传感器在物体表面的运动、局部触觉观测和对象形状统一起来。相关方法可结合粒子滤波、因子图、神经场、点云配准和主动闭环,用于滑动触摸定位、遮挡下姿态跟踪和视觉-触觉联合形状补全。

识别、融合与操作

触觉图像包含许多视觉难以捕捉的语义和物理线索,例如纹理、材料、硬度、柔顺性和接触状态。卷积网络、神经形态编码、结构色传感器和多模态匹配方法被用于材料分类、实例识别和属性回归。 多模态融合是视觉触觉智能的关键。视觉提供全局场景、物体形状和预接触几何,触觉提供局部接触、受力、滑移和材料响应,语言提供任务描述和语义约束,本体感知提供机器人自身状态。有效融合并不是简单拼接模态,而是要在时间、空间和任务目标上对齐异步信号。 在操作层面,触觉被用于抓取稳定性判断、抓取调整、插入装配、滑动定位、柔性物体处理、动态操作和闭环控制。触觉基础模型和视觉-触觉-语言-动作模型则试图把触觉从任务专用模块提升为可迁移、可组合、可用于推理和策略生成的通用能力。

V. SIMULATION PLATFORMS AND DATASETS:仿真平台与数据集

仿真平台

真实触觉数据昂贵、传感器依赖强、标注困难,因此仿真平台是规模化触觉学习的重要基础。不同平台主要区别在渲染策略、形变建模和任务接口。TACTO 提供快速触觉图像生成并常与机器人仿真结合;Taxim 使用样例校准把接触几何映射为类似 GelSight 的图像和标记运动;Tacchi 和 DiffTactile 更强调弹性体与接触物理,其中 DiffTactile 还支持可微仿真,便于梯度式策略或传感器优化。 近年趋势是从单传感器渲染走向大规模数据生成和硬件-算法协同设计。物理渲染可在制造前评估传感器形状、光照和材料;面向大面积触觉皮肤的仿真结合多物理场、触觉图像渲染和仿真到现实学习;GPU并行环境则支持更大规模的触觉机器人训练。

数据集与基准

触觉数据集正在从物体级感知资源扩展到多模态、动态和任务导向基准。早期资源关注标准物体上的触觉形状映射和视觉-触觉对应关系;后续数据集开始把触觉与视觉、语言、动作、力和音频等模态对齐,用于多感官表征学习。 新的数据集和基准进一步面向触觉语言理解、动态触觉表征、灵巧操作演示和视觉触觉操作策略评测。它们使研究者能够比较不同触觉表示、不同传感器、不同仿真平台和不同操作策略,也为触觉基础模型提供训练来源。

迁移与适配

视觉触觉仿真到现实迁移的难点在于,真实传感器输出受弹性体力学、摩擦、光照、光学路径、标记运动、噪声和制造差异影响。模拟图像与真实图像之间往往存在明显域差异。 现有方法包括合成触觉数据、图像翻译、真实到仿真预处理、有限元建模、域随机化、单样本适配、神经形态触觉去噪和跨传感器生成翻译。未来触觉策略很可能依赖仿真获得规模,再通过少量真实标定和跨传感器适配完成部署。

VI. OPEN CHALLENGES AND FUTURE DIRECTIONS:开放挑战与未来方向

机器人手兼容设计

视觉触觉传感器要部署到机器人手指和指尖,必须同时满足尺寸、形态、重量、布线、机械鲁棒性、空间分辨率、力灵敏度、滑移线索和接触状态感知等要求。更大的光学系统有利于图像质量,却难以嵌入紧凑手指;更软的弹性体提高灵敏度,却可能降低耐久性。因此,未来设计需要把机械封装、光路、弹性体、感知性能和手部具身结构联合优化。

大面积触觉皮肤

从指尖传感扩展到全身或大面积机器人皮肤仍是重要挑战。视觉触觉传感器通常是局部高分辨率单元,扩展为大面积皮肤会遇到传感器拼接、数据带宽、计算负载、机械集成和分布式标定问题。如何在大面积覆盖中保持视觉触觉的信息丰富度,是该方向的长期难题。

基础模型与具身策略

触觉基础模型和视觉-触觉-语言-动作策略需要让触觉具备物理基础、时间感和可行动性。触觉信号局部、接触依赖强、传感器特异性强,因此模型必须捕捉接触转移、力和滑移线索、任务相关性,并能与语言、视觉、机器人状态和动作对齐。未来的关键不是只做触觉识别,而是让触觉同时支持底层接触修正和高层操作决策。

多模态与反馈闭环

多模态触觉智能要把触觉与视觉、语言、本体感知和动作结合起来。难点在于异构异步信号的对齐,以及在融合后仍保留接触、力、滑移、纹理和材料响应的物理含义。另一方面,触觉反馈不应只服务机器人执行,也应服务人类示教。若遥操作或数据采集系统无法向人类提供足够触觉反馈,示教动作可能不自然,接触丰富任务的数据质量也会下降。

第一视角触觉数据

第一视角人类数据采集可能成为触觉学习规模化的新路径。可穿戴触觉传感器、手部姿态跟踪器和第一视角摄像头可以记录人类如何协调触觉、视觉、运动和动作完成插入、擦拭、紧固、工具使用等任务。挑战在于构建轻量耐用的可穿戴系统,同步多模态信号,并弥合人手与机器人末端执行器之间的具身差异。

VII. CONCLUSION:结论

视觉触觉传感已经成为机器人感知与操作的重要技术,因为它把物理接触转化为图像式信号,使触觉能够接入现代 AI 模型。本文综述表明,视觉触觉系统的性能并不由某个单点决定,而是由硬件、算法和数据基础设施共同塑造。弹性体设计、照明、光路、相机布局和传感器形态决定可观测信息;AI方法将触觉图像转化为力、形变、滑移、接触状态、几何、姿态、材料属性和动作策略;仿真平台与数据集则支撑训练、评测和迁移。 更长远看,视觉触觉的意义在于让具身智能获得视觉之外的接触世界。随着触觉基础模型、多模态融合和视觉-触觉-语言-动作策略发展,触觉有望从任务专用模块走向通用具身能力。但要实现这一目标,仍需解决机器人手兼容硬件、大面积触觉皮肤、仿真到现实迁移、跨传感器泛化、触觉反馈和第一视角数据采集等问题。只有把硬件、学习管线、仿真和数据作为一体化系统设计,机器人才能在真实接触任务中获得更稳健、更灵巧、更可泛化的操作能力。

成为VIP会员查看完整内容
0

相关内容

机器人(英语:Robot)包括一切模拟人类行为或思想与模拟其他生物的机械(如机器狗,机器猫等)。狭义上对机器人的定义还有很多分类法及争议,有些电脑程序甚至也被称为机器人。在当代工业中,机器人指能自动运行任务的人造机器设备,用以取代或协助人类工作,一般会是机电设备,由计算机程序或是电子电路控制。

知识荟萃

精品入门和进阶教程、论文和代码整理等

更多

查看相关VIP内容、论文、资讯等
综述 | 基础模型时代的人本智能全景
专知会员服务
6+阅读 · 8月20日
综述 | 触觉与力觉感知机器人学习
专知会员服务
10+阅读 · 8月18日
面向具身智能与机器人仿真的三维生成:综述
专知会员服务
18+阅读 · 4月30日
「机器人感知与控制关键技术」最新2023研究综述
专知会员服务
64+阅读 · 2023年4月2日
前沿综述:集体智能与深度学习的交叉进展
专知会员服务
76+阅读 · 2022年2月6日
专知会员服务
106+阅读 · 2020年11月27日
干货 | 可解释的机器学习
AI科技评论
20+阅读 · 2019年7月3日
A Technical Overview of AI & ML in 2018 & Trends for 2019
待字闺中
18+阅读 · 2018年12月24日
【机器视觉】机器视觉全面解析
产业智能官
12+阅读 · 2018年11月12日
干货|25张PPT深度系统讲解机器视觉应用
机器人大讲堂
13+阅读 · 2017年12月12日
国家自然科学基金
15+阅读 · 2016年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
Arxiv
37+阅读 · 2021年8月2日
VIP会员
最新内容
综述 | 面向机器人的视觉触觉智能
专知会员服务
0+阅读 · 今天14:51
论文 | 基础模型驱动具身智能体安全综述
专知会员服务
0+阅读 · 今天14:43
伊朗-美国-以色列冲突教训
专知会员服务
0+阅读 · 今天13:06
《美国陆军 · 战役规划手册(2027年)》237页
专知会员服务
4+阅读 · 今天12:48
综述 | 自我中心视频中的视觉语言模型
专知会员服务
2+阅读 · 8月21日
综述 | 自演化智能体作为动态图变换
专知会员服务
5+阅读 · 8月21日
综述 | 自我中心视频中的视觉语言模型
专知会员服务
8+阅读 · 8月20日
综述 | 基础模型时代的人本智能全景
专知会员服务
6+阅读 · 8月20日
综述 | 多模态大模型的不确定性感知决策
专知会员服务
8+阅读 · 8月19日
综述 | Deep Academic Survey:有状态闭环综述自动化
综述 | 触觉与力觉感知机器人学习
专知会员服务
10+阅读 · 8月18日
综述 | AI科学家的过去与未来
专知会员服务
12+阅读 · 8月18日
相关基金
国家自然科学基金
15+阅读 · 2016年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
微信扫码咨询专知VIP会员