| (来源:DeepTouch新机器视觉)导语:机器人能从图像中认出杯子,接触世界却未必能稳稳地把它端起来。综述因为在“看见”和“拿起”之间,机器觉远经新横亘着一个长期被低估的人学关键能力——物理交互。抓握、有视远插孔、够新拧盖、浪财浪网擦拭、接触世界开门、综述操作柔性物体……这些任务的机器觉远经新成败,往往不取决于机器人“看到了什么”,人学而取决于它在接触瞬间“感受到了什么”,有视远以及如何实时调整动作。够新近日,浪财浪网来自南洋理工大学、接触世界斯坦福、UC Berkeley、MIT等十余家顶尖机构的研究者发布了一篇53页的重磅综述,系统梳理了触觉与力觉感知的机器人学习,提出了一个名为TF-ART的统一框架。这篇文章将带你读懂:要让机器人真正“接触世界”,技术拼图还缺哪些关键部分。一、从“看见世界”到“接触世界”,缺的不是另一双眼睛过去几年,具身智能的进步令人瞩目。视觉语言模型让机器人能理解场景、识别物体、根据指令规划动作。但当任务从“走到桌子前”变为“把线插入孔中”时,纯视觉方案的局限性就会暴露。接触状态往往不可见。物体可能被手遮挡,操作可能发生在视野死角,力的大小、摩擦的细微变化、滑移的前兆,这些信息在RGB图像中几乎无法可靠提取。物体状态因接触而改变。一块布被抓起时会变形,一颗螺丝被拧入时阻力会变化,一个弹簧被按压时会反弹。不感知这些变化,机器人就只能“闭着眼睛”执行预设轨迹。力觉和触觉提供了互补的信息。力/力矩传感通常捕捉全局交互——末端受力、关节力矩;触觉传感则捕捉局部接触——压力分布、接触点、纹理、剪切和滑移。两者结合,机器人才能真正感知并调节物理交互。然而,已有综述往往按传感器、控制方法或具体任务单独组织,缺少一个同时覆盖多模态感知和多阶段系统设计的统一视角。这篇综述的核心贡献,就是提出了TF-ART(Tactile/Force-Aware Robot learning Taxonomy),把触觉/力觉机器人学习拆解为四个清晰的阶段。二、TF-ART:一个四阶段的触觉/力觉学习框架TF-ART将整个学习与控制链条分为四个递进的阶段:Phase 0:多模态融合与表示学习——如何编码和理解触觉、力觉、视觉、语言等多模态信号。Phase 1:主动作生成——高层策略如何生成粗动作、轨迹或控制目标。Phase 2:模态区分式动作精修——如何用几度触觉/力觉信号修正和细化动作。Phase 3:机器人末端控制——如何通过阻抗、导纳、混合力位控制等机制,将动作稳定地执行到真实硬件上。这个框架的关键洞见在于:触觉/力觉不应被视为视觉策略的附加输入,而应嵌入一个多阶段控制链条。视觉和语言适合低频语义推理,触觉和力觉适合几度局部响应。把所有这些模态一次性塞进一个端到端策略,往往导致响应不及时或贡献未便解释。三、Phase 0:融合之前,先理解每个模态的“性格”触觉和力觉不是同一种东西,甚至不同触觉传感器之间的差异也很大。触觉模态主要包括三类:视觉触觉(如GelSight类传感器,把接触形变转化为图像)、触觉阵列(taxel阵列,直接提供压力分布)、接触点表示。它们擅长捕捉局部接触几何、滑移和纹理。力觉模态包括腕部六轴力/力矩传感器、关节力矩、动力学估计和电机电流。腕部传感器直接测量末端整体受力,适合插入和装配;关节力矩覆盖整条手臂,但要求动力学模型分离重力、惯性和外部接触。非接触模态则包括语言(任务语义)、视觉(全局场景和局部视角)、机器人本体状态(关节角、末端位姿)以及声学等补充信号。在表示学习层面,综述归纳了五种方法:辅助重建、掩码自编码、向量量化重建、多模态对比对齐和任务相关监督。核心困难在于:这些信号在维度、效率、噪声结构和物理含义上差异巨大,简单的特征拼接很难稳定工作。融合机制则包括FiLM注入、注意力条件化、专家混合和门控过滤。作者特别强调:融合不一定越早越好。合理的设计要求在不同阶段保留不同模态,让高层策略和低层控制各取所需。四、Phase 1 & 2:为什么大模型不能“一步到位”?主动作生成策略是TF-ART的决策核心,它接收多模态编码特征,输出动作、粗轨迹、动作块,或下游控制器所需的参考力、控制刚度。综述将主策略架构归纳为五类:回归策略、强化学习、扩散/流匹配策略、动作分块Transformer和视觉语言动作模型。但单阶段策略有本质局限。视觉和语言提供高层语义,但推理效率低、延迟高;触觉和力觉直接关联接触状态,但局部、噪声大、任务相关。因此,多阶段架构变得必要。Phase 2——模态区分式动作精修——是TF-ART最具特色的部分。这一阶段的目标是把主策略的粗动作修正为更适合接触执行的动作。它接收两类信息:一是从融合阶段转发的触觉、力觉、状态或局部视觉信息,二是第一阶段产生的动作、参考力、控制刚度或潜变量。核心思想是:不同模态不必在同一个策略中一次性融合,而可以按效率、物理含义和控制要求分配到不同阶段。视觉和语言在第一阶段生成粗操作计划,触觉和力觉在第二阶段负责局部调整,机器人状态贯穿两个阶段保证可执行性。这种设计尤其适合精密装配、插孔、柔性材料、开门、擦拭等任务——这些任务既要求高层语义理解,又要求低延迟物理反馈,单一模型很难同时满足。五、Phase 3:动作生成不等于真实执行第三阶段把学习策略的输出连接到真实机器人硬件。论文讨论了PD控制、阻抗控制、导纳控制和混合力/位置控制,并强调:接触任务必须把“动作生成”与“力控/柔顺控制”结合起来。阻抗控制定义机器人运动与外力之间的动态关系,使机器人在受力时表现出类似质量-阻尼-弹簧的响应,不一定要求附加力传感器;导纳控制则把测得的外力映射为期望运动,适合要求主动让步的场景;混合力/位置控制在部分方向控位置、其他方向控力,适合擦拭、切割、装配等有明确约束方向的任务。一个常被忽视的问题是:学习策略输出的动作并不等于机器人真实执行。实际效果取决于控制接口、传感效率、控制延迟、安全边界和硬件约束。综述提醒,未来触觉/力觉学习系统要求更透明地报告底层控制实现,否则方法间未便公平比较。六、从53篇论文看天地现状:研究扎堆,短板明显综述统计了2024年至2026年4月的53篇核心论文,揭示了当前研究的分布特征。任务分布上,插孔类任务有26篇,占据近半壁江山。表面擦拭和拾取放置也较多;但动态多接触、长程家庭任务和复杂多阶段交互相对不足。这说明当前天地更擅长评估局部接触精修,而对长期、多目标、开放环境中的物理交互推理研究不足。传感器使用上,25个方法使用腕部力/力矩或关节力矩,27个使用触觉传感器,仅4个同时结合两类。值得注意的是,还有5个方法既不使用力觉也不使用触觉,只依赖视觉或本体感知。传感器的选择必须匹配任务:精密插入通常要求力反馈,灵巧手操作更依赖触觉阵列,柔性材料要求接触分布,动态任务则要求更几度率和更低延迟。七、未来方向:从“拼接”走向“协同设计”综述提出了多个关键挑战,指向同一个深层判断:端到端大模型不会替代控制理论和传感器工程。真正可靠的物理交互系统,来自学习模型、接触传感、经典控制和硬件约束之间的协同设计。挑战一:传感器本身的瓶颈。当前触觉传感器在空间分辨率、可靠性、耐久性、成本和跨平台一致性上仍有限,不同设备输出格式差异大,阻碍大规模数据集和可迁移模型的构建。挑战二:表示学习与融合。触觉、力觉、视觉、语言、状态的物理含义、采样效率和噪声结构各异,未来要求能处理异步、多频、多尺度信号的模型,而非仅在特征维度上拼接。挑战三:分层策略设计。如何自动决定哪些模态在何时进入哪一层,是多阶段机器人学习的核心问题。挑战四:学习与控制的整合。很多论文报告模型架构,却未充分说明控制接口、柔顺参数、控制效率和安全机制。实际部署时,学习输出必须经过稳定、可解释、可约束的控制模块。挑战五:任务、基准与评估。当前任务分布偏向短程、局部、结构化接触,未来要求更多长程、多接触、非结构化环境中的评估,并报告失败模式、泛化条件和硬件依赖。结语这篇综述最深刻的启示或许是:机器人学习正在经历一次从“模态堆叠”到“系统协同”的范式转变。过去我们问:“怎样把触觉数据也喂给神经网络?”现在更应该问:“在一个多阶段控制架构中,触觉和力觉应该在哪一层、以什么形式、以何种效率介入?”TF-ART给出的答案不是“越多越好”,而是一种分工的智慧:视觉和语言负责语义与目标,触觉和力觉负责接触与响应,底层控制负责稳定与安全。只有这样,机器人才能在“看见世界”之后,真正“接触世界”。论文信息标题:Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning作者:Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma 等机构:南洋理工大学、斯坦福大学、UC Berkeley、MIT、新加坡国立大学、佐治亚理工、东京大学、ETH Zurich、哈佛大学、帝国理工、KTH、达姆施塔特工业大学等链接:https://arxiv.org/pdf/2608.07558海量资讯、精准解读,尽在新浪财经APP |
