来源:北京中关村学院
链接:https://mp.weixin.qq.com/s/Q_Q9xwdPnEaffNV-SNBlyQ
为什么大脑对可预见的触觉信号选择抑制,却对意外刺激格外敏感?
一个重要原因是,大脑会提前预测自己动作将产生什么感觉,并抑制这些可以预料的感官信号;相比之下,那些与预测不一致的“意外”刺激会获得更多注意。通过过滤大量可预测的信息,人能够迅速发现碰撞、滑动和接触异常,并及时调整动作。
机器人同样需要这种能力。当前视觉语言动作模型(Vision-Language-Action,VLA)已经能够根据图像和语言指令完成抓取、移动和放置,但在插入、旋拧、擦拭等接触密集任务中,机器人不仅需要知道物体在哪里,还需要感知是否碰撞、是否对准、是否卡住,以及接触力是否发生变化。
一种直接的思路是把触觉图像作为额外输入加入VLA。然而,视觉信息连续、丰富,触觉信号则稀疏且主要在接触时刻发挥作用。训练过程中,高带宽视觉特征很容易掩盖触觉信号,导致模型虽然“接入了触觉传感器”,实际决策时却仍然主要依赖视觉。
围绕这一问题,北京中关村学院研究团队提出ResTacVLA,借鉴人类大脑的预测编码机制,将触觉表示为“视觉预期与真实物理接触之间的差异”。模型不再平均处理所有触觉信息,而是重点感知视觉没有预料到的碰撞、卡滞、滑移和接触变化,从而让VLA真正利用触觉完成动作修正。
该成果已被机器人领域国际重要会议IROS 2026录用。

论文标题:Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation
会议:IEEE/RSJ International Conference on Intelligent Robots and Systems(IROS 2026)
作者:Pengwei Zhang, Bin Xie, Ce Hao, Xinpan Meng, Xinyu Guo, Fang Deng, Long Cheng, Tiancai Wang
论文地址:https://arxiv.org/abs/2607.03387
代码及项目主页:https://awilekong.github.io/ResTacVLA/
视觉主导的VLA非常适合完成自由空间中的动作。例如,摄像头可以观察物体位置、机器人姿态和运动轨迹,模型据此完成接近、抓取和搬运。
但当机器人真正接触物体后,问题发生了变化。在插入任务中,毫米级的位置误差可能导致插头卡住;在灯泡旋拧中,机器人需要判断螺纹是否咬合以及旋转阻力是否异常;在擦拭任务中,机械臂必须持续贴住表面,而不能悬停在物体上方。
这些状态往往难以从视觉中直接判断,却会在触觉中留下明显信号。
然而,直接将触觉图像与普通相机图像一起输入模型并不一定有效。视觉信息几乎在每个时刻都包含丰富内容,而触觉在自由空间运动时通常没有明显变化,只有在接触发生后才突然变得重要。面对这种信息量极不平衡的多模态输入,模型容易形成“视觉主导、触觉失效”的模态坍缩。
论文实验也验证了这一现象:将ResNet编码的触觉特征直接加入π0.5后,模型综合平均表现由视觉基线的28.2%下降至23.2%。这说明,简单增加一个触觉输入通路,不仅未必带来提升,甚至可能使高维触觉噪声干扰原有策略。
真正的问题不是机器人有没有触觉,而是模型能否识别:触觉在什么时候提供了视觉无法获得的新信息。
ResTacVLA的核心思想可以用一个简单问题概括:
如果机器人已经通过视觉预料到自己将产生什么触觉,那么真实触觉中与预测不一致的部分,是否正是最值得关注的信息?
为此,研究团队设计了 Cross-Modal Predictor(跨模态预测器,CMP)。该模块首先根据机器人腕部相机画面,预测当前时刻“应该出现”的触觉表示;与此同时,GelSight触觉传感器记录真实接触产生的触觉图像。
模型随后计算二者之间的差异:残差触觉=真实触觉-视觉预测触觉
这里的“残差触觉”并不是简单计算前后两帧触觉图像的变化,而是衡量视觉预期与真实物理接触之间的差异。
例如,视觉可能预测机器人将顺利插入孔中,但真实触觉却记录到侧向碰撞;视觉可能认为灯泡已经对准,触觉却检测到螺纹没有正确咬合;视觉可能看到机械臂沿盘子表面移动,触觉却表明末端已经失去接触。
这些无法被视觉提前解释的残差信号,恰恰对应机器人最需要修正动作的时刻。

原始触觉图像包含大量细微形变和高频噪声,如果直接输入操作策略,模型仍然可能难以提取稳定信息。
ResTacVLA进一步通过向量量化方法,将残差触觉压缩为一组离散的 Latent Contact Primitives(潜在接触原语)。这些接触原语可以理解为机器人从大量触觉数据中自动总结出的典型物理事件,例如:
自由空间运动;
初次建立接触;
意外碰撞;
成功对准;
稳定插入;
旋拧过程中的阻力变化。
对模型内部表示进行可视化后,研究团队发现,不同任务中的自由空间运动会集中到一个共同区域,因为这些阶段几乎没有新的触觉信息;而一旦发生真实接触,不同任务会形成与碰撞、对准和交互状态相关的局部结构。
这说明,模型不只是压缩了触觉图像,还从连续触觉信号中形成了一套具有物理意义的“接触词汇”。

残差触觉解决了“应该提取什么信息”,但机器人还需要判断“什么时候使用这些信息”。
为此,ResTacVLA设计了 Surprise-Aware Gate(惊讶感知门控,SAG)。跨模态预测器在预测触觉时,不仅输出预测结果,还输出视觉预测的不确定性。该不确定性被用作衡量“跨模态惊讶程度”的信号:
当机器人在自由空间运动、视觉预测较为可靠时,门控值保持较低,模型主要依靠视觉进行轨迹规划,同时抑制无意义的触觉噪声;
当机器人接近物体或建立接触、视觉难以判断真实物理状态时,门控值逐渐升高,触觉通路获得更大权重;
当碰撞、卡滞或螺纹咬合等关键事件发生时,模型利用接触原语修正后续动作。
在灯泡旋拧任务中,门控值在接近阶段接近于零,进入预接触、对准和旋拧阶段后明显升高。这表明模型学会了根据任务阶段自适应分配视觉与触觉的重要性。
模型不需要在视觉和触觉之间做固定选择,而是形成了一种动态策略:自由空间主要相信视觉,物理接触阶段重点相信触觉。

研究团队在真实Franka机械臂上对ResTacVLA进行了验证。机械臂配备Robotiq二指夹爪,并在一个手指上安装GelSight Mini触觉传感器;环境中设置前视、侧视和腕部三个相机,为模型提供多视角视觉信息。
实验覆盖五类具有不同物理挑战的接触密集任务:
灯泡旋拧:判断螺纹是否正确咬合,并感知旋转阻力;
插头插入:在视觉遮挡和毫米级误差下完成对准与插接;
Peg Transfer:连续完成抓取、移动和精细插入;
Plate Wiping:保持末端与盘子表面的持续接触并完成有效覆盖;
Peg-in-Hole:在遮挡条件下根据触觉判断对准和插入状态。
每个任务采集约100条专家演示。评测不仅关注机器人是否完成初步视觉对准,还进一步考察它是否真正完成了旋拧、插接、擦拭等物理交互。

实验结果显示,ResTacVLA在论文定义的综合指标上达到62.8%,相比视觉版本π0.5的28.2%提升34.6个百分点,也明显超过直接触觉融合和预训练触觉编码方法。
在需要完成真实接触交互的阶段,ResTacVLA取得了更加明显的提升:
灯泡旋拧由8%提升至32%;
插头插入由20%提升至60%;
Peg-in-Hole由40%提升至80%;
Peg Transfer由26.7%提升至60%;
Plate Wiping由20%提升至60%。
值得注意的是,残差触觉表示并不只适用于VLA。将相同表示加入Diffusion Policy后,综合表现也由18.8%提升至38.0%,提高19.2个百分点。这说明“感知视觉之外的触觉残差”是一种具有一定架构通用性的触觉融合思路。
消融实验进一步表明,如果取消离散接触原语,模型在代表性任务上的平均成功率由60.0%下降至33.3%;如果将自适应门控替换为始终开启的固定触觉融合,成功率下降至46.7%。这说明机器人既需要从触觉中提取稳定的物理事件,也需要选择正确的时机使用触觉。


真实环境不会永远与训练数据完全一致。物体可能被移动,抓取位置可能出现偏差,操作表面的高度也可能发生变化。
研究团队进一步设计了三类扰动实验:
在插头插入任务中,为初始抓取增加位置和角度偏差;
在Peg-in-Hole执行过程中,突然将目标移动3至5厘米;
在Plate Wiping任务中,将表面高度分别改变正负2厘米。
在动态目标移动条件下,ResTacVLA成功率达到66.7%,视觉模型仅为26.7%;面对初始抓取误差,ResTacVLA达到52.0%,视觉模型仅为8.0%;当擦拭表面降低2厘米时,视觉模型完全失败,而ResTacVLA仍保持40.0%的成功率。
这些结果说明,触觉的作用不只是确认“是否发生接触”,更重要的是帮助策略在真实物理状态与视觉预期不一致时及时调整动作。


ResTacVLA揭示了多模态机器人学习中的一个关键问题:增加传感器并不会自动产生新的智能。只有当模型能够区分冗余信息与关键物理变化,触觉才会真正参与决策。
残差触觉表示让机器人关注视觉无法解释的物理变化,潜在接触原语将连续信号转化为稳定的接触事件,惊讶感知门控则决定何时增强触觉、何时保持视觉主导。三者共同使VLA从“同时接收视觉和触觉”,进一步走向“根据物理状态主动调用触觉”。
如果说本系列第一项成果TacReasoner解决了机器人如何理解触觉,那么ResTacVLA进一步回答了一个更接近操作的问题:机器人如何把触觉变成动作修正。
不过,现实中的类人操作还包含更复杂的挑战。机器人不仅要完成单臂插入和旋拧,还要协调双臂、灵巧手和工具,并在一个长时程任务中切换抓取、接触控制与手内旋转等不同技能。
在本系列的下一项成果中,研究团队将进一步把VLA、强化学习技能、力触觉反馈和63自由度双臂灵巧机器人整合起来,探索苹果削皮等复杂类人操作任务。
作者团队及项目支持
本文第一作者为北京中关村学院博士生张鹏伟,通讯作者为北京中关村学院兼职导师程龙,合作单位包括中国科学院自动化所、Dexmal等机构。
本成果依托北京中关村学院培育项目“触觉/力控多模态融合机器人操作策略研究和应用”。项目围绕触觉感知、力控反馈和具身智能操作策略开展系统研究,推动机器人从视觉主导的动作生成,进一步走向能够感知接触、响应物理变化并稳定完成复杂操作的多模态具身智能