来源:北京中关村学院
链接:https://mp.weixin.qq.com/s/TdnRO86H-8cF-dcQAkfLsg
如果闭上眼睛,用手按压一个水果,我们如何判断它是否成熟?真正有用的信息并不只是接触某一瞬间的触觉图像,而是水果在持续按压时如何形变、接触面积如何扩展,以及手指滑动时是否出现位移和摩擦。
对于机器人而言也是如此。触觉并不是一张静态图片,而是一段持续发生的物理交互过程。然而,现有触觉语言模型往往更擅长识别物体表面的静态属性,难以理解按压、滑动、旋转和释放过程中不断变化的接触状态。当模型面对陌生物体或复杂问题时,还可能绕过真正的触觉证据,仅凭语言先验“猜出”答案,产生触觉语义幻觉。
围绕这一问题,北京中关村学院研究团队提出了动态触觉语言推理框架TacReasoner。该工作通过动态触觉编码器显式建模接触过程中的时间变化,构建触觉链式推理数据集 TouchCoT-10K,并进一步建立面向动态接触理解的评测基准DynTAC-Bench,推动机器人触觉智能从“识别触觉属性”走向“理解接触过程并进行物理推理”。
该成果已被机器人领域国际重要会议IROS 2026录用。

论文标题:TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Open-World Scenarios
会议:IEEE/RSJ International Conference on Intelligent Robots and Systems(IROS 2026)
作者:Kailin Lyu, Di Wu, Long Xiao, Jianning Zeng, Jianwei He, Chang Lin, Lianyu Hu, Lin Shu, Jie Hao, Ce Hao
论文地址:https://arxiv.org/abs/2607.05131v1
近年来,视觉触觉传感器能够将接触面的细微形变转化为高分辨率图像,使机器人可以识别硬度、弹性、摩擦和表面纹理等物理属性。但触觉与普通视觉存在一个本质区别:视觉可以在远距离观察物体,触觉信息则必须通过主动交互才能产生。
当机器人按压一个物体时,接触区域会逐渐扩大;当机器人沿物体表面滑动时,纹理会发生位移,局部剪切和摩擦也会随之变化;当机器人松开物体时,材料还可能以不同速度恢复原状。这些连续变化共同揭示了物体的弹性、摩擦、真假和当前接触状态。
已有方法虽然可以把触觉信号当作视频输入模型,但其训练目标往往集中在图像重建或静态属性分类,缺乏对跨帧形变传播、滑移变化和接触阶段的显式建模。因此,模型可能看到了多帧触觉图像,却没有真正理解这些触觉变化所反映的物理过程。
TacReasoner从这一关键问题出发,将触觉理解的重点从“某一帧看到了什么”,转向“接触过程中发生了什么”。
为了捕捉触觉交互的时间变化,TacReasoner提出了 Dynamic-aware Tactile Encoder。
该编码器将触觉信息拆分为两条互补通路:一条通路保留物体接触区域的稳定外观信息,另一条通路专门建模相邻时刻之间的动态变化。模型随后通过注意力机制融合两类特征,并结合用户提出的问题,提取与当前推理目标最相关的触觉证据。
例如,当问题是“哪个物体更有弹性”时,模型会重点关注按压过程中接触面积的扩展和释放后的恢复变化;当问题是“物体是否正在滑动”时,模型则需要关注接触纹理的位置变化和剪切积累。
这种设计使模型不再只是对触觉视频进行整体编码,而是能够围绕具体问题,追踪触觉信号随时间演化的过程。

仅仅增强触觉特征还不够。研究团队发现,现有触觉问答数据通常只提供属性标签或简短答案。例如,模型可能被要求直接回答“硬”或“软”,却不需要解释答案来自哪些接触变化。
这使模型容易学习物体名称、语言模板和属性标签之间的表面关联,而不是根据真实触觉证据进行推理。当面对陌生物体、不同类型的触觉传感器或训练数据之外的问题时,模型就可能产生看似合理、实际缺乏触觉依据的回答。
为此,研究团队构建了触觉链式推理数据集TouchCoT-10K。每条数据不仅包含触觉视频、问题和最终答案,还包含一个结构化的中间推理过程,要求模型依次分析:
最大接触时的区域形状和轮廓;
按压过程中接触面积如何变化;
滑动时纹理是否发生明显位移;
不同阶段的触觉证据共同说明了什么物理属性。
数据生成后还经过一致性检查和人工审核,过滤推理过程与最终结论不一致的样本。通过这种方式,模型不仅学习“答案是什么”,也学习“应当依据哪些触觉变化得到这个答案”。
TacReasoner采用两阶段训练:第一阶段完成触觉特征与语言空间的对齐,第二阶段利用TouchCoT-10K激活模型的结构化触觉推理能力。实验表明,动态编码器和触觉推理数据缺一不可,二者共同构成了TacReasoner性能提升的关键。
为了评估模型是否真的理解了动态接触过程,研究团队进一步建立了DynTAC-Bench。
在数据采集过程中,UR5机械臂按照统一流程与物体进行交互:首先从物体上方接近,随后完成按压、旋转和滑动,最后离开物体表面。一次交互形成约5秒的触觉视频,并通过多次重复采集获得稳定的动态接触数据。
DynTAC数据包含五组外观高度相似的真假水果,以及五类具有不同材料和物理属性的日常物体。一些真假水果仅依靠视觉甚至静态接触难以区分,模型必须分析持续按压和滑动过程中呈现的动态触觉差异。
DynTAC-Bench主要覆盖三类能力:
基础物理属性理解:识别硬度、粗糙度、纹理等基本属性;
触觉常识推理:根据触觉证据判断物体特性、用途以及不同表面之间的关系;
动态接触推理:判断水果是真是假,或识别物体当前处于接触、滑动还是释放阶段。
这使评测不再停留在静态触觉分类,而是进一步考察模型能否将连续触觉变化转化为可解释的物理判断。


在VTV-150K触觉理解和推理任务上,TacReasoner-7B的综合平均性能达到66.7%,相比同等规模的VTV-LLM-7B提升6.3个百分点,并超过参数规模更大的VTV-LLM-14B。
其中,TacReasoner在弹性判断上提升9.24个百分点,在需要比较多个物体触觉属性的任务中提升12.72个百分点,在根据触觉感受推断物体身份的任务中提升11.07个百分点。相比简单的静态属性识别,模型在更复杂的比较、关联和场景推理任务上表现出更明显的优势。
在DynTAC-Bench的动态任务中,TacReasoner同样取得显著提升:
在真假物体识别任务中,准确率由VTV-LLM-7B的43%提升至68%,提高25个百分点;
在接触状态估计任务中,准确率由46%提升至53%,提高7个百分点。
这些结果说明,模型的提升并不只是来自更强的语言能力。动态触觉编码器帮助模型捕捉接触过程中的真实变化,TouchCoT-10K则进一步促使模型将这些变化组织成可解释的推理过程。



TacReasoner并不是一个直接控制机械臂完成操作的动作模型,它解决的是触觉具身智能中更基础的问题:如何将触觉传感器记录的连续形变和接触变化,转化为可以解释、比较和推理的物理证据。
这项工作表明,触觉智能不能简单照搬视觉模型的技术路径。真正有价值的触觉信息往往隐藏在交互过程中:物体如何形变、何时开始滑动、接触状态如何转换,以及这些变化与物体属性和现实常识之间存在怎样的联系。
通过动态触觉表征、触觉链式推理数据和动态评测基准,TacReasoner为构建能够理解物理接触的触觉语言模型提供了新的技术路径,也为机器人进一步利用触觉进行操作决策奠定了基础。
在本系列的下一项成果中,研究团队将进一步回答另一个关键问题:当机器人已经能够感知触觉之后,如何让VLA操作模型真正重视触觉,并在插入、旋拧和擦拭等接触密集任务中根据触觉实时修正动作。
作者团队及项目支持
本文第一作者为吕凯霖,通讯作者为郝策,合作单位包括 中科院自动化所、北京中关村学院、南洋理工大学、广东人工智能与先进计算研究院。
本成果依托北京中关村学院培育项目“触觉/力控多模态融合机器人操作策略研究和应用”。项目围绕触觉感知、力控反馈和具身智能操作策略开展系统研究,推动机器人从视觉主导的环境理解,进一步走向能够感知接触、理解物理状态并完成复杂操作的多模态具身智能。