来源:北京中关村学院
链接:https://mp.weixin.qq.com/s/W9oQ6Qhzyq_uzzHSAbMrSw
削苹果对人类而言是一个再普通不过的动作:一只手握住苹果并不断旋转,另一只手控制削皮器贴住表面,同时根据阻力调整切入深度。视觉负责判断苹果的位置和剩余果皮,手指触觉用于防止苹果滑落,手臂力觉则帮助控制削皮器与果皮之间的接触。
但对机器人来说,削苹果几乎集中了灵巧操作中最困难的一组问题:双臂需要持续协同,灵巧手需要稳定抓持并完成手内旋转,工具必须保持合适的接触力,多个技能还要在长时程任务中反复切换。任何一个环节出现误差,都可能导致果皮没有切下、苹果从手中滑落,甚至削皮器与苹果失去接触。

现有视觉语言动作模型(Vision-Language-Action,VLA)已经能够完成抓取、移动和放置,但这些成果大多基于二指夹爪和视觉主导的简单任务。当机器人从低自由度夹爪扩展到双臂、双灵巧手,并进入连续接触和手内操作场景时,数据采集、技能学习和力触觉融合都会变得更加困难。
围绕这一问题,北京中关村学院联合研究团队提出由IMCopilot与MoDE-VLA组成的类人双臂灵巧操作系统:利用强化学习技能辅助人类采集高难度示范,再通过混合灵巧专家架构,将手臂力觉、指尖触觉和预训练VLA融合起来,使机器人能够完成齿轮装配、充电器插接、试管重排和苹果削皮等复杂任务。
该成果已被机器人领域国际重要会议IROS 2026录用。论文称,据作者所知,该系统实现了首个自主双灵巧手苹果削皮任务。
论文标题:Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA
会议:IEEE/RSJ International Conference on Intelligent Robots and Systems(IROS 2026)
论文地址:https://arxiv.org/abs/2603.08122
当前VLA模型通常把机器人操作简化为一组相对低维的动作:机械臂负责移动,二指夹爪负责开合。在这类系统中,机器人主要根据视觉判断物体位置,并完成接近、抓取和放置。类人灵巧操作则完全不同。
该研究使用的机器人平台配备两条7自由度机械臂和两只22自由度灵巧手,同时拥有可运动的颈部和上半身。在实验状态下,整套系统需要控制的自由度达到63个。机器人十个指尖均配备触觉传感器,可以提供六维力和力矩信息;两条机械臂的关节力矩则用于反映手臂尺度的接触和受力状态。
自由度增加后,机器人不仅要决定“手移动到哪里”,还要协调每根手指如何弯曲、物体如何在手内旋转,以及两只手如何配合。苹果削皮更要求机器人同时处理三类信息:
视觉信息负责定位苹果、削皮器和剩余果皮;
手臂力觉反映削皮器切入果皮时受到的阻力;
指尖触觉用于判断苹果是否稳定、是否发生滑移。
这使类人双臂操作面临三个相互关联的瓶颈:高质量数据难以采集,一个模型难以同时学习差异巨大的操作技能,异构的力觉与触觉信号也难以直接融合进预训练VLA。
研究团队首先搭建了一套面向双臂灵巧机器人的沉浸式遥操作系统。操作者佩戴上肢外骨骼、外骨骼手套和VR头显,将人体手臂与手指动作映射到机器人,同时通过脚踏板调用辅助技能。
VR画面不仅显示机器人相机视角,还将手臂力矩和指尖触觉以可视化方式叠加在画面中。当机器人指尖接触物体时,手套还会向操作者提供振动提示,帮助其判断当前接触状态。
这套系统可以支持抓取、搬运和双手交接等动作,但研究团队发现,即使是熟练操作者,也很难通过纯遥操作稳定完成连续手内旋转。
原因在于,人手与机器人灵巧手之间存在结构差异。操作者不仅需要控制两条机械臂,还要同时关注数十个手指关节、物体姿态和接触状态。在苹果削皮任务中,人类如果无法遥操作机器人持续转动苹果,就无法获得高质量示范数据,后续VLA训练也无从开始。
因此,研究团队没有要求人类独自完成所有低层动作,而是引入强化学习技能作为“副驾驶”。

研究团队提出IMCopilot(In-hand Manipulation Copilot,手内操作副驾驶),将稳定抓持、手内旋转等高难度动作训练为可以随时调用的原子技能。
这些技能首先在IsaacLab仿真环境中通过PPO强化学习训练。训练过程中,模型学习如何协调多个手指,在保持物体稳定的同时,使物体围绕指定方向连续旋转。通过对物体质量、摩擦系数、尺寸、重心和控制参数进行随机化,技能可以从仿真迁移到真实灵巧手。
IMCopilot在整个系统中承担双重角色。在数据采集阶段,人类仍然控制机器人手臂的整体运动;当任务进入手内旋转阶段时,操作者踩下脚踏板,由IMCopilot接管复杂的手指协调。完成旋转后,人类继续控制机器人执行后续动作。
在自主执行阶段,是否调用IMCopilot不再由人决定,而是由VLA自己判断。VLA的输出中包含一个技能触发信号:当模型认为需要旋转苹果时,IMCopilot接管灵巧手动作,而机械臂仍由VLA控制。
这种层级结构类似于人类运动控制:高层负责判断目标和技能切换,经过大量练习的低层技能则负责快速、稳定地完成具体动作。
为了验证IMCopilot是否真正解决了数据采集瓶颈,研究团队使用乒乓球、网球和苹果测试手内旋转能力。
纯遥操作的总体成功率只有34%,而使用IMCopilot后提高到89%。其中:
乒乓球操作成功率由10%提升至83%;
网球操作成功率由67%提升至93%;
苹果操作成功率由27%提升至90%。
对于乒乓球和苹果,物体容易从指尖滑落,操作者很难通过遥操作连续协调多根手指。IMCopilot则能够根据手指状态和触觉反馈快速调整动作,完成更加稳定的手内旋转。
力触觉反馈也提高了数据采集效率。以齿轮装配为例,在没有反馈时,操作者完成100次采集需要75分钟,其中85次成功;加入力触觉反馈后,完成相同数量采集只需要65分钟,成功示范增加到93次。
这表明,强化学习技能并不是要替代人类示教,而是帮助人类跨越高自由度遥操作中最困难的局部阶段,从而获得原本难以采集的高质量机器人数据。

解决数据采集问题之后,机器人还需要学习如何在自主执行过程中使用力觉和触觉。
一种直接方法是将所有传感器读数拼接到VLA输入中,但手臂力觉和指尖触觉具有完全不同的物理含义:
两条机械臂的14维关节力矩主要反映手臂尺度的受力,例如削皮器遇到的切削阻力;
十个指尖的60维六维力/力矩信号主要反映局部接触,例如手指是否贴住苹果、是否出现滑动。
如果把它们当成同一类状态输入,模型可能混淆不同传感信号的作用,还可能破坏VLA原有的视觉语言能力。
为此,研究团队提出MoDE-VLA(Mixture-of-Dexterous-Experts VLA,混合灵巧专家VLA)。该模型在预训练π0主干之外,为力觉和触觉分别建立专门的信息通路:
将手臂力矩和指尖触觉编码为独立的多模态表示;
通过自注意力与视觉、语言和动作信息进行交互;
利用稀疏专家路由,让不同专家分别处理自由空间、初始接触、稳定抓持和手内旋转等状态;
将力触觉产生的动作修正以残差形式注入VLA输出。
其中,力觉信息主要用于修正机械臂动作,触觉信息主要用于修正灵巧手动作。这种设计避免了不同物理信号相互干扰。
残差注入则保证MoDE-VLA不是重新训练一个完全独立的策略。当机器人处于自由空间、力触觉信息较少时,修正量自然趋近于零,保留预训练VLA原有的视觉语言操作能力;当机器人建立接触后,力觉和触觉专家才开始显著调整动作。

研究团队设计了四项难度逐渐提高的接触密集任务:
齿轮装配:依次抓取三个齿轮,并将其安装到对应齿轮轴上;
充电器插接:抓取充电器,并将其插入插线板;
试管重排:右手取出倒置试管,将其交给左手,再插入目标位置;
苹果削皮:右手控制削皮器,左手持握并旋转苹果,重复完成“削皮—旋转”循环。
其中,齿轮装配和充电器插接主要考察末端接触、插入力调节和毫米级对准;试管重排需要双臂协调和双手交接;苹果削皮则同时包含工具使用、稳定抓持、手内旋转、连续接触和长时程技能切换。
苹果削皮过程中,VLA负责控制右臂和削皮器,使工具沿苹果表面运动;当一次削皮动作结束后,模型触发IMCopilot,由其控制左侧灵巧手旋转苹果;随后VLA重新开始下一段削皮动作,直到完成目标区域。
这使苹果削皮成为检验整套系统的“终极任务”:任何一个模块失效,机器人都难以完成完整循环。

实验结果显示,MoDE-VLA在四类任务上的平均成功率达到34%,相比π0基线的15%提升19个百分点。在不同任务中:
齿轮装配成功率由40%提升至60%;
充电器插接成功率由5%提升至15%;
试管重排成功率由15%提升至30%;
苹果削皮取得30%的完整成功率。
由于苹果削皮包含多个连续循环,仅以“是否完整成功”评价容易忽略部分进展,因此论文还设置了削皮完成率指标。MoDE-VLA的平均削皮完成率达到73%,而π0基线只有8%。
消融实验进一步说明了不同模块的作用:
移除力觉输入后,四类任务平均成功率由34%下降至23%;
移除触觉输入后,平均成功率下降至26%;
在苹果削皮中移除IMCopilot后,削皮完成率由73%下降至25%。
力觉在齿轮装配、充电器插接等任务中提供接触发生和插入阻力信息;指尖触觉帮助机器人维持稳定抓持、检测滑移;IMCopilot则解决了VLA难以直接生成高自由度手内旋转动作的问题。三者并非简单叠加,而是在不同层级分别解决接触感知、动作修正和技能执行问题。

这项工作表明,复杂类人操作未必能够完全依靠一个端到端模型解决。
在苹果削皮这样的任务中,VLA擅长理解语言目标、处理视觉信息和组织长时程动作;力觉与触觉负责揭示视觉无法直接观察的接触状态;强化学习技能则承担需要快速反应和高频手指协调的手内操作。通过层级决策、专家分工和残差修正,这些能力被整合到同一套双臂灵巧操作系统中。
至此,“触觉/力控多模态融合机器人操作策略研究和应用”项目的三项系列成果形成了一条连续技术路线:
TacReasoner让机器人从连续接触变化中理解物理属性和接触状态;
ResTacVLA让操作模型关注视觉无法预料的触觉信息,并据此修正动作;
MoDE-VLA与IMCopilot进一步将VLA、强化学习技能、力触觉感知和双臂灵巧硬件融合起来,完成复杂类人操作。
三项研究分别回答了“如何理解触觉”、“如何利用触觉”和“如何依靠触觉完成复杂技能”三个问题,推动机器人从视觉主导的动作执行,进一步走向能够感知接触、理解物理状态并协调多种技能的多模态具身智能。
本成果依托北京中关村学院培育项目“触觉/力控多模态融合机器人操作策略研究和应用”。项目围绕触觉感知、力控反馈、多模态操作策略和真实机器人系统开展连续研究,为具身智能在精密装配、工具使用、智能制造和家庭服务等场景中的应用提供新的技术路径。合作单位包括上海交通大学、Sharpa、上海人工智能研究院、新加坡国立大学、上海创智学院等机构。

