
作者丨向 欣
编辑丨高景辉
雷峰网(公众号:雷峰网)报道:
逛完今年的 WAIC,原力灵机展台上那座由数万块积木搭建的长城令人印象深刻。

4 台桌面机械臂和 2 台轮式机器人 Apex 联合作业 15 个小时,用近 8.2 万块微型积木拼出了一座 3.5 米长、1.5 米宽的长城模型。桌面机械臂以稳定的节奏拼接着微米级的积木块,轮式机器人滑行穿梭,负责上料、搬运和整体巡视。
这座微缩长城的最小组件不到 1 厘米宽,拼装精度进入亚毫米区间,超越了人手自然抖动的极限。遇到偏差,机器人能自主感知、即时纠错,重新调整姿态后再尝试。
原力灵机让人印象深刻的地方在于,精细操作、错误恢复、多机协同能力能在同一套系统里并行运转十几个小时。展馆里提全栈的厂商很多,但把这些能力串成一条完整作业线跑通的并不多。
他们是怎么做到的?我们在现场和原力灵机联合创始人范浩强聊了聊。展台上的动作只是表象,那些背后的技术判断和产业思考,更值得仔细琢磨。

01
今年 WAIC 上,不少厂商直接把产线搬进展厅,试图用最直观的方式证明落地能力。原力灵机同样以工业落地为目标,却选了不太一样的展示方式:用积木搭长城。
理由很简单。工厂产线太专业了,普通观众可能会看不懂,更重要的是也提不起兴趣。积木就不一样了,人人都玩过。
形式是积木,逻辑其实是产线。上料、装配、质检、下料、异常恢复……这些环节和工厂里的流水线一模一样。而积木本身也成了一个沟通工具:观众看到的是长城,潜在客户看到的是展商的能力边界。
这次积木长城的展项,系统展示了具身智能的三大能力:精细操作、错误恢复、多机协作。
积木的拼接公差是微米级的,远超机械臂自身的重复定位精度。机器人需要先靠视觉判断偏移方向,难点之一是,最后接触的那一刻,视觉已无法分辨,必须转而依赖其他感知方法。
原力灵机的方案是在执行末端装上六维力传感器,它会和关节电流共同推断受力状态,决定是继续压还是停下来。
单做视觉、单做力觉都有人能实现类似的方案,其中难点在于把多模态信号集成进同一个模型还能跑通。这背后是具身通用基础模型 DM0.5 的支持:它引入了历史关键帧实现分钟级任务记忆,训练中扩展了时序推理能力,推理速度在单卡 4090 上可达到 10Hz。
但真正花时间最多的地方,还不是精度,而是异常流的处理,即错误恢复能力。
很多人对工业场景的想象会有一个预设前提:机器人必须做到完美无缺,才有资格走进产线。但一个反直觉的事实是,产线最看重的反而不是完美,而是在出错之后自己可以进行调整恢复,不让整条线停下来。这也更加贴合人类在产线中的工作状况。毕竟百分之几的废品率可以接受,产线一停就是真金白银的损失。
现在大家展示的抗干扰能力,面对的情况其实有两种。一种是人为制造的,例如用手电筒照一照改变光线,或者推一推物品改变位置,机器人再调整回来。不过这种变动未必和真实工况相符。
另一种则是自然环境中自然产生的错误。例如,在这次积木长城的案例中,积木本身会有公差,有的凹槽紧一些,有的松一些,拼装过程中随时可能出现偏差,零件可能会崩出去,掉落到随机的位置,这些就属于自然产生的错误,很难预演。
原力灵机的方法是大量采集真实失败场景的数据,配合 RL 让模型从自身运行分布中学习。其训练数据主要来自真机遥操作,每个月能采集数万小时的真实操作数据。
尽管他们也有使用仿真数据,但范浩强认为,一方面,在 GPU 里模拟一次,花的钱和能耗可能比真实做一次还大,另一方面,地球其实是最好的模拟器。
这套真机数据训练+RL 的模式,听起来门槛不高,但一层层拆开看,每一级都在叠加难度。100 台机器人同时采数据已经很难,还要带着算法一起采,本质上每个数据采集任务都是一个独立项目。原力灵机的DW0.5 世界模型在其中扮演后训练环境的角色,用帧级绑定和密集反馈机制加速了这个过程。
除此之外,6 台机器人还要协同工作。桌面机器人负责精细拼接,两台轮式机器人负责上料、下料和巡视。整个调度由一个 Agent 完成,这个 Agent 直接调用了阶跃星辰最新的大模型。它要感知谁缺料了、谁的组件完成了、整体进度怎么样,然后把任务分解成对原子技能的调用。

这就和真正的产业应用是同样的逻辑了。搭长城,其实是在搭一条产线。

02
今天能搭积木,明天能不能搭别的?可以。
这次积木长城背后的具身模型是以原子性动作作为学习单元的,一拿、一放、一塞、一拉……新任务到来时,模型可以进行子任务拆解,重新组合,具备任务泛化能力。

比如一个牙膏包装的场景,今天要装一管,明天要装两管,后天要装进不同尺寸的盒子,模型不需要重新编程,只需要理解新的指令,调整子任务的排列。这跟拼积木的逻辑一脉相承。
很多场景里的任务,其实都是pick and place型任务的变体。物流分拣、工业上下料、装配、回收料整理,抽象来看都是在做同一件事:把一个东西从一个地方运到另一个地方,只不过 pick 和 place 的环节各有要求,于是变成了拣选、变成了装配、变成了打包。原子技能的拆解逻辑,对应的就是这种任务本质。
原力灵机选择落地场景的逻辑是,不做流水线中间的高频节拍,那些用非标自动化更经济,而是做线头线尾的「零碎活」:料盘用完要拿走、材料卷用完了要上新卷、不同批次的产品需要不同的包装方式。这些动作很难用一套固定的自动化设备实现,占地面积大、稼动率低,但恰好是机器人柔性能力的用武之地。
多机协作的展示也对应产业场景:轮式机器人给桌面设备上料下料、巡视全局,和工厂里一个员工盯几台自动化设备的模式一致。
在硬件设计上,原力灵机的想法也比较超前。
Apex 走圆润亲切路线,原力灵机考虑到一线操作人员接受一个新事物需要过程,外形柔和一些,攻击性和压迫感天然就会降低,安全性在观感上也更容易建立信任。很多厂商今年才开始往这个方向靠,原力灵机在设计之初就已经把这一点考虑进去了。

这种设计思路也帮助原力灵机打开了工业之外的空间,商业场景也在推进中,沃尔玛、优衣库等品牌已经和他们接洽试用。
此外,导航摄像头装在左右两侧而非脑袋前后,既是审美选择也体现了全栈算法能力:有些公司摄像头一换位置算法就适配不了,原力灵机因为算法全栈自研,硬件设计自由度更大。

03
原力灵机能在展台上搭出这座长城,其技术能力是来自一个更长的积累链条。
首先是团队积累深厚。原力灵机由旷视联合创始人、前 CTO 唐文斌创立,核心团队全部来自旷视核心研究院和业务线。范浩强本人也是旷视时期的资深技术骨干。这支团队从 ResNet 时代就开始做视觉模型研究,在 AI 1.0 时代积累了长时间的经验。
现在业界存在 VLA 模型和世界模型的技术路线之争,但在他们看来,这有点像问轮子和激光雷达谁更重要,其实它们都是一辆车里有用的组件,非要辩出谁用谁不用,在技术上不成立。原力灵机提「具身原生模型」的概念,核心逻辑就是:有用的技术都用,不站队。
这个方法论也延续到了他们的研发哲学里。团队在 Transformer 时代做过一次验证,证明了 CNN 加上特定配置也能做 Transformer 能做的视觉问题。他们的思维方式是做「还原论式」的思考:把一个技术 work 的本质和核心提炼出来,再去应用。
更关键的是对数据的理解。原力灵机从第一天就把数据当作核心要素来对待。
我们了解到,原力灵机团队在旷视做计算机视觉的时候,就讲究「数据、算法、系统」三要素,其中数据是第一位的。算法决定在数据充分时能否把能力发挥出来,系统决定能否把算法的表现最终呈现出来。这个认知被完整地搬到了具身智能领域。
之所以从第一天就把数据当作核心要素,也是因为他们重视系统化工程能力。
所谓系统化工程能力,是把硬件、驱动、深度学习基础设施全链条系统化的能力,这里面涉及大量的基建工程。原力灵机开源了 Dexbotic 2.0 一站式 VLA 开发框架、DM0、DM0.5、DW0.5 系列模型权重与配套训练推理代码,目的之一就是为了展示自己在这些方面的思考和投入。
在系统能力的搭建上,今年原力灵机节奏很快:2 月发布 DM0,7 月 Action2026 开发者大会一口气推出 DM0.5、Apex 本体和 DFOL2.0、MaaS、DexOS 三件套,从模型到本体到开发工具到云服务,完整的产品矩阵已经就位。
回到 WAIC 的展台上。今年我们看到不少厂商都在展示泛化能力和长程任务,有的叠衣服,有的用烤面包机,有的做咖啡,的确百花齐放。但原力灵机的「积木长城」仍然是独特的:它展示了一条完整作业流的系统化运转,精细操作、错误恢复、多机协同、任务调度,所有这些能力在同一套系统里跑通,持续十几个小时。

WAIC 上的长城竣工了,具身智能的征程才刚刚开始。下一步,它们要去真正的工厂解决真问题。而能同时把模型、系统、场景三件事都做到极致的公司,才有可能穿越具身智能的技术周期与产业周期,原力灵机至少已经把这三件事都做在了前面。(雷峰网)
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。