
作者丨张 璐 邓哲敏
编辑丨齐铖湧
本届 WAIC 大会除了各个展台和产品demo,我们最关注的,其实是一些细分领域的论坛,这里面是是最容易涌现行业真思考的地方。
今天上午,可能是这届WAIC具身领域含金量最高的论坛出现了。
由智元合伙人、觅峰科技董事长兼CEO姚卯青攒局,Physical Intelligence研究科学家任至意,佐治亚理工学院徐丹飞,Dyna Robotics联创马也骋,腾讯首席科学家张正友、Sunday赵子豪等行业各个细分方向的一号位,带来了一场以Scaling Law的“物理墙”:物理AI如何迎来通用智能涌现为核心议题,集结国内具身智能、机器人仿真、物理建模赛道的头部领军人物的圆桌对谈。

姚卯青和徐丹飞一直在研究怎么“采数据”,采什么数据,Sunday和 PI 团队则聚焦落地和算法,做出了目前世界上最被公认好用、最顶尖的具身模型 ,可以说是全行业最懂数据价值的人之一。
再加上其他几位在各大厂和创业公司一线负责技术部署的顶尖科学家,这帮最懂行、最会采数据也最会用数据的人聚在一起,讨论的是直击具身行业目前最核心的命题:
在这个从数字到真实的跃迁期,到底该去哪搞高质量的物理经验数据?怎么用这些数据把机器人的操作成功率喂到商业落地的标准?
雷峰网(公众号:雷峰网)AI 科技评论在现场完整听完了这场干货碰撞,接下来为你拆解这帮物理 AI 拓荒者眼中的行业进化内幕。

01
首先登场的是东道主、智元的姚卯青。
在过去一年多的时间里,他带领团队深扎在一线,用真机在真实场景里不断“摸爬滚打”。
在疯狂采数据、炼模型的过程中,他敏锐地捕捉到了物理AI智能涌现的核心,那便是表征与闭环的“双螺旋驱动”——从知识规模化向真实世界经验规模化的范式跃迁。

但在实际干的过程中,他也发现行业迎面撞上了三道难以逾越的“物理墙”:
一是数据墙,真实交互数据极度稀缺且成本昂贵,没法像互联网数据那样轻松规模化获取;
二是表征墙,各类机器人各自为战,缺乏跨任务、跨本体的统一表征;
三是闭环墙,现实中试错代价太高、反馈极慢,动辄硬件报废。
为了打破这三堵墙,他们选择在模型和数据上双线并进,通过世界模型仿真与多机器人集群强化学习全力破局。

姚卯青坚信,只有让这个“可泛化、可优化、可进化”的技术飞轮真正高速转动起来,才是物理AI突破智能涌现的唯一核心路径。
不过,想要在物理世界实现真正的具身突破,除了看清路径,更需要足够好用、且能在反馈中持续进化的基础模型。

02
紧接着登场的清华大学苏航教授,便重点分享了他在“从观察到行动”这一具身基础模型与反馈学习上的前沿工作。

面对多变且复杂的物理环境,苏航教授指出,具身智能不仅需要强大的跨模态基础认知能力,更需要建立一种高效的“反馈学习”机制。
他结合团队最新的研究成果,详细阐述了如何让机器人通过主动观察环境、在交互反馈中自主修正动作策略,从而大幅提升任务的成功率与泛化能力。
这一工作为如何让机器人既能“看懂”世界又能“精准行动”,提供了一套极其扎实的理论与工程解法。

有了苏航教授在反馈学习和基础模型上的底层框架支撑,如何让这套模型在产业实战中真正“看懂”海量异构数据,就成了下一个需要攻克的堡垒。
接下来,最懂数据价值的PI团队科学家任至意,带来了他们关于扩展数据上下文(Context)的全新解法。

03
任至意一登场,直接把这场论坛的主题推向了行业都在拼命摸高的地方:机器人到底怎么才能真正“听懂、看懂”上下文(Context)?
“过去这阵子,包括我们团队自己做 PI0.5 的时候,大家都踩过不少坑”任至意直言不讳地说。
以前大家总觉得把历史信息和粗粒度的语言指导往模型里一塞就完事了,结果发现经常把模型“带坏”。
因为指令太模糊,模型根本分不清哪些数据是高质量的“标准动作”,哪些是带偏节奏的“无效动作”。

为了解决这个痛点,他们直接从大语言模型和视频生成模型里偷师,给最新的 PI0.7进行了一次上下文的“大升级”:不仅用上了更厉害的视频编码器,还整了一套叫 Dance Multimodal Guidance 的高维玩法,让模型能提前预判任务做完后的画面。
更绝的是,他们首次在 Context 里加上了数据质量打分。这样一来,模型在训练时就像开了天眼,一眼就能看出数据的“好坏”。
这种策略,让 PI0.7 迎来了爆发性的突破。
以前不同飞轮训练出来的策略只能各自干一件活,现在 PI0.7 单凭同一个 Checkpoint,不用做任何特定任务的微调,就能通吃好几个复杂场景,甚至还涌现出了跨本体技能迁移的奇迹——在便宜机械臂上学到的叠衣服技能,直接就能无缝挪到工业级 UF5 机械臂上使用。
甚至人只需要用最具体的语言在旁边指挥,不用遥操作,机器人自己就能把从未见过的动作给做出来。
听完任至意分享的这一套 Context 升级组合拳,台下的徐丹飞教授显然坐不住了。
既然模型对数据的理解已经到了这个精度,那摆在行业面前最大的瓶颈,就变成了去哪里搞更多、更具物理智能的高价值数据。
徐丹飞一上台,直接抛出了那个让全场眼前一亮的颠覆性观点:别光盯着机器人采数据了,人类自己就是最好的“教科书”!

04

他先聊起了年初在北美爆火的“免费上门打扫卫生只为拿头戴设备录数据”的奇葩商业新闻。
在大家都在看热闹的时候,徐丹飞团队其实从2023年开始就坚定地在这个方向上死磕了。他直言,传统的遥操作不仅累人、难规模化,更要命的是会把揉面、拿薄卡片、用手肘带门这种精细的“物理智能”给掩盖掉。
既然人形机器人长得越来越像人,人类为什么不能成为机器人最好的老师?
带着这个猜想,他们一路从实验室摸索到了英伟达的规模化验证阶段。到了今年年初,团队已经丧心病狂地堆到了2万小时的人类第一视角数据。

在海量数据的喂养下,他们惊喜地观测到了具身智能领域的线性Scaling规律:只要数据量成倍翻上去,机器人的复杂操作成功率就跟着蹭蹭往上涨,甚至能零样本去组装玩具小车。
这种“把人当机器人训”的超前路线,直接给行业指明了一条用人类经验突破数据荒的全新大路。
而紧接着登场的Genesis AI王尊玄,则把侧重点放在了如何让机器人在实验室之外的真实世界里“能思考、少犯错”。

05
王尊玄一上来就分享了他们今年在世界模型(World Model)控制上的最新突破。
他坦言,现在的World Action Model在控制和泛化上比以前的法子都要省数据,但如果机器人只靠这套直觉系统,进了真实世界还是不够看,必须得给它配上一颗处理长程任务的Reasoning Model(慢思考大脑)。

靠着这套双系统和20万小时的混合预训练,Dyna直接把新任务的上手门槛给打了下来。
王尊玄在现场甩出了几个让人惊掉下巴的案例:只喂了一两个小时的数据,机器人就能无限循环切芹菜且零失误;在容错率极低的高精度堆杯子、分类极薄创口贴的任务里,也是一把过。
更绝的是,这种高效的后训练(Post-Training)在他们公司已经不需要研究员动手了,刚入职的普通采集员自己录两段,模型就能学会新动作,甚至还能零样本去抓各种没见过的物体。
这种Data-Driven的强悍泛化,让大家看到了机器人走向千家万户的底气。
不过,从实验室里的“神童”到流水线上的“熟练工”,中间还隔着一道叫可靠性的硬槛。
作为Dyna Robotics的联合创始人兼首席科学家,马也骋最后登台,直接把大伙拉回到了最残酷的商用现实中。

06
作为Dyna Robotics联合创始人兼首席科学家,在演讲中分享了团队从2024年9月创立以来,同时推进基础模型研究与真实世界部署的独特思路。

他强调,实验室里的模型研发和真实商业场景的需求存在明显差异。只有把真实世界部署(Deployment)和研究紧密结合,才能让研究方向更精准、模型更实用。
为了让模型更加皮实,他们创新地搭了一个“数据金字塔”:底层用互联网和人类第一视角数据铺底,中间用真机多任务数据过渡,而塔尖最核心的,则是机器人在真实部署中犯错、并完成恢复(Recovery)的高价值过程数据。

把这20万小时的杂交数据炼成基础模型后,马也骋直接把它扔进江西南昌的红旗3C产线去“搞实战”。
结果非常硬核:机器人全工段24小时连轴转,单次多日直播干了近6.5万件活,成功率硬生生顶到了99.99%!

马也骋在结尾给大家泼了一盆清醒的冷水:现在行业里有太多的通用模型,什么都能干一点,但干什么成功率都不高,这在商业部署上是没有价值的。
Dyna接下来的使命,就是在保证通用的前提下,把单项复杂任务的成功率死磕到极致。
只有跨过这道“可靠性”的鬼门关,具身智能才算真正走完了从实验室到产业落地的历史性长征。

07
在WAIC大会的尾声,一场关于具身智能底层逻辑与产业格局的对话将气氛推向了最高潮。
来自智元的姚总、PI团队的任至意、斯坦福大学的徐丹飞、Dyna Robotics的马也骋、腾讯的张正友以及Sunday的Tony,围绕数据、模型路线、软硬件一体化及大厂壁垒等核心命题,展开了一场直面痛点的干货碰撞。
▎吵了一年的主流算法路线,出现共识了么?
任至意:在我看来,VLA(视觉-语言-动作模型)与世界模型(World Model)完全不冲突。原生理解Context并对未来进行建模,绝对能提高模型的表征能力。我们在最新模型里通过生成未来的子目标图像来引导底层模型,这很Make Sense。未来两者的技术趋势一定会逐渐收敛。
马也骋:本质上模型需要的各种能力是共通的,但从更少数据达到极高成功率和鲁棒性的角度出发,我们在一些特定场景下发现,用WEM(世界动作模型)去处理会比VLA更加高效。不过单一模型是不够的,还需要Reasoning Model来支撑长程复杂任务。
徐丹飞:从机器人真正部署能用的角度来看,核心指标只有三个:能不能学到数据里的东西、能不能泛化、跑得够不够快(实时性)。现在学术界和产业界对这两种架构哪个更好并没有定论,最终赢的不是某一种特定架构,而是它体现出的长程索引或Context学习能力。
张正友:整个行业都还在起步阶段,远没有到大语言模型那种加数据就能往前推的统一框架。如果借鉴人类的認知系统,具身智能Agent至少应该包含认知、感知行动和肢体反应三层闭环系统。只靠一个3B、4B的单一小模型去解决所有问题,显然是不现实的。
▎具身公司该做大脑还是全栈?硬件本体是否决定机器人智能上限?
Tony:现在的本体设计实际上是成本与能力的权衡。我们采用三指夹爪,就是追求以20%的成本获得80%的能力。目前机器人无法走进千家万户,核心瓶颈不在于缺少一个五指灵巧手,而在于手后面的大脑不够聪明。只要解锁了智能层,机器人才真正有用。
任至意:没有自研硬件,在某些具体任务上确实会受到限制。但现阶段我们的策略是用维护成本较低的本体把Infra先搭起来,快速支持模型的研发和能力涌现,这更偏向研究导向。当然,长期来看我们肯定会考虑更加可靠的硬件。
姚总:面向一线用户时,可靠性、成本和成功率非常现实。自己钻研底层硬件设计,才能在所有约束条件下优化出最高效的系统。比如端侧芯片算力受限,这就催生出端云结合的架构——云端低频推理,端侧跑5B/10B模型做高频控制。全栈研发能让我们对这些约束有更深的体会。
徐丹飞:从科学研究的角度,我们有一个假设:只要机器人的灵巧度达到一定程度,就能直接从人类第一视角数据中学习策略。人类数据采集在不影响操作时,本身就是灵巧手状态。我们现在有资源和技术,应该把这条路推一步看看能不能成。
▎互联网第一视角数据,能为物理世界带来多大价值?
张正友:互联网上大量的人人和人机交互数据能极大地帮助机器人训练,但在具体的精密操作层面,人类第一视角视频里往往“看不见手”,因为人类熟练后不会特意关注手部。现在的趋势是多采集一些异构的操作数据,再配合仿真数据提升精确度,一旦部署出去,数据飞轮就能真正飞起来。
▎OpenAI等大厂要是下场做机器人,创业公司该怎么办?
马也骋:大厂做Robotics其实是一直在发生的。但机器人策略和部署对延迟极其敏感,必须在本地运行,很难像语言模型那样只在云端调一个API。有了开源的视频或大模型支持,反而对我们做部署的公司帮助巨大,创业公司依然要坚持走自研或基于开源做本地模型自研的路线。
张正友:大厂有大厂的问题。像PC时代的Mac和Windows,全栈和只做大脑的都能活得很好,腾讯也明确了只做大脑不做本体。对于创业公司来说,要避开大厂的锋芒,就不要做容易被大模型包裹进去的incremental(增量式)改动。在场景和数据上做更深入的思考,创业公司有非常多的可能性。
▎年度猜想:机器人的 ChatGPT 时刻何时到来?
姚总:2年。主要取决于数据层面的进展。
任至意:以前觉得要10年,现在看4到5年。
徐丹飞:5年。
马也骋:差不多4年。
张正友:3到5年。行业需要踏踏实实地去做,这期间非常有希望。
Tony:3年以内。


