资讯 业界
此为临时链接,仅用于文章预览,将在时失效

一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

作者:陆毅
2026/09/10 09:55
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?
语义和几何能力,正在 Model 层形成可以公开验证的技术结果。

    编辑丨李希

                                                                                                       

如果机器人最终要进入家庭,它面对的将是一个和标准实验环境完全不同的世界:

桌上的东西不会永远摆在同一个位置,光线不会始终一致,用户也不会按照模型训练时的固定模板给出指令。

今天,用户说:“帮我拿杯子。”明天就可能变成:“把我刚才喝水那个拿过来。”甚至是:“不要大的,拿旁边那个。”

这些表达对于人类几乎没有理解成本,但对一个真正需要执行动作的机器人来说,背后同时包含了任务意图、目标识别、空间关系和动作选择等等要素。

于是,一个问题开始变得明确:如果机器人最终要进入家庭,“会做动作”并不足够。它既需要理解人,也需要理解物理世界。

欧拉万象最近公开的两个模型【OLA-Sem】和【OLA-Geo】可以被看作对这两个问题的阶段性回答。

一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

01


第一道题:

用户到底想让机器人做什么?

标准机器人任务往往定义得很清楚:“抓取红色杯子”“把物体放进盒子”……只有定义清楚任务,机器人才能知道要去什么地方,面对什么目标,执行什么动作。

但在家庭里,没人会这么说话,用户会使用指代、属性、上下文,也会在任务执行过程中临时改变要求。

这意味着,机器人真正需要解决的问题,并不只是“下一步动作是什么”,还包括“用户说的对象是什么”、“当前环境发生了什么”、“原来的任务是否还成立”、“接下来又应该如何继续”等等问题。

欧拉万象的 OLA-Sem,就是为了让机器人更好地执行家庭任务而诞生的。

它尝试在统一模型中联合动作预测、图像生成和文本推理,让视觉、语言和动作共享统一表征;预训练阶段则联合第一视角视频、视觉问答与机器人操作数据,希望把语义、环境交互与机器人行动能力进一步连接起来。

换句话说,OLA-Sem 想强化的是:用户的任务意图、机器人当前看到的世界,以及最终行动之间的关联。

一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

02


第二道题:理解目标以后,

它真的知道东西在哪吗?

即使机器人已经准确知道,用户要的是桌上某个特定的杯子,但任务还仍然没有完成——机器人还需要知道不少信息:杯子距离自己多远,前面有没有遮挡物;相邻物体是否会影响抓取;从哪个方向接近更合理;动作发生之后,空间关系又会如何改变。
因为“知道这是一个杯子”和“能够把杯子拿起来”,中间隔着一个真实的三维世界。
这就是 OLA-Geo 试图处理的问题。
它没有简单在一个已经训练完成的 VLA 后增加独立的 3D 模块,而是尝试让几何空间信息从预训练阶段开始就参与模型表征的形成。
训练过程中,空间感知基础模型作为“空间教师”,通过多视角 RGB 图像提供几何信息,再通过特征层面对齐,将位置、深度、尺度和遮挡等信息逐渐融入 VLA 自身的视觉表征。而到了真正部署阶段,“空间教师”就无需额外参与推理。
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?
为什么一家做家庭场景的公司,会觉得几何必须更早地进入模型?
OLA-Geo 背后的判断可以概括为:空间不应该只是机器人准备行动时临时调用的一条辅助信息,而应该逐渐成为模型理解物理世界的一部分,也就是空间原生的具身模型。
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

03


一个目标家庭服务的机器人公司,

为什么同时做这两件事?

要回答这个问题,答案恰恰可能来自家庭本身。
假设用户说:“把沙发旁边那个蓝色的东西拿给我。”机器人首先需要判断语义——“蓝色的东西”是什么;同时还需要理解几何空间——“沙发旁边”意味着怎样的空间关系,目标到底在哪里。
而真正执行时,两种信息必须共同转化为动作,这样机器人才能在家庭里实际地完成任务。
所以,OLA-Sem 和 OLA-Geo 并不是两道彼此独立的题:OLA-Sem 更关注任务意图、当前观察与行动之间的关联OLA-Geo 更关注物理世界当前是什么状态,以及目标处在怎样的空间关系里。
最终,它们都必须回答:机器人怎样真正理解并作用于物理世界?
但对于欧拉万象来说,OLA-Sem  OLA-Geo 并不是最终目的。它们只是 OLA 整个 Real-world RSI(Recursive Self-Improvement)System 中,Model 层目前已经公开的两种探索。
真正的问题是:当这些模型能力进入真实机器人以后,一次执行产生的新数据和反馈,能否重新推动模型、系统与本体继续进化?
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?
欧拉万象基础模型:语义几何并行,迭代自我提升
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

04


RoboTwin 

给出了第一张阶段性成绩单

最近更新的 RoboTwin 2.0 Leaderboard,为欧拉万象的两个探索提供了一次公开评测结果:
OLA-Sem 取得 71.3% 的 Average 综合成绩,排名第一;
OLA-Geo 在 clean2clean设置下取得 83.0%,排名第一;
同时,OLA-Sem 在更强调环境变化与泛化能力的 clean2random设置中取得 67.6%,排名第二。
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?
【成绩汇总图】RoboTwin 2.0 来源
从这个角度看,RoboTwin 给出的更像是一张阶段性成绩单。它验证的是 OLA 在 Model 层的一部分探索,而不是一个完整家庭机器人系统已经成立。
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

05


欧拉万象真正想 build 的,

不只是一个 Model

如果把 OLA-Sem、OLA-Geo、Agentic OS、Embodiment 和 Data & Model Infra 分开看,它们很容易被理解成几条独立的技术线。
而“分别把四个模块做好”,却无法概括欧拉万象的野心。
如果整个公司只 build 一件事,那就是一套面向具身智能的 Real-world RSI System。
Model、Agentic OSembodiment  Data & Model Infra,都是这套系统的组成部分:
Model 负责持续增强机器人对语义、空间与行动的理解;
Agentic OS 连接用户意图、任务规划、技能调度与执行过程,让机器人从“完成一个动作”,进一步走向“完成一个任务”;
Embodiment 则让这些模型和系统能力真正进入物理世界——OLA 围绕 AI-native 的机器人本体与 Mobile Manipulation 持续优化,让机器人既走得到,也拿得到;
而 Data & Model Infra 承担的,是整套系统里“让下一轮变得更好”的闭环角色——机器人进入真实世界以后,每一次成功、失败和异常执行都会产生新的数据,这些数据又会被重新采集、处理、分析,进入训练与评测,再重新部署回机器人——因此,Infra 的价值不只是“把模型训练出来”,而是让真实世界本身持续成为下一轮模型和系统进化的数据来源。
于是,整个系统就形成了一个具身智能持续进化的循环:真实任务 → 执行 → 反馈 → 数据 → Model / System 迭代 → 再部署 → 新的真实任务。
当这个循环不断发生,OLA 希望实现的就不只是某一次 Benchmark 上的性能提升,而是机器人在真实世界中的持续 Self-Improvement——这就是 OLA 所定义的 Real-world RSI System。
从这个角度再看 OLA-Sem 和 OLA-Geo,它们的重要性也不只在于分别解决语义与空间问题。它们是这个循环里 Model 层已经露出的两种能力。
而 Agentic OS、本体和 Data & Model Infra,则负责让这些能力真正进入现实世界,并将新的现实世界经验重新送回下一轮迭代。
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?
一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

06


Benchmark 之后,

真正的问题仍然是现实世界

当然,RoboTwin 不等于一个真实家庭:真实家庭中的语言更自由,空间更复杂,人与物会持续变化,任务可能持续更长时间,机器人还会遇到错误恢复、安全、人机协作以及长期学习等一系列问题——这些都无法由一张 Leaderboard 给出最终答案。
所以,对欧拉万象来说,OLA-Sem 和 OLA-Geo 更像两张阶段性答卷,它们至少回答了一个问题:语义和空间这两种能力,正在 Model 层形成可以公开验证的技术结果。
而下一步的问题则是:当这些能力真正离开 Benchmark,来到一个持续变化的现实环境中之后,它们到底还能做到什么?
从这个角度看:第一名不是结论。真正的考试,才刚刚开始。
长按图片保存图片,分享给好友或朋友圈

正在生成分享图...

取消
相关文章