来源:智驾机器人技术前线
原文链接:https://mp.weixin.qq.com/s/ud9BIsM145JUfLUZPcsdCQ
机器人已经越来越擅长“看见”物体,却仍然不太会“记住”一个持续变化的世界。桌边的椅子被挪走、垃圾桶消失、推车突然出现,甚至同一个人从机器人身旁反复经过,都可能让语义地图迅速过期。来自卡内基梅隆大学 Robotics Institute 的 SuperMap,试图补上这块长期被忽视的拼图:在几何 SLAM 与视觉基础模型之间,增加一层可持续更新、可查询、带有时间历史的空间记忆。
假设机器人刚刚完成一圈巡检。十分钟后,用户对它说:
“去找之前放在植物旁边的那把椅子。”
这句话看似简单,却同时包含了三个要求:机器人要区分具体的椅子实例,而不是只认出“chair”这个类别;要理解“植物旁边”这一空间关系;还要知道“之前”对应的历史状态,而不是只看当前画面。
传统 SLAM 擅长回答“我在哪里、墙在哪里”,开放词汇检测器擅长回答“画面里有什么”,但两者简单拼接以后,往往仍然无法可靠回答“这个东西是不是刚才那个”“它什么时候消失了”“它原来放在哪里”。SuperMap 的核心价值,就在于把这些离散的感知结果组织成一张持续生长的 4D 场景图。
图 1:SuperMap 同时处理短期动态目标和长期场景变化。上图中的人发生快速运动,垃圾桶从环境中消失,推车则在后续时刻出现。系统不仅更新点云,还要维护对象身份及其历史。
现有语义建图系统通常在几种能力之间做取舍。
离线开放词汇方法可以借助 SAM、CLIP 或视觉语言模型得到丰富的语义,但需要先完整扫描场景,再进行分钟级甚至小时级处理;实时语义 SLAM 能够在线运行,却常常依赖固定类别,缺少开放词汇泛化;动态 SLAM 会剔除行人、车辆等运动目标,却未必保留对象身份,也很少追踪物体在长时间尺度上的出现、消失与迁移。
论文中的能力对比表很直观:SuperMap 希望同时覆盖实时、开放词汇、实例级、短期动态、长期变化和场景图六项能力。
表 1:论文对主流语义建图与语义 SLAM 系统的能力梳理。作者将 SuperMap 定位为同时覆盖实时运行、开放词汇、实例级建图、短期与长期动态以及场景图查询的统一系统。
这里最关键的变化,是地图对象从“带标签的点”变成了“带身份、置信度、空间关系和时间历史的实例”。
一把椅子不再只是若干个被预测为 chair 的点,而是一个具有唯一 ID 的对象节点。系统持续记录它的三维位置、语义标签、存在状态、相邻关系和历史轨迹。当椅子被遮挡、检测器漏检或者机器人转身离开时,这个对象不会立刻从记忆中消失;当证据持续表明它已经被搬走时,旧地图内容又会被逐步清理。
这使 SuperMap 更接近一种“活的空间记忆”,而不是一次性完成的场景快照。
在时刻 ,系统接收 RGB 图像与深度或激光雷达观测:
上一时刻已经维护了一张地图 。当前需要同时估计机器人位姿 、实例关联结果 和更新后的地图 。论文将目标写成:
进一步按条件概率拆解:
这三个因子分别对应:
SuperMap 的系统结构正是沿着这三个问题展开。
图 2:SuperMap 的三层架构。几何层负责位姿估计与稠密三维重建;实例层把二维开放词汇感知结果提升到三维并维护对象身份;拓扑层把对象和关系组织为可供 VLM 查询的 4D 场景图。
SuperMap 的底座不是端到端神经建图,而是 SuperOdometry 提供的 LiDAR-视觉-惯性状态估计与彩色稠密重建。系统接收同步的 RGB、深度或 LiDAR 以及 IMU 数据,持续估计机器人在世界坐标系中的位姿。
若 表示机体在世界坐标系下的位姿, 表示固定的相机外参,则相机位姿为:
这一步看起来是传统 SLAM 内容,却决定了后面所有“记忆”是否可信。
开放词汇检测器只在二维图像中输出框、掩码和类别。如果没有稳定的相机位姿与深度,系统很难判断不同视角中的两个检测结果是否属于同一个真实物体,也无法分辨物体移动和机器人自身运动。SuperMap 因此没有让大模型直接承担几何一致性,而是先用高频 SLAM 建立统一的度量坐标系,再把低频、异步的语义结果锚定到这个坐标系中。
这种设计也解释了系统为何采用“高频几何 + 低频语义”的异步架构:位姿估计以 10 Hz 运行,二维实例分割受基础模型推理开销限制约为 1 Hz。语义感知不必和每一帧几何更新同步,地图仍然能够连续维护。
SuperMap 在二维感知端使用 GroundingDINO 完成语言驱动的开放集检测,并结合 SAM2 得到实例掩码。问题随即从“这一帧看到了什么”转向“这一帧看到的对象,对应地图里的哪一个实例”。
普通二维跟踪器通常假设目标在图像平面中近似匀速运动。机器人快速旋转或移动时,即使场景中的椅子完全静止,它在图像上的位置也可能发生剧烈跳变,导致轨迹断裂或 ID 切换。
SuperMap 为每个轨迹维护一个解耦状态:
其中, 是二维中心点, 是检测框尺度, 表示图像平面速度。
但系统不会只依赖上一帧的二维速度。对于地图中已有对象的三维中心 ,它利用当前相机位姿重新投影,得到更加可靠的二维先验:
随后再将这个投影结果送入卡尔曼滤波预测:
它的直觉很朴素:不要猜椅子在图像里应该往哪里移动,而是根据机器人刚刚估计出的运动,把地图中的椅子重新“拍”回当前图像。这样,机器人自运动带来的大幅像素变化就被显式补偿了。
仅靠跟踪仍然无法处理长期变化。一个垃圾桶暂时没被检测到,可能是模型漏检,也可能被桌子挡住,还可能已经被人搬走。SuperMap 通过几何一致性更新来区分这些情况。
对于地图点 ,系统先计算它在当前相机坐标系中的预测深度 ,再与传感器在投影像素 处测得的深度 比较:
根据残差关系,地图点被划分为三种状态:
当预测点与当前深度吻合时,说明旧对象仍然存在;当旧点落在当前观测表面后方时,它可能只是被新表面遮挡,系统不应贸然删除;当旧点位于当前表面之前、但传感器在同一视线方向上已经看到了更远的背景时,旧点更可能已经离开原位置。
系统用 log-odds 递推方式积累存在证据:
这意味着地图不会因为单帧异常就立即删除对象,而是通过多帧证据逐渐增强或削弱其存在置信度。短暂遮挡被保留下来,持续冲突的旧内容则会被清理。
开放词汇模型的标签具有明显的视角依赖。同一个物体可能先被识别为 chair,之后又被输出为 seat 或其他相近概念。SuperMap 为每个对象维护类别分布,并利用贝叶斯更新融合连续观测:
其中, 是当前检测结果, 是归一化系数。相比直接覆盖旧标签,这种做法会让稳定出现的语义逐渐占据主导,同时抑制偶发误分类。
几何存在置信度和语义标签置信度共同构成了 SuperMap 的“自我修正”机制:新证据可以强化已有对象,也可以推翻旧判断,而不是不断把每帧检测结果堆进地图。
完成实例关联以后,SuperMap 将地图抽象为:
是对象实例节点; 表示 on、beside、under 等空间关系; 则把同一对象在不同时刻的状态连接起来,形成可追溯的时间历史。
以“物体 A 位于物体 B 上方”为例,系统可以通过高度关系与水平投影重叠度建立边:
为了保证在线效率,系统会先根据对象中心距离进行聚类,只在候选对象之间判断关系,而不是对全图所有实例两两计算。
场景图最终被序列化为结构化文本。每个节点包含实例 ID、语义标签和三维中心,边则明确描述空间与时间关系。VLM 不再需要吞入完整点云或长视频,只需阅读一段规模更小、关系更清楚的结构化上下文,并在输出中返回目标实例 ID。系统随后从地图中取出该实例的三维中心,将其转换为导航航点。
这一接口把概率感知与确定性执行分开了:VLM 负责理解语言并选择对象,SLAM 地图负责提供可执行的空间坐标。
论文首先在 ScanNet 上评估语义质量。需要注意的是,SuperMap 是面向流式在线机器人的对象级系统,而不少对比方法可以离线使用完整场景,因此指标不能只看单一的 mIoU。
表 2、表 3:ScanNet 上的类别级与实例级结果。SuperMap 在无背景设置下取得 55.48% 的准确率;在实例级任务中,对椅子、窗户和冰箱等离散对象的 mAP 指标明显高于 HOV-SG 与 ConceptGraphs。
类别级结果中,SuperMap 的无背景 mIoU 为 27.42%,低于点特征融合方法 RayFronts 的 41.29%,但其频率加权 mIoU 达到 43.50%,准确率达到 55.48%。这说明它不是所有类别级指标都占优,优势更集中在对象级表达、在线运行和实例一致性上。
实例级差距则更加明显。以 为例:
这组结果反映出 3D-aware tracking-by-detection 对独立、可分辨物体尤其有效,但对大面积结构、边界模糊或几何关系复杂的类别,仍然存在提升空间。
作者在约 的室内区域进行了 10 分钟真实机器人实验。实验中主动移除植物、垃圾桶和椅子,同时新增水桶、推车和安全标志,考察系统是否能够在环境变化后继续维护稳定 ID。
图 3:上排是水桶、推车和安全标志的出现事件;下排是椅子、植物和垃圾桶的消失事件。新对象获得新 ID,未变化的邻近对象保持原 ID。
与只做帧级检测不同,SuperMap 需要同时完成两件事:新对象出现时不能错误复用旧 ID;旧对象消失后,也不能因为残留点或历史标签继续在当前地图中“幽灵般存在”。
论文设置了对象检测召回率和变化检测召回率两个指标。前者要求对象存在期间被正确检测;后者不仅要求出现阶段被检测到,还要求消失阶段不再产生错误残留。
表 4、表 5:SuperMap 的时空变化检测与消融结果。完整系统在 41 个标注对象的场景中取得 Precision 0.8677、Recall 0.4955、F1 0.6308。
在六个目标对象上,SuperMap 对水桶和椅子的变化检测召回率达到 1.000;对推车、安全标志、植物和垃圾桶分别为 0.622、0.790、0.865 和 0.679。结果并不意味着所有变化都能被完美识别,但至少说明系统能够把“看见对象”和“确认对象已经离开”纳入同一套地图维护逻辑。
消融实验进一步说明三个模块并非可有可无:
值得留意的是,完整系统的 Precision 达到 0.8677,但 Recall 只有 0.4955。SuperMap 更偏向构建一张干净、可信的对象地图,而不是尽可能保留每一个候选实例。对于需要高召回的搜索任务,这种取舍仍可能带来漏检风险。
作者使用 Gemini 2.0 Flash 比较两种输入方式:一种是原始 RGB 视频序列,另一种是序列化后的 4D 场景图。
图 4:左侧任务要求根据灭火器、锥桶和植物的空间关系选择正确实例;右侧任务要求回溯携包人员的历史轨迹。场景图输入给出了更明确的实例、距离与时间关系。
在空间推理任务中,机器人需要找到相对锥桶和植物位置正确的灭火器。原始视频容易受到透视、遮挡和相似实例干扰,场景图则已经把对象坐标与关系整理为明确谓词。
在时间推理任务中,系统需要回忆携包人员经过了哪些位置,以判断物品可能掉在哪里。视频模型必须在长序列中自行建立记忆,而 4D 场景图可以直接沿时间边查询对象轨迹。
两者的差别,不仅是“输入更短”。更重要的是,SuperMap 已经提前完成了对象持久化、坐标统一和关系计算,VLM 面对的不是未经整理的视觉信号,而是一份带有实例 ID 和时间索引的空间数据库。
最后,作者在未知环境中进行了零样本视觉语言导航。机器人一边探索一边在线构建场景图,接收到自然语言指令后,VLM 解析对象与关系,输出目标实例 ID,导航系统再读取对应的三维中心坐标。
图 5:机器人根据“墙上画作旁边的白板”“冰箱旁边的画作”等关系,在多个外观相似的候选目标中完成消歧,并把语言目标转换为真实导航位置。
其中一个场景中存在四块外观相似的白板。单纯依赖类别标签,只能得到四个 whiteboard;场景图则能够结合“画作旁边”“之后去大屏幕”等关系,确定指令所指的具体实例。另一个场景要求寻找冰箱旁边的画作,系统同样通过关系边完成目标检索。
这说明 4D 场景图的意义不只在于让地图更“语义化”,而在于让语言真正落到可执行的三维实体上。
论文给出的板载平台包括 Intel i9-14900H CPU、RTX 4090 Laptop GPU、Livox Mid-360 LiDAR 和全景相机。各模块频率为:
这组数据值得结合系统架构理解。SuperMap 的“实时”并不是每一帧都执行完整开放词汇分割,而是依靠高频几何状态估计维持连续坐标,再让计算更重的语义模块异步更新。对于真实机器人,这往往比强行让全部模块同频更合理。
不过,1 Hz 的二维实例分割也意味着高速动态物体仍可能在两次语义更新之间发生较大位移。论文在局限性中明确承认,系统对高度动态对象的跟踪能力仍然有限。
把这篇工作仅仅概括为“SLAM + GroundingDINO + SAM2 + 场景图”,会低估它的意义。组件本身大多不是新提出的,真正重要的是作者围绕长期一致性重新组织了系统边界。
视觉基础模型擅长开放词汇识别,但不天然维护度量空间、对象身份和长期历史。SuperMap 没有要求 VLM 自己记住整段视频,而是让它负责语义理解,让 SLAM 与概率地图负责世界状态维护。
这是一种更工程化也更可扩展的分工:未来即便替换检测器、分割器或语言模型,底层的时空记忆接口仍然可以保留。
长期地图的难点不只是增加信息,更是删除已经失效的信息。很多语义地图会不断累积旧检测,最终变成充满重复实例和过期标签的仓库。SuperMap 通过几何存在置信度和语义后验,让地图能够根据新证据修正过去。
对于机器人而言,可靠地忘掉一个已经被搬走的垃圾桶,和记住它曾经在哪里同样重要。
端到端 VLA 模型可以从视觉直接预测动作,但长时任务仍然需要持续世界状态。SuperMap 所代表的 4D 场景图,可以成为视觉基础模型与具身智能体之间的外部空间记忆:模型不必在上下文窗口中反复重建整个场景,只需查询与当前任务有关的对象、关系和历史。
从这个角度看,它并不只是一个语义 SLAM 系统,也是在探索具身智能中的“记忆基础设施”。
第一,系统目前依赖预定义的对象提示词列表。虽然检测器属于开放词汇模型,但如果机器人事先没有提出某类对象,它未必会主动发现并纳入地图。真正的开放世界系统还需要自动对象发现和动态提示机制。
第二,高动态目标仍是弱项。当前方法的优势主要体现在静态物体、缓慢变化和长期出现/消失事件上。对于快速行人、多目标交互或频繁形变对象,仅靠低频语义更新与通用跟踪仍然不够。
第三,实验中的变化检测对象数量和场景规模有限。真实家庭、商场或仓库中的长期部署会面对光照变化、家具大范围重排、传感器漂移、重复结构以及跨天重定位,这些因素是否会让 ID 与场景图持续稳定,还需要更长周期验证。
第四,系统的召回率仍有明显提升空间。消融实验中完整系统的 Recall 为 0.4955,说明它为了控制错误实例而采取了较保守的地图更新策略。面向“必须找到所有目标”的任务时,后续仍需在精度与召回之间重新平衡。
最后,论文和项目页将其描述为开源框架,但截至 2026 年 7 月 31 日,公开 GitHub 仓库的 README 仍注明“完整代码将在 RSS 后发布”。目前项目页面、论文、演示和仓库入口已经开放,复现者应以仓库后续更新为准。
传统 SLAM 给机器人一个稳定的几何世界,开放词汇模型让机器人能够说出世界里有什么。SuperMap 所尝试补足的,是两者之间最难被看见的一层:世界会变化,而机器人必须知道哪些东西还是原来的东西,哪些已经离开,哪些刚刚出现,以及这些对象过去与现在分别在哪里。
它没有把所有问题都交给一个更大的模型,而是通过几何约束、实例关联、概率更新和场景图,把感知结果转化为可以积累、修正、查询和执行的空间记忆。
对于视觉语言导航,这张地图可以帮助机器人理解“冰箱旁边的画”“刚才植物旁边的椅子”;对于更广泛的具身智能,它也提供了一条值得关注的路线:大模型负责理解与决策,持续运行的世界模型负责记住现实。