- SLAM-GS3LAM // W7
- Python 实现
- ANIMA
SLAM-GS3LAM
以 3D 看世界,并认出每一样东西
在复杂环境中导航的机器人平台——工厂车间、前沿作战基地、城市地形——不仅要知道墙在哪里,还要知道墙由什么构成、哪是门哪是障碍、哪是设备哪是人。纯几何 SLAM 只有结构没有理解;纯语义模型又需要结构才能推理。在移动平台上实时兼顾二者,一直是瓶颈。
模块状态: 生产就绪任务融合
3
- 部门
- 通用
- 波次
- W7
- 领域
- 通用
- 第7波 // ANIMA 套件
- 基础层 — SLAM-GS3LAM
我们解决的问题
在复杂环境中导航的机器人平台——工厂车间、前沿作战基地、城市地形——不仅要知道墙在哪里,还要知道墙由什么构成、哪是门哪是障碍、哪是设备哪是人。纯几何 SLAM 只有结构没有理解;纯语义模型又需要结构才能推理。在移动平台上实时兼顾二者,一直是瓶颈。
自主车辆与机器人平台由此获得支撑任务级推理的空间理解:“导航到标有入口的门”“避开被判定为不稳定地形的区域”“标记 10m 内所有人类类别检测”——全部来自一张实时构建的地图。
SLAM-GS3LAM 提供什么
SLAM-GS3LAM(代号:Tsukuyomi)实现 GS3LAM(ACM MM 2024),在单一融合管线中联合优化相机位姿估计、照片级 3D 高斯重建与语义分割。RGB、深度、语义标签与相机内参张量输入统一的优化循环,输出相机位姿和增量更新的语义 3DGS 地图。
能力
- SLAM-GS3LAM(代号:Tsukuyomi)实现 GS3LAM(ACM MM 2024),在单一融合管线中联合优化相机位姿估计、照片级 3D 高斯重建与语义分割
- RGB、深度、语义标签与相机内参张量输入统一优化循环,输出相机位姿和增量更新的语义 3DGS 地图
- 场景中每个高斯都带有类别标签——可查询、可筛选、可导出。
为什么这很难
构建 SLAM-GS3LAM 需要解决多个耦合问题:
- 01在复杂环境中导航的机器人平台——工厂车间、前沿作战基地、城市地形——不仅要知道墙在哪里,还要知道墙由什么构成、哪是门哪是障碍、哪是设备哪是人
- 02纯几何 SLAM 只有结构没有理解;纯语义模型又需要结构才能推理
- 03SLAM-GS3LAM(代号:Tsukuyomi)实现 GS3LAM(ACM MM 2024),在单一融合管线中联合优化相机位姿估计、照片级 3D 高斯重建与语义分割
- 04RGB、深度、语义标签与相机内参张量输入统一优化循环,输出相机位姿和增量更新的语义 3DGS 地图
SLAM-GS3LAM 通过精心的架构设计和严格的验证来解决这些问题。
用数据说话
关键性能指标:
| 指标 | 数值 |
|---|---|
| 任务融合 | 位姿估计 + 3D 重建 + 语义建图同步完成——一条管线,无需串联 |
| 输入组合 | RGB + 深度 + 语义 + 内参——适配任意 RGB-D + 分割传感器组合 |
| 输出 | 逐高斯语义标签——从实时 SLAM 生成可查询的场景图 |
| 防务价值 | 为 UGV、巡检机器人和建筑清搜系统提供具备语义场景理解的自主导航 |
已构建的功能
| 组件 | 状态 | 说明 |
|---|---|---|
| 任务融合 | 已完成 | 位姿估计 + 3D 重建 + 语义建图同步完成——单一管线,无需串联 |
| 输入组合 | 已完成 | RGB + 深度 + 语义 + 内参——适配任意 RGB-D + 分割传感器组合 |
| 输出 | 进行中 | 逐高斯语义标签——从实时 SLAM 生成可查询的场景图 |
| 防务价值 | 进行中 | 为 UGV、巡检机器人与建筑清搜系统提供具备语义场景理解的自主导航 |
SLAM-GS3LAM 部署场景
- APP_01
自主系统
自主车辆与机器人平台由此获得支撑任务级推理的空间理解:“导航到标有入口的门”“避开被判定为不稳定地形的区域”“标记 10m 内所有人类类别检测”——全部基于一张实时构建的地图。
- APP_02
研究实验室
SLAM-GS3LAM(代号:Tsukuyomi)实现 GS3LAM(ACM MM 2024),在单一融合管线中联合优化相机位姿估计、照片级 3D 高斯重建与语义分割。
- APP_03
边缘计算
语义高斯泼溅 SLAM——实时构建照片级地图,同时为每个表面标注物体类别。