- 场景图 // 2025
- 超越基线 22.5%
- 零样本迁移
MIDAS
操控 — 基于场景图的零样本
通过智能操作图实现零样本机器人操控,将 VLM 规划与动态场景图相结合。将复杂任务分解为图结构计划,具备碰撞感知轨迹和运行时故障恢复能力。相比 VLA 和分层基线提升 22.5-25% — 无需特定任务训练。
模块状态: 开发中超越 VLA 基线
ZERO
- 部门
- ANIMA
- 波次
- W5
- 领域
- 操控
- 第五波 // ANIMA 套件
- 场景图零样本操控
MIDAS // W5 // 045/079
01核心挑战
传统操控在新物体上失效
当前的操控方法需要大量的逐任务训练数据或脆弱的手工编码规划器。VLA 模型在训练中未见过的新物体上表现挣扎。分层规划器线性分解任务,但无法推理空间关系或从执行中的故障中恢复。
现实世界的操控需要对未见物体的零样本泛化、复杂场景的空间推理、碰撞感知的轨迹生成,以及出错时的优雅恢复。当环境不符合预期时,线性任务计划就会崩溃。
02解决方案
MIDAS 提供什么
MIDAS 将视觉语言模型规划与动态场景图相结合,创建智能操作图。它将操控任务分解为图结构计划,每个节点代表一个子动作,边编码依赖关系,图根据场景感知实时重构。
能力
- VLM 驱动的任务分解为有向无环操作图
- 从 RGB-D 输入动态构建场景图 — 实时物体跟踪和关系推断
- 利用空间图约束的碰撞感知轨迹生成
- 运行时故障检测和自动图重构恢复
- 通过语义场景理解实现对新物体的零样本迁移
- 集成 ANIMA 套件的 AZOTH + PROTEUS + ERGON + CHIRON 模块
03工程挑战
为什么这很难
从场景图构建零样本操控需要解决多个耦合问题:
- 01场景图构建:从原始传感器数据实时提取物体节点、空间关系和可操作性
- 02任务图规划:VLM 必须生成有效的有向无环图,节点排序尊重物理约束
- 03轨迹碰撞避免:路径必须使用图编码的空间关系在杂乱场景中规划
- 04故障检测:识别执行偏离计划需要持续的场景图比较
- 05图重构:执行中途重新规划而不从头开始 — 对操作图进行局部修改
MIDAS 通过将操控视为图优化而非顺序规划,实现了超越基线 22.5-25% 的提升 — 支持并行子任务执行、约束传播和局部故障恢复。
04性能基准
用数据说话
与 VLA 和分层基线的对比测试:
| 指标 | 数值 |
|---|---|
| 超越 VLA 基线 | 22.5% |
| 超越分层方法 | 25% |
| 训练需求 | 零样本 |
| 移动平台迁移 | 直接迁移 |
| 规划延迟 | 实时 |
| 场景图更新率 | 30 Hz |
| 故障恢复 | 自动 |
| 物体泛化 | 新/未见物体 |
| 任务分解 | DAG 结构 |
| 碰撞避免 | 图约束 |
| ANIMA 集成 | AZOTH + PROTEUS + ERGON + CHIRON |
| 轨迹规划 | 碰撞感知 |
05构建状态
已构建的功能
已完成 3/6 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 场景图引擎 | 已完成 | 从 RGB-D 实时构建物体图 — 30 Hz 更新率 |
| VLM 规划 | 已完成 | 将任务分解为有向无环操作图 |
| 轨迹生成 | 进行中 | 杂乱场景中的碰撞感知路径规划 |
| 故障恢复 | 进行中 | 运行时图重构和重新规划 |
| 核心模型 | 已完成 | VLM + 场景图 + 轨迹模型已训练验证 |
| API 层 | 进行中 | 公共 REST + gRPC API — 等待集成测试 |
06应用场景
MIDAS 部署场景
- APP_01
搜索与救援
在灾难环境中操控废墟、开门和清除障碍物,无需对特定物体进行预先训练。
- APP_02
排爆 / 危险品
通过场景图驱动的操控处理未知爆炸物和危险材料,无需物体专用模型。
- APP_03
非结构化环境
在预编程操控序列失效的杂乱动态空间中运行 — 仓库、野外作业、灾区。
- APP_04
物流自动化
在仓库环境中拾取和放置新物品,无需逐 SKU 训练或基于夹具的解决方案。
- APP_05
野外机器人
在农业、建筑和采矿环境中进行自主操控,物体配置不可预测。
- APP_06
人机协作
通过实时场景理解和碰撞感知轨迹适应实现与人类的安全协同操控。
07技术
底层技术
基础:智能操作图
- VLM 驱动的任务分解为有向无环图(DAG)
- 动态场景图构建 — 节点(物体)、边(空间关系)
- 图约束轨迹优化与碰撞避免
- 通过场景图状态比较的运行时故障检测
核心创新
将操控视为图优化而非顺序规划。操作图支持并行子任务执行、跨节点约束传播、以及用于故障恢复的局部精确修改 — 无需重新规划整个任务。
ANIMA 集成
- AZOTH — 基础 VLM 推理用于任务图生成
- PROTEUS — 自适应具身接口用于跨平台执行
- ERGON — 动作原语库用于图节点执行
- CHIRON — 运行时监控和故障检测
处理管线
- 感知
- RGB-D → 30 Hz 场景图 — 物体检测、姿态估计、关系推断
- 规划
- VLM 生成操作 DAG — 依据场景图约束验证
- 执行
- 图节点作为碰撞感知轨迹执行 — 依赖允许时并行执行
08论文
研究论文
- [01]Scene Graphs for Robot Manipulation — Johnson 等
- [02]Vision-Language Models for Robotic Planning — Driess 等
- [03]有向无环图的智能任务分解