跳至正文
RFL_GLOBAL
EN
  • 场景图 // 2025
  • 超越基线 22.5%
  • 零样本迁移

MIDAS

操控 — 基于场景图的零样本

通过智能操作图实现零样本机器人操控,将 VLM 规划与动态场景图相结合。将复杂任务分解为图结构计划,具备碰撞感知轨迹和运行时故障恢复能力。相比 VLA 和分层基线提升 22.5-25% — 无需特定任务训练。

模块状态: 开发中

超越 VLA 基线

ZERO

部门
ANIMA
波次
W5
领域
操控
第五波 // ANIMA 套件
场景图零样本操控
MIDAS // W5 // 045/079
01核心挑战

传统操控在新物体上失效

当前的操控方法需要大量的逐任务训练数据或脆弱的手工编码规划器。VLA 模型在训练中未见过的新物体上表现挣扎。分层规划器线性分解任务,但无法推理空间关系或从执行中的故障中恢复。

现实世界的操控需要对未见物体的零样本泛化、复杂场景的空间推理、碰撞感知的轨迹生成,以及出错时的优雅恢复。当环境不符合预期时,线性任务计划就会崩溃。

02解决方案

MIDAS 提供什么

MIDAS 将视觉语言模型规划与动态场景图相结合,创建智能操作图。它将操控任务分解为图结构计划,每个节点代表一个子动作,边编码依赖关系,图根据场景感知实时重构。

能力

  • VLM 驱动的任务分解为有向无环操作图
  • 从 RGB-D 输入动态构建场景图 — 实时物体跟踪和关系推断
  • 利用空间图约束的碰撞感知轨迹生成
  • 运行时故障检测和自动图重构恢复
  • 通过语义场景理解实现对新物体的零样本迁移
  • 集成 ANIMA 套件的 AZOTH + PROTEUS + ERGON + CHIRON 模块
03工程挑战

为什么这很难

从场景图构建零样本操控需要解决多个耦合问题:

  1. 01场景图构建:从原始传感器数据实时提取物体节点、空间关系和可操作性
  2. 02任务图规划:VLM 必须生成有效的有向无环图,节点排序尊重物理约束
  3. 03轨迹碰撞避免:路径必须使用图编码的空间关系在杂乱场景中规划
  4. 04故障检测:识别执行偏离计划需要持续的场景图比较
  5. 05图重构:执行中途重新规划而不从头开始 — 对操作图进行局部修改

MIDAS 通过将操控视为图优化而非顺序规划,实现了超越基线 22.5-25% 的提升 — 支持并行子任务执行、约束传播和局部故障恢复。

04性能基准

用数据说话

与 VLA 和分层基线的对比测试:

用数据说话
指标数值
超越 VLA 基线22.5%
超越分层方法25%
训练需求零样本
移动平台迁移直接迁移
规划延迟实时
场景图更新率30 Hz
故障恢复自动
物体泛化新/未见物体
任务分解DAG 结构
碰撞避免图约束
ANIMA 集成AZOTH + PROTEUS + ERGON + CHIRON
轨迹规划碰撞感知
05构建状态

已构建的功能

已完成 3/6 个组件
已构建的功能
组件状态说明
场景图引擎已完成从 RGB-D 实时构建物体图 — 30 Hz 更新率
VLM 规划已完成将任务分解为有向无环操作图
轨迹生成进行中杂乱场景中的碰撞感知路径规划
故障恢复进行中运行时图重构和重新规划
核心模型已完成VLM + 场景图 + 轨迹模型已训练验证
API 层进行中公共 REST + gRPC API — 等待集成测试
06应用场景

MIDAS 部署场景

  • APP_01

    搜索与救援

    在灾难环境中操控废墟、开门和清除障碍物,无需对特定物体进行预先训练。

  • APP_02

    排爆 / 危险品

    通过场景图驱动的操控处理未知爆炸物和危险材料,无需物体专用模型。

  • APP_03

    非结构化环境

    在预编程操控序列失效的杂乱动态空间中运行 — 仓库、野外作业、灾区。

  • APP_04

    物流自动化

    在仓库环境中拾取和放置新物品,无需逐 SKU 训练或基于夹具的解决方案。

  • APP_05

    野外机器人

    在农业、建筑和采矿环境中进行自主操控,物体配置不可预测。

  • APP_06

    人机协作

    通过实时场景理解和碰撞感知轨迹适应实现与人类的安全协同操控。

07技术

底层技术

基础:智能操作图

  • VLM 驱动的任务分解为有向无环图(DAG)
  • 动态场景图构建 — 节点(物体)、边(空间关系)
  • 图约束轨迹优化与碰撞避免
  • 通过场景图状态比较的运行时故障检测

核心创新

将操控视为图优化而非顺序规划。操作图支持并行子任务执行、跨节点约束传播、以及用于故障恢复的局部精确修改 — 无需重新规划整个任务。

ANIMA 集成

  • AZOTH — 基础 VLM 推理用于任务图生成
  • PROTEUS — 自适应具身接口用于跨平台执行
  • ERGON — 动作原语库用于图节点执行
  • CHIRON — 运行时监控和故障检测

处理管线

感知
RGB-D → 30 Hz 场景图 — 物体检测、姿态估计、关系推断
规划
VLM 生成操作 DAG — 依据场景图约束验证
执行
图节点作为碰撞感知轨迹执行 — 依赖允许时并行执行
08论文

研究论文

  1. [01]Scene Graphs for Robot Manipulation — Johnson 等
  2. [02]Vision-Language Models for Robotic Planning — Driess 等
  3. [03]有向无环图的智能任务分解