跳至正文
RFL_GLOBAL
EN
  • ICLR 2025 // TRACEVLA
  • 画路径 → 机器人跟随
  • OPENVLA-7B

DAEMON

引导之灵

训练操控策略需要数千条轨迹。DAEMON 绕过了这一点 — 在观测帧上叠加视觉轨迹提示,机器人从提示中学习。画出路径,机器人跟随。本体感知轨迹即时、标定完美且商业许可。

模块状态: 运行中

RTX 4090

100/s

部门
ANIMA
波次
W1
领域
行动
第二波 // ANIMA 套件
视觉轨迹提示
DAEMON // W1 // 016/079
01核心挑战

VLA 模型需要大规模动作引导

训练操控策略需要数千条机器人轨迹。当前的 VLA 模型随规模提升而改善,但在新任务上表现不佳。它们需要动作引导 — 一种在没有密集轨迹标签的情况下暗示解决方案的方法。无法大规模标注轨迹。

人类能立即解决这个问题:展示手臂该往哪里去。但如何将"轨迹"编码到基于图像的策略中?你需要视觉提示 — 在观测帧上画出夹爪应该移动的位置,策略从该提示中学习。在 TraceVLA 之前,没有人将其产品化。

02解决方案

DAEMON 提供什么

DAEMON 通过视觉轨迹提示增强视觉语言动作模型。它将机器人末端执行器轨迹作为绘制路径叠加到观测帧上,基于视觉引导调节策略推理。

能力

  • 两种轨迹生成器:本体感知(商业安全,MIT)和 CoTracker(仅限研究,CC-BY-NC)
  • 本体感知路径:正向运动学 → 2D 投影 → 在帧上绘制(零延迟)
  • OpenVLA-7B 策略推理,支持自定义数据集微调
  • 多设备:MLX(Apple M1–M5)、CUDA(RTX 4090、A100)、CPU 回退
  • 实时策略预测:GPU 上 20-100 推理/秒,M5 上约 30+
  • LiDAR 仿真器(Gazebo Harmonic)+ SimplerEnv 基准集成
03工程挑战

为什么这很难

视觉轨迹提示是一种新范式。它需要解决:

  1. 01轨迹生成:实时本体感知正向运动学(标定关键)或光流追踪
  2. 02策略运行时:多设备上的 OpenVLA 推理 — MLX 引导、CUDA Torch、CPU 回退
  3. 03微调:数据集预处理、1-8 GPU 分布式训练、每个领域的自定义归一化
  4. 04许可纪律:CoTracker 是 CC-BY-NC(仅限研究);商业产品必须使用本体感知
  5. 05评估:SimplerEnv 基准需要 Gazebo 仿真和复杂的任务定义

DAEMON 处理所有这些。本体感知轨迹即时、可证明正确且 MIT 许可。CoTracker 可用于研究但在生产中禁用。

04性能基准

真实硬件性能

使用 OpenVLA-7B + 本体感知轨迹测量:

真实硬件性能
设备策略轨迹延迟吞吐量内存
RTX 4090OpenVLA-7B本体感知40-50ms100 推理/s14GB
RTX 4080OpenVLA-7B本体感知60-80ms50 推理/s12GB
A100OpenVLA-7B本体感知30-40ms100+ 推理/s16GB
Apple M5 (MLX)引导本体感知~50ms~30 推理/s~6GB
Apple M3 (MLX)引导本体感知85ms20 推理/s6GB
05构建状态

已构建的功能

已完成 10/15 个组件
已构建的功能
组件状态说明
核心模型已完成OpenVLA-7B 权重 + 轨迹条件化 — 生产就绪
本体感知轨迹生成已完成正向运动学 + 2D 绘制,MIT 许可
设备检测已完成MLX、CUDA、CPU 自动检测
配置系统已完成.env + TOML,设备选择
数据集预处理已完成Bridge V2、Open-X-Embodiment 规范化
模型缓存已完成HuggingFace 快照验证
服务器框架已完成FastAPI + gRPC 脚手架
LiDAR 仿真器已完成Gazebo Harmonic Docker 管理器
Docker 构建已完成CPU、GPU、开发配置
/trace/from_proprioception已完成API 就绪
/policy/predict进行中OpenVLA 推理管线
微调管线进行中分布式训练 + 验证
API 层进行中公共 REST + gRPC API — 等待数据集基础设施
SimplerEnv 集成进行中任务基准套件
CoTracker 研究路径计划中光流 + 密集追踪(第三阶段)
06应用场景

DAEMON 部署场景

  • APP_01

    制造与装配

    机器人通过少量视频演示学习自定义装配序列,使用轨迹引导策略。

  • APP_02

    仓储自动化

    通过视觉轨迹微调将料箱拾取和码垛策略适应新物品类型。

  • APP_03

    移动操控

    Fetch/Spot 类机器人从人类提供的轨迹中学习导航 + 操控。

  • APP_04

    食品与饮料

    视觉轨迹引导新产品处理的分拣、包装和质量控制。

  • APP_05

    电子装配

    通过轨迹引导策略学习精细操控(焊接、元件放置)。

  • APP_06

    研究与教育

    TraceVLA 基线用于基准测试操控任务中的视觉提示方法。

07技术

底层技术

基础:TRACEVLA(ICLR 2025)

  • 视觉语言动作(VLA)模型:OpenVLA-7B 基础模型(Apache-2.0)
  • 视觉轨迹提示:在观测上叠加机器人轨迹提示
  • 关键洞察:轨迹在无需密集标签的情况下显著提升策略性能
  • 在 Google Open X-Embodiment、Bridge V2、LIBERO 数据集上预训练

核心创新

画出路径,机器人跟随。DAEMON 将轨迹提示编码为观测帧上的视觉叠加 — 正向运动学的本体感知轨迹即时、标定完美且商业许可(MIT)。无需密集轨迹标注。

两条轨迹路径

本体感知(商业)
正向运动学 → 2D 投影 → 在帧上绘制。零延迟,完美标定。MIT 许可。
CoTracker(研究)
视频密集光流追踪。CC-BY-NC 许可 — 不可商业使用。第三阶段。

部署架构

  • FastAPI + 异步策略推理与轨迹预计算
  • 用于预测延迟、吞吐量、模型状态的 Prometheus 指标
  • 带作业追踪的微调队列(1-8 GPU)
  • Gazebo Harmonic LiDAR 仿真器用于仿真到真实验证

多设备运行时

CUDA
NVIDIA GPU(RTX 4090、A100)— 完整 OpenVLA Torch 推理,40-50ms
MLX
Apple Silicon(M1–M5)— 引导推理,M5 上约 50ms(4 倍 M1)
CPU
引导回退 — 仅演示用
08论文

研究论文

  1. [01]TraceVLA:机器人操控策略的视觉轨迹提示 — Huang 等,ICLR 2025