- ICLR 2025 // TRACEVLA
- 画路径 → 机器人跟随
- OPENVLA-7B
DAEMON
引导之灵
训练操控策略需要数千条轨迹。DAEMON 绕过了这一点 — 在观测帧上叠加视觉轨迹提示,机器人从提示中学习。画出路径,机器人跟随。本体感知轨迹即时、标定完美且商业许可。
模块状态: 运行中RTX 4090
100/s
- 部门
- ANIMA
- 波次
- W1
- 领域
- 行动
- 第二波 // ANIMA 套件
- 视觉轨迹提示
DAEMON // W1 // 016/079
01核心挑战
VLA 模型需要大规模动作引导
训练操控策略需要数千条机器人轨迹。当前的 VLA 模型随规模提升而改善,但在新任务上表现不佳。它们需要动作引导 — 一种在没有密集轨迹标签的情况下暗示解决方案的方法。无法大规模标注轨迹。
人类能立即解决这个问题:展示手臂该往哪里去。但如何将"轨迹"编码到基于图像的策略中?你需要视觉提示 — 在观测帧上画出夹爪应该移动的位置,策略从该提示中学习。在 TraceVLA 之前,没有人将其产品化。
02解决方案
DAEMON 提供什么
DAEMON 通过视觉轨迹提示增强视觉语言动作模型。它将机器人末端执行器轨迹作为绘制路径叠加到观测帧上,基于视觉引导调节策略推理。
能力
- 两种轨迹生成器:本体感知(商业安全,MIT)和 CoTracker(仅限研究,CC-BY-NC)
- 本体感知路径:正向运动学 → 2D 投影 → 在帧上绘制(零延迟)
- OpenVLA-7B 策略推理,支持自定义数据集微调
- 多设备:MLX(Apple M1–M5)、CUDA(RTX 4090、A100)、CPU 回退
- 实时策略预测:GPU 上 20-100 推理/秒,M5 上约 30+
- LiDAR 仿真器(Gazebo Harmonic)+ SimplerEnv 基准集成
03工程挑战
为什么这很难
视觉轨迹提示是一种新范式。它需要解决:
- 01轨迹生成:实时本体感知正向运动学(标定关键)或光流追踪
- 02策略运行时:多设备上的 OpenVLA 推理 — MLX 引导、CUDA Torch、CPU 回退
- 03微调:数据集预处理、1-8 GPU 分布式训练、每个领域的自定义归一化
- 04许可纪律:CoTracker 是 CC-BY-NC(仅限研究);商业产品必须使用本体感知
- 05评估:SimplerEnv 基准需要 Gazebo 仿真和复杂的任务定义
DAEMON 处理所有这些。本体感知轨迹即时、可证明正确且 MIT 许可。CoTracker 可用于研究但在生产中禁用。
04性能基准
真实硬件性能
使用 OpenVLA-7B + 本体感知轨迹测量:
| 设备 | 策略 | 轨迹 | 延迟 | 吞吐量 | 内存 |
|---|---|---|---|---|---|
| RTX 4090 | OpenVLA-7B | 本体感知 | 40-50ms | 100 推理/s | 14GB |
| RTX 4080 | OpenVLA-7B | 本体感知 | 60-80ms | 50 推理/s | 12GB |
| A100 | OpenVLA-7B | 本体感知 | 30-40ms | 100+ 推理/s | 16GB |
| Apple M5 (MLX) | 引导 | 本体感知 | ~50ms | ~30 推理/s | ~6GB |
| Apple M3 (MLX) | 引导 | 本体感知 | 85ms | 20 推理/s | 6GB |
05构建状态
已构建的功能
已完成 10/15 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | OpenVLA-7B 权重 + 轨迹条件化 — 生产就绪 |
| 本体感知轨迹生成 | 已完成 | 正向运动学 + 2D 绘制,MIT 许可 |
| 设备检测 | 已完成 | MLX、CUDA、CPU 自动检测 |
| 配置系统 | 已完成 | .env + TOML,设备选择 |
| 数据集预处理 | 已完成 | Bridge V2、Open-X-Embodiment 规范化 |
| 模型缓存 | 已完成 | HuggingFace 快照验证 |
| 服务器框架 | 已完成 | FastAPI + gRPC 脚手架 |
| LiDAR 仿真器 | 已完成 | Gazebo Harmonic Docker 管理器 |
| Docker 构建 | 已完成 | CPU、GPU、开发配置 |
| /trace/from_proprioception | 已完成 | API 就绪 |
| /policy/predict | 进行中 | OpenVLA 推理管线 |
| 微调管线 | 进行中 | 分布式训练 + 验证 |
| API 层 | 进行中 | 公共 REST + gRPC API — 等待数据集基础设施 |
| SimplerEnv 集成 | 进行中 | 任务基准套件 |
| CoTracker 研究路径 | 计划中 | 光流 + 密集追踪(第三阶段) |
06应用场景
DAEMON 部署场景
- APP_01
制造与装配
机器人通过少量视频演示学习自定义装配序列,使用轨迹引导策略。
- APP_02
仓储自动化
通过视觉轨迹微调将料箱拾取和码垛策略适应新物品类型。
- APP_03
移动操控
Fetch/Spot 类机器人从人类提供的轨迹中学习导航 + 操控。
- APP_04
食品与饮料
视觉轨迹引导新产品处理的分拣、包装和质量控制。
- APP_05
电子装配
通过轨迹引导策略学习精细操控(焊接、元件放置)。
- APP_06
研究与教育
TraceVLA 基线用于基准测试操控任务中的视觉提示方法。
07技术
底层技术
基础:TRACEVLA(ICLR 2025)
- 视觉语言动作(VLA)模型:OpenVLA-7B 基础模型(Apache-2.0)
- 视觉轨迹提示:在观测上叠加机器人轨迹提示
- 关键洞察:轨迹在无需密集标签的情况下显著提升策略性能
- 在 Google Open X-Embodiment、Bridge V2、LIBERO 数据集上预训练
核心创新
画出路径,机器人跟随。DAEMON 将轨迹提示编码为观测帧上的视觉叠加 — 正向运动学的本体感知轨迹即时、标定完美且商业许可(MIT)。无需密集轨迹标注。
两条轨迹路径
- 本体感知(商业)
- 正向运动学 → 2D 投影 → 在帧上绘制。零延迟,完美标定。MIT 许可。
- CoTracker(研究)
- 视频密集光流追踪。CC-BY-NC 许可 — 不可商业使用。第三阶段。
部署架构
- FastAPI + 异步策略推理与轨迹预计算
- 用于预测延迟、吞吐量、模型状态的 Prometheus 指标
- 带作业追踪的微调队列(1-8 GPU)
- Gazebo Harmonic LiDAR 仿真器用于仿真到真实验证
多设备运行时
- CUDA
- NVIDIA GPU(RTX 4090、A100)— 完整 OpenVLA Torch 推理,40-50ms
- MLX
- Apple Silicon(M1–M5)— 引导推理,M5 上约 50ms(4 倍 M1)
- CPU
- 引导回退 — 仅演示用
08论文
研究论文
- [01]TraceVLA:机器人操控策略的视觉轨迹提示 — Huang 等,ICLR 2025