- RA-L 2025 // VLM-GIST
- 自然语言
- 开放词汇跟踪
LOGOS
言之即成
"找到红色圆柱形瓶子。""跟踪损坏的轮子。"机器人应该理解自然语言,而非刚性检测类别。LOGOS 将语言描述转换为有依据的检测和持久跟踪 — 属性感知、提供者灵活、生产就绪。
模块状态: 生产 MVP模块状态
OPEN
- 部门
- ANIMA
- 波次
- W4
- 领域
- 理解
- 第一波 // ANIMA 套件
- 语言驱动跟踪
LOGOS // W4 // 042/079
01核心挑战
语言与像素之间的鸿沟
自然语言是人类思考任务的方式。"找到红色圆柱形瓶子。""跟踪损坏的轮子。"但大多数机器人系统强制你使用刚性检测类别或手写属性规则。
VLM 驱动的感知存在,但要么太慢(每帧 5-10 秒)要么没有定位(给描述,不给像素位置)。检测器不理解属性。跟踪器不使用语言。自然语言意图与像素级动作之间的鸿沟巨大。
02解决方案
LOGOS 提供什么
LOGOS 将自然语言任务描述转换为有依据的物体理解和持久跟踪。
能力
- 自然语言 → 实例:"找到红色圆柱形瓶子" → 检测 + 跟踪 ID
- 属性提取:颜色、形状、大小、材质、姿态、状态
- /describe 端点:带提供者抽象和缓存的 VLM 场景定位
- /detect 端点:带提示清理的开放词汇检测
- /track + /track/sequence:运动感知 ID、外观匹配分配
- 提供者灵活性:Anthropic、OpenAI、可选 MLX 或模拟 VLM
- 检测器抽象:Ultralytics YOLO-World 或模拟 — 自动选择
- Apple Silicon MLX:M5 上约 200ms 描述、约 80ms 检测(4 倍 M1)
03工程挑战
为什么这很难
在单个服务中组合 VLM、检测器和跟踪器需要仔细编排:
- 01构建引导 VLM 到正确物体的任务驱动提示
- 02运行带提示清理和回退的开放词汇检测
- 03根据 VLM 描述验证检测 — 并非所有 VLM 物体都可检测
- 04使用运动和外观特征在遮挡中维护稳定 ID
- 05检测器或 VLM 不可用时优雅回退 — 模拟提供者
LOGOS 通过提供者抽象实现所有这些 — 无需重写管线即可更换 VLM 和检测器。带归档跟踪重新识别的会话跟踪维护持久身份。
04构建状态
已构建的功能
已完成 11/12 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | VLM + YOLO-World 权重 — 生产就绪 |
| /describe(VLM 定位) | 已完成 | 已用 Anthropic + OpenAI 提供者测试 |
| /detect(开放词汇) | 已完成 | 检测器缺失时回退到模拟 |
| /track(单图像) | 已完成 | 运动感知稳定 ID |
| /track/sequence(多帧) | 已完成 | 每轨迹连续性分析 |
| 会话管理 | 已完成 | 基于归档的重新识别 |
| 分割 | 已完成 | 图像优化多边形,可选 SAM |
| VLM 抽象(4 提供者) | 已完成 | Anthropic、OpenAI、MLX、模拟 |
| 检测器抽象 | 已完成 | Ultralytics YOLO-World 或模拟 |
| Docker(CPU/GPU) | 已完成 | 生产部署 |
| 基准工具 | 已完成 | scripts/benchmark_perception.py |
| API 层 | 进行中 | 公共 API — 等待数据集基础设施 |
05应用场景
LOGOS 部署场景
- APP_01
机器人操控
自然语言任务描述转化为用于抓取的跟踪物体。
- APP_02
仓储自动化
通过描述查找和跟踪托盘 — 无需 RFID 或条形码。
- APP_03
检查与维修
描述异常并在多个视角中跟踪它们。
- APP_04
装配与分拣
"拿红色 5mm 螺栓" — 无需预定义 SKU 数据库。
- APP_05
人机协作
操作员描述他们想要的,机器人理解并执行。
- APP_06
研发
无需自定义管线即可测试 VLM 驱动感知假设。
06技术
底层技术
基础:VLM-GIST(RA-L 2025)
- 面向机器人的语言驱动结构化感知
- 属性感知开放词汇检测和跟踪
- 提供者抽象的 VLM + 检测器管线
- 基于会话的持久身份与重新识别
推理管线
- 自然语言任务 → 提示构建器(任务驱动 JSON)
- VLM 提供者(Anthropic/OpenAI/MLX/模拟)→ 结构化场景物体
- 开放词汇检测器(Ultralytics YOLO-World)→ 边界框 + 掩码
- 物体关联验证器 → 查询 + 属性过滤
- 会话跟踪器 → 运动感知稳定 ID + 外观匹配
提供者灵活性
- Anthropic Claude
- 主要 VLM — 最高精度场景定位
- OpenAI GPT
- 次要 VLM — 回退提供者
- MLX(Apple Silicon)
- M1–M5 本地推理,约 200ms 描述
- 模拟 VLM + 检测器
- 回退安全 — 始终可用于测试
07论文
研究论文
- [01]VLM-GIST — RA-L 2025