跳至正文
RFL_GLOBAL
EN
  • RA-L 2025 // VLM-GIST
  • 自然语言
  • 开放词汇跟踪

LOGOS

言之即成

"找到红色圆柱形瓶子。""跟踪损坏的轮子。"机器人应该理解自然语言,而非刚性检测类别。LOGOS 将语言描述转换为有依据的检测和持久跟踪 — 属性感知、提供者灵活、生产就绪。

模块状态: 生产 MVP

模块状态

OPEN

部门
ANIMA
波次
W4
领域
理解
第一波 // ANIMA 套件
语言驱动跟踪
LOGOS // W4 // 042/079
01核心挑战

语言与像素之间的鸿沟

自然语言是人类思考任务的方式。"找到红色圆柱形瓶子。""跟踪损坏的轮子。"但大多数机器人系统强制你使用刚性检测类别或手写属性规则。

VLM 驱动的感知存在,但要么太慢(每帧 5-10 秒)要么没有定位(给描述,不给像素位置)。检测器不理解属性。跟踪器不使用语言。自然语言意图与像素级动作之间的鸿沟巨大。

02解决方案

LOGOS 提供什么

LOGOS 将自然语言任务描述转换为有依据的物体理解和持久跟踪。

能力

  • 自然语言 → 实例:"找到红色圆柱形瓶子" → 检测 + 跟踪 ID
  • 属性提取:颜色、形状、大小、材质、姿态、状态
  • /describe 端点:带提供者抽象和缓存的 VLM 场景定位
  • /detect 端点:带提示清理的开放词汇检测
  • /track + /track/sequence:运动感知 ID、外观匹配分配
  • 提供者灵活性:Anthropic、OpenAI、可选 MLX 或模拟 VLM
  • 检测器抽象:Ultralytics YOLO-World 或模拟 — 自动选择
  • Apple Silicon MLX:M5 上约 200ms 描述、约 80ms 检测(4 倍 M1)
03工程挑战

为什么这很难

在单个服务中组合 VLM、检测器和跟踪器需要仔细编排:

  1. 01构建引导 VLM 到正确物体的任务驱动提示
  2. 02运行带提示清理和回退的开放词汇检测
  3. 03根据 VLM 描述验证检测 — 并非所有 VLM 物体都可检测
  4. 04使用运动和外观特征在遮挡中维护稳定 ID
  5. 05检测器或 VLM 不可用时优雅回退 — 模拟提供者

LOGOS 通过提供者抽象实现所有这些 — 无需重写管线即可更换 VLM 和检测器。带归档跟踪重新识别的会话跟踪维护持久身份。

04构建状态

已构建的功能

已完成 11/12 个组件
已构建的功能
组件状态说明
核心模型已完成VLM + YOLO-World 权重 — 生产就绪
/describe(VLM 定位)已完成已用 Anthropic + OpenAI 提供者测试
/detect(开放词汇)已完成检测器缺失时回退到模拟
/track(单图像)已完成运动感知稳定 ID
/track/sequence(多帧)已完成每轨迹连续性分析
会话管理已完成基于归档的重新识别
分割已完成图像优化多边形,可选 SAM
VLM 抽象(4 提供者)已完成Anthropic、OpenAI、MLX、模拟
检测器抽象已完成Ultralytics YOLO-World 或模拟
Docker(CPU/GPU)已完成生产部署
基准工具已完成scripts/benchmark_perception.py
API 层进行中公共 API — 等待数据集基础设施
05应用场景

LOGOS 部署场景

  • APP_01

    机器人操控

    自然语言任务描述转化为用于抓取的跟踪物体。

  • APP_02

    仓储自动化

    通过描述查找和跟踪托盘 — 无需 RFID 或条形码。

  • APP_03

    检查与维修

    描述异常并在多个视角中跟踪它们。

  • APP_04

    装配与分拣

    "拿红色 5mm 螺栓" — 无需预定义 SKU 数据库。

  • APP_05

    人机协作

    操作员描述他们想要的,机器人理解并执行。

  • APP_06

    研发

    无需自定义管线即可测试 VLM 驱动感知假设。

06技术

底层技术

基础:VLM-GIST(RA-L 2025)

  • 面向机器人的语言驱动结构化感知
  • 属性感知开放词汇检测和跟踪
  • 提供者抽象的 VLM + 检测器管线
  • 基于会话的持久身份与重新识别

推理管线

  • 自然语言任务 → 提示构建器(任务驱动 JSON)
  • VLM 提供者(Anthropic/OpenAI/MLX/模拟)→ 结构化场景物体
  • 开放词汇检测器(Ultralytics YOLO-World)→ 边界框 + 掩码
  • 物体关联验证器 → 查询 + 属性过滤
  • 会话跟踪器 → 运动感知稳定 ID + 外观匹配

提供者灵活性

Anthropic Claude
主要 VLM — 最高精度场景定位
OpenAI GPT
次要 VLM — 回退提供者
MLX(Apple Silicon)
M1–M5 本地推理,约 200ms 描述
模拟 VLM + 检测器
回退安全 — 始终可用于测试
07论文

研究论文

  1. [01]VLM-GIST — RA-L 2025