跳至正文
RFL_GLOBAL
EN
  • CVPR 2025 亮点 // LLMDET
  • 零重训练
  • 生产 MVP

AZOTH

万能之眼

当今的视觉系统是脆弱的 — 每个新物体都需要重新训练。AZOTH 仅通过自然语言描述即可检测任何物体。"红色容器"、"损坏的轮子"、"已装配模块" — 无需训练、无词汇限制、无需重新编译。只需描述你想找的东西。

模块状态: 生产中

Apple Silicon MLX 直接

146ms

部门
ANIMA
波次
W2
领域
感知
第一波 // ANIMA 套件
开放词汇检测
AZOTH // W2 // 005/079
01核心挑战

固定词汇检测器在真实世界中失效

传统检测器在离开实验室的那一刻就锁定了固定词汇。工厂车间需要检测数百种 SKU。仓库不能每天重新编译模型。机器人进入新环境就会"失明"。每个新物体都意味着重新训练、重新标注、重新部署。

竞争者依赖 CLIP 嵌入或不理解空间关系的暴力检测器。VLM 对机器人来说太慢 — 每帧数秒。YOLO 变体需要将词汇限制固化在模型中。机器人需要的是理解语言的感知系统,而不仅仅是标签。

02解决方案

AZOTH 提供什么

AZOTH 是 Robot Flow Labs 的产品化感知端点。它将图像和自然语言查询转换为精确的边界框 — 旨在为抓取、导航和人机协作工作流提供数据。

能力

  • 开放词汇检测:通过文本提示实时检测任意物体类别
  • 论文对齐推理:检测、短语定位和指代表达 — 同一运行时
  • 容器优先部署:单一服务用于本地开发和生产部署
  • REST + gRPC 双接口:FastAPI 用于 Web,protobuf 用于系统
  • 有界并发:可预测的过载行为(饱和时返回 429/RESOURCE_EXHAUSTED)
  • Apple Silicon MLX 后端:M 系列平均 146ms 检测(比 CPU 快 25 倍)
03工程挑战

为什么这很难

开放词汇检测不仅仅是"CLIP + 边界框"。它需要理解语言如何映射到像素坐标:

  1. 01语言到像素的定位:模型必须学习空间关系,而不仅仅是类别相似度
  2. 02实时吞吐量:VLM 每帧需要数秒 — 机器人需要边缘硬件上 200ms 以内
  3. 03准入控制:有界并发防止生产负载下的内存溢出
  4. 04多后端一致性:论文忠实的 LLMDet vs. 实验性 MLX — 不同的速度/保真度权衡
  5. 05可复现性:带清单完整性检查的固定模型版本,确保生产安全

AZOTH 使用 LLMDet(CVPR 2025 亮点),它从定位和描述的监督中学习。它不记忆类别 — 它理解语言如何映射到像素。

04性能基准

实测数据 — 2026 年 3 月

使用固定 llmdet_tiny 版本在标准 COCO 测试图像上测试:

实测数据 — 2026 年 3 月
指标结果说明
Apple Silicon MLX 直接平均 146ms最小 59ms,最大 232ms
MLX 前向传播51.6ms图像加载 4.4ms,提示 1.9ms
直接推理(x86)平均 2.5sCPU 基线
HTTP/ASGI 传输(x86)平均 1.8sREST 端点
gRPC 回环(x86)平均 2.0sProtobuf 传输
容器检测(REST)5.3s推理:4.2s
容器检测(gRPC)4.8s推理:3.8s
容器预热159.7s包含首次模型下载
Apple M5 预估约 80ms 平均4 倍 M1 性能扩展
05构建状态

已构建的功能

已完成 9/10 个组件
已构建的功能
组件状态说明
核心模型已完成LLMDet 权重已训练验证 — 生产就绪
FastAPI REST 服务生产中完整检测、定位、指代表达
gRPC 传输生产中Protobuf 合约,有界并发
Docker CPU 运行时生产中Kubernetes 就绪配置
Docker GPU 运行时已完成已测试和验证
模型缓存生产中带清单完整性的快照
健康/指标生产中Prometheus 端点
基准测试套件生产中可复现的延迟测试
Apple Silicon MLX实验性25 倍加速,保真度差距已标注
API 层进行中公共 REST + gRPC API — 等待数据集基础设施
06应用场景

AZOTH 部署场景

  • APP_01

    制造质检

    通过自然语言描述检测质量缺陷、损坏零件和装配步骤 — 无需 SKU 数据库。

  • APP_02

    仓储运营

    通过描述查找托盘、箱子和产品,无需维护固定的物体词汇表。

  • APP_03

    检查与维修

    无需重新训练即可识别设备的故障和磨损模式 — 只需描述缺陷。

  • APP_04

    农业

    通过描述检测作物类型、病害和成熟度,适应不断变化的季节条件。

  • APP_05

    机器人机队

    无需重新编译或现场重训练即可赋予机器人新的感知能力 — 通过文本提示更新。

  • APP_06

    人机协作

    弥合人类指令与像素级动作之间的鸿沟,用于协作机器人。

07技术

底层技术

基础:LLMDET(CVPR 2025 亮点)

  • 从定位和描述的监督中学习 — 非类别记忆
  • 真正的开放词汇,非零样本近似
  • 检测、短语定位和指代表达统一架构
  • Apache-2.0 许可 — 可安全用于商业机器人

核心创新

语言到像素的定位:LLMDet 理解自然语言如何映射到图像中的空间坐标,实现对任何用文字描述的物体的检测 — 无需重新训练,无词汇限制。

部署架构

  • Python 3.12,UV 包管理器
  • FastAPI + gRPC(protobuf)双模式服务
  • 固定 HuggingFace 模型版本确保可复现性
  • 带清单完整性检查的模型缓存
  • Kubernetes 就绪的 Docker 配置(CPU + GPU)

推理后端

LLMDet(主要)
论文忠实的 CVPR 2025 实现 — 最高保真度
AIMv2 MLX
Apple Silicon(M1–M5)— 25 倍加速,M5 约 80ms(4 倍 M1)
CPU 回退
x86 基线 — 平均 2.5s,用于验证和开发
08论文

研究论文

  1. [01]LLMDet:在大语言模型监督下学习强大的开放词汇目标检测器 — CVPR 2025 亮点