- CVPR 2025 亮点 // LLMDET
- 零重训练
- 生产 MVP
AZOTH
万能之眼
当今的视觉系统是脆弱的 — 每个新物体都需要重新训练。AZOTH 仅通过自然语言描述即可检测任何物体。"红色容器"、"损坏的轮子"、"已装配模块" — 无需训练、无词汇限制、无需重新编译。只需描述你想找的东西。
模块状态: 生产中Apple Silicon MLX 直接
146ms
- 部门
- ANIMA
- 波次
- W2
- 领域
- 感知
- 第一波 // ANIMA 套件
- 开放词汇检测
固定词汇检测器在真实世界中失效
传统检测器在离开实验室的那一刻就锁定了固定词汇。工厂车间需要检测数百种 SKU。仓库不能每天重新编译模型。机器人进入新环境就会"失明"。每个新物体都意味着重新训练、重新标注、重新部署。
竞争者依赖 CLIP 嵌入或不理解空间关系的暴力检测器。VLM 对机器人来说太慢 — 每帧数秒。YOLO 变体需要将词汇限制固化在模型中。机器人需要的是理解语言的感知系统,而不仅仅是标签。
AZOTH 提供什么
AZOTH 是 Robot Flow Labs 的产品化感知端点。它将图像和自然语言查询转换为精确的边界框 — 旨在为抓取、导航和人机协作工作流提供数据。
能力
- 开放词汇检测:通过文本提示实时检测任意物体类别
- 论文对齐推理:检测、短语定位和指代表达 — 同一运行时
- 容器优先部署:单一服务用于本地开发和生产部署
- REST + gRPC 双接口:FastAPI 用于 Web,protobuf 用于系统
- 有界并发:可预测的过载行为(饱和时返回 429/RESOURCE_EXHAUSTED)
- Apple Silicon MLX 后端:M 系列平均 146ms 检测(比 CPU 快 25 倍)
为什么这很难
开放词汇检测不仅仅是"CLIP + 边界框"。它需要理解语言如何映射到像素坐标:
- 01语言到像素的定位:模型必须学习空间关系,而不仅仅是类别相似度
- 02实时吞吐量:VLM 每帧需要数秒 — 机器人需要边缘硬件上 200ms 以内
- 03准入控制:有界并发防止生产负载下的内存溢出
- 04多后端一致性:论文忠实的 LLMDet vs. 实验性 MLX — 不同的速度/保真度权衡
- 05可复现性:带清单完整性检查的固定模型版本,确保生产安全
AZOTH 使用 LLMDet(CVPR 2025 亮点),它从定位和描述的监督中学习。它不记忆类别 — 它理解语言如何映射到像素。
实测数据 — 2026 年 3 月
使用固定 llmdet_tiny 版本在标准 COCO 测试图像上测试:
| 指标 | 结果 | 说明 |
|---|---|---|
| Apple Silicon MLX 直接 | 平均 146ms | 最小 59ms,最大 232ms |
| MLX 前向传播 | 51.6ms | 图像加载 4.4ms,提示 1.9ms |
| 直接推理(x86) | 平均 2.5s | CPU 基线 |
| HTTP/ASGI 传输(x86) | 平均 1.8s | REST 端点 |
| gRPC 回环(x86) | 平均 2.0s | Protobuf 传输 |
| 容器检测(REST) | 5.3s | 推理:4.2s |
| 容器检测(gRPC) | 4.8s | 推理:3.8s |
| 容器预热 | 159.7s | 包含首次模型下载 |
| Apple M5 预估 | 约 80ms 平均 | 4 倍 M1 性能扩展 |
已构建的功能
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | LLMDet 权重已训练验证 — 生产就绪 |
| FastAPI REST 服务 | 生产中 | 完整检测、定位、指代表达 |
| gRPC 传输 | 生产中 | Protobuf 合约,有界并发 |
| Docker CPU 运行时 | 生产中 | Kubernetes 就绪配置 |
| Docker GPU 运行时 | 已完成 | 已测试和验证 |
| 模型缓存 | 生产中 | 带清单完整性的快照 |
| 健康/指标 | 生产中 | Prometheus 端点 |
| 基准测试套件 | 生产中 | 可复现的延迟测试 |
| Apple Silicon MLX | 实验性 | 25 倍加速,保真度差距已标注 |
| API 层 | 进行中 | 公共 REST + gRPC API — 等待数据集基础设施 |
AZOTH 部署场景
- APP_01
制造质检
通过自然语言描述检测质量缺陷、损坏零件和装配步骤 — 无需 SKU 数据库。
- APP_02
仓储运营
通过描述查找托盘、箱子和产品,无需维护固定的物体词汇表。
- APP_03
检查与维修
无需重新训练即可识别设备的故障和磨损模式 — 只需描述缺陷。
- APP_04
农业
通过描述检测作物类型、病害和成熟度,适应不断变化的季节条件。
- APP_05
机器人机队
无需重新编译或现场重训练即可赋予机器人新的感知能力 — 通过文本提示更新。
- APP_06
人机协作
弥合人类指令与像素级动作之间的鸿沟,用于协作机器人。
底层技术
基础:LLMDET(CVPR 2025 亮点)
- 从定位和描述的监督中学习 — 非类别记忆
- 真正的开放词汇,非零样本近似
- 检测、短语定位和指代表达统一架构
- Apache-2.0 许可 — 可安全用于商业机器人
核心创新
语言到像素的定位:LLMDet 理解自然语言如何映射到图像中的空间坐标,实现对任何用文字描述的物体的检测 — 无需重新训练,无词汇限制。
部署架构
- Python 3.12,UV 包管理器
- FastAPI + gRPC(protobuf)双模式服务
- 固定 HuggingFace 模型版本确保可复现性
- 带清单完整性检查的模型缓存
- Kubernetes 就绪的 Docker 配置(CPU + GPU)
推理后端
- LLMDet(主要)
- 论文忠实的 CVPR 2025 实现 — 最高保真度
- AIMv2 MLX
- Apple Silicon(M1–M5)— 25 倍加速,M5 约 80ms(4 倍 M1)
- CPU 回退
- x86 基线 — 平均 2.5s,用于验证和开发