跳至正文
RFL_GLOBAL
EN
  • SAM2 // META AI
  • 可提示
  • 30FPS 跟踪

PROTEUS

变形者

机器人需要看到单个物体。但标注掩码需要手动注释。PROTEUS 是生产就绪的 SAM 2 服务——指向任何物体,即时获得分割,在视频中跟踪。无需训练,无需标注。四种模型尺寸从 62MB 到 1.2GB。GPU 上实时 30fps 跟踪。

模块状态: 构建中

Small (91MB) M5 MLX

SAM2

部门
ANIMA
波次
W2
领域
理解
第二波 // ANIMA 套件
可提示分割与跟踪
PROTEUS // W2 // 062/079
01核心挑战

机器人看不到物体边界

机器人需要看到单个物体。但标注物体掩码需要手动注释。现成的分割对新物体、工具手柄和夹持器手指都失败。你需要交互式分割,能够第一次就对任何物体起作用。

传统方法:在你的领域上训练,等待数月,收集 10,000 个标注。新方法:指向它一次,SAM2 分割它,在视频中跟踪它。无需训练。无需标注。明天就可以上线。PROTEUS 让这变得生产就绪。

02解决方案

PROTEUS 提供什么

PROTEUS 是基于 SAM 2(Meta AI)构建的生产就绪分割与跟踪服务。接受任何提示,返回掩码,在视频中跟踪。

流程

  1. 01提示图像分割:点、框、掩码、多提示输入
  2. 02自动分割:无需提示为所有物体生成掩码
  3. 03实时视频跟踪:GPU 上逐帧掩码传播 30fps
  4. 04基于会话的跟踪状态,保持时间连贯性
  5. 05四种模型尺寸:tiny (62MB)、small (91MB)、base+ (259MB)、large (1.2GB)
  6. 06MLX Apple Silicon(M1–M5,M5 上 small ~60ms,M1 的 4 倍)+ CUDA + CPU
  7. 07实时视频 WebSocket 流 + REST API + 会话管理

能力

  • 提示分割点、框、掩码——任何提示即时获得掩码→ 无需训练,第一次就适用于任何物体
  • 实时跟踪GPU 上逐帧掩码传播 30fps→ 基于会话的状态,跨帧时间连贯
  • 多设备支持MLX(Apple Silicon)、CUDA(GPU)、CPU 回退→ 部署到任何硬件——从笔记本到数据中心
03工程挑战

为什么这很难

SAM2 很强大,但部署需要精细的工程:

  1. 01模型选型:四种变体有 10 倍内存范围——选错会破坏生产环境
  2. 02会话状态管理:跟踪会话必须维护帧历史和掩码传播状态
  3. 03提示解析:将用户输入(指向 x,y)转换为模型提示需要校准意识
  4. 04性能扩展:从批处理到流式推理完全改变延迟特征
  5. 05多目标跟踪:处理多个同时跟踪而不产生干扰或 ID 切换

PROTEUS 抽象了所有这些。每个视频初始化一次,无需重新计算即可获得逐帧掩码。生产就绪的会话管理和设备抽象。

04性能基准

真实硬件性能

跨设备和模型尺寸测量:

真实硬件性能
指标数值
Small (91MB) M5 MLX~60ms(M1 的 4 倍)
Small (91MB) RTX 40905ms
Small (91MB) CPU1.8s
Large (1.2GB) RTX 409030ms
Large (1.2GB) M5 MLX~150ms
视频跟踪GPU 上 30fps 实时
模型尺寸tiny 62MB、small 91MB、base+ 259MB、large 1.2GB
许可证Apache-2.0(商业安全)
05构建状态

已构建的功能

已完成 6/12 个组件
已构建的功能
组件状态说明
核心模型进行中SAM2 模型集成进行中
API 层进行中公共 API 开发中
设备检测已完成MLX、CUDA、CPU 自动检测
配置系统已完成TOML + .env,模型缓存
提示类型已完成点、框、掩码、文本就绪
服务器框架已完成FastAPI + WebSocket 脚手架
Docker 构建已完成CPU、GPU、开发配置
模型下载器已完成HuggingFace 集成
/segment/image进行中提示分割
/segment/auto进行中自动掩码生成
/track/init进行中初始化跟踪会话
WebSocket 流进行中实时视频跟踪
06应用场景

PROTEUS 部署场景

  • APP_01

    机器人操作

    无需预训练即可识别抓取物体部件。指向手柄,获得掩码,规划抓取。

  • APP_02

    拣箱操作

    在杂乱箱中分割物品供机器人抓取。无需特定领域模型即可分离重叠物体。

  • APP_03

    视频分析

    仓储和检测工作流中的实时跟踪。跨帧跟踪物体无需重新提示。

  • APP_04

    AR / VR

    从视频中进行交互式 3D 物体理解。为混合现实叠加分割和跟踪物体。

  • APP_05

    自动驾驶

    实时检测和跟踪障碍物。对新型危险物进行可提示分割。

  • APP_06

    医学影像

    通过领域微调分割解剖结构和手术工具。为医学数据集进行交互式标注。

07技术

底层技术

基础:SAM 2(META AI 2024)

  • Vision Transformer (ViT) 编码器用于特征提取
  • 基于解码器的掩码生成,支持任何提示类型
  • 基于会话的跟踪,解码器状态跨帧保持
  • Apache-2.0 许可——商业机器人安全可用

PROTEUS 实现

  • FastAPI + 异步推理与会话管理
  • 每图像和每帧并发处理
  • 会话存储(内存或 Redis 用于分布式)
  • Prometheus 指标用于延迟 + 会话计数 + 推理时间

集成接口

  • 向 MONAD 提供物体掩码(持久跟踪)
  • 向操作规划模块提供分割结果
  • 向下游标注(LOGOS)提供掩码边界
08论文

研究基础

  1. [01]SAM 2:在图像和视频中分割一切 — Meta AI 2024