- SAM2 // META AI
- 可提示
- 30FPS 跟踪
PROTEUS
变形者
机器人需要看到单个物体。但标注掩码需要手动注释。PROTEUS 是生产就绪的 SAM 2 服务——指向任何物体,即时获得分割,在视频中跟踪。无需训练,无需标注。四种模型尺寸从 62MB 到 1.2GB。GPU 上实时 30fps 跟踪。
模块状态: 构建中Small (91MB) M5 MLX
SAM2
- 部门
- ANIMA
- 波次
- W2
- 领域
- 理解
- 第二波 // ANIMA 套件
- 可提示分割与跟踪
PROTEUS // W2 // 062/079
01核心挑战
机器人看不到物体边界
机器人需要看到单个物体。但标注物体掩码需要手动注释。现成的分割对新物体、工具手柄和夹持器手指都失败。你需要交互式分割,能够第一次就对任何物体起作用。
传统方法:在你的领域上训练,等待数月,收集 10,000 个标注。新方法:指向它一次,SAM2 分割它,在视频中跟踪它。无需训练。无需标注。明天就可以上线。PROTEUS 让这变得生产就绪。
02解决方案
PROTEUS 提供什么
PROTEUS 是基于 SAM 2(Meta AI)构建的生产就绪分割与跟踪服务。接受任何提示,返回掩码,在视频中跟踪。
流程
- 01提示图像分割:点、框、掩码、多提示输入
- 02自动分割:无需提示为所有物体生成掩码
- 03实时视频跟踪:GPU 上逐帧掩码传播 30fps
- 04基于会话的跟踪状态,保持时间连贯性
- 05四种模型尺寸:tiny (62MB)、small (91MB)、base+ (259MB)、large (1.2GB)
- 06MLX Apple Silicon(M1–M5,M5 上 small ~60ms,M1 的 4 倍)+ CUDA + CPU
- 07实时视频 WebSocket 流 + REST API + 会话管理
能力
- 提示分割点、框、掩码——任何提示即时获得掩码→ 无需训练,第一次就适用于任何物体
- 实时跟踪GPU 上逐帧掩码传播 30fps→ 基于会话的状态,跨帧时间连贯
- 多设备支持MLX(Apple Silicon)、CUDA(GPU)、CPU 回退→ 部署到任何硬件——从笔记本到数据中心
03工程挑战
为什么这很难
SAM2 很强大,但部署需要精细的工程:
- 01模型选型:四种变体有 10 倍内存范围——选错会破坏生产环境
- 02会话状态管理:跟踪会话必须维护帧历史和掩码传播状态
- 03提示解析:将用户输入(指向 x,y)转换为模型提示需要校准意识
- 04性能扩展:从批处理到流式推理完全改变延迟特征
- 05多目标跟踪:处理多个同时跟踪而不产生干扰或 ID 切换
PROTEUS 抽象了所有这些。每个视频初始化一次,无需重新计算即可获得逐帧掩码。生产就绪的会话管理和设备抽象。
04性能基准
真实硬件性能
跨设备和模型尺寸测量:
| 指标 | 数值 |
|---|---|
| Small (91MB) M5 MLX | ~60ms(M1 的 4 倍) |
| Small (91MB) RTX 4090 | 5ms |
| Small (91MB) CPU | 1.8s |
| Large (1.2GB) RTX 4090 | 30ms |
| Large (1.2GB) M5 MLX | ~150ms |
| 视频跟踪 | GPU 上 30fps 实时 |
| 模型尺寸 | tiny 62MB、small 91MB、base+ 259MB、large 1.2GB |
| 许可证 | Apache-2.0(商业安全) |
05构建状态
已构建的功能
已完成 6/12 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 进行中 | SAM2 模型集成进行中 |
| API 层 | 进行中 | 公共 API 开发中 |
| 设备检测 | 已完成 | MLX、CUDA、CPU 自动检测 |
| 配置系统 | 已完成 | TOML + .env,模型缓存 |
| 提示类型 | 已完成 | 点、框、掩码、文本就绪 |
| 服务器框架 | 已完成 | FastAPI + WebSocket 脚手架 |
| Docker 构建 | 已完成 | CPU、GPU、开发配置 |
| 模型下载器 | 已完成 | HuggingFace 集成 |
| /segment/image | 进行中 | 提示分割 |
| /segment/auto | 进行中 | 自动掩码生成 |
| /track/init | 进行中 | 初始化跟踪会话 |
| WebSocket 流 | 进行中 | 实时视频跟踪 |
06应用场景
PROTEUS 部署场景
- APP_01
机器人操作
无需预训练即可识别抓取物体部件。指向手柄,获得掩码,规划抓取。
- APP_02
拣箱操作
在杂乱箱中分割物品供机器人抓取。无需特定领域模型即可分离重叠物体。
- APP_03
视频分析
仓储和检测工作流中的实时跟踪。跨帧跟踪物体无需重新提示。
- APP_04
AR / VR
从视频中进行交互式 3D 物体理解。为混合现实叠加分割和跟踪物体。
- APP_05
自动驾驶
实时检测和跟踪障碍物。对新型危险物进行可提示分割。
- APP_06
医学影像
通过领域微调分割解剖结构和手术工具。为医学数据集进行交互式标注。
07技术
底层技术
基础:SAM 2(META AI 2024)
- Vision Transformer (ViT) 编码器用于特征提取
- 基于解码器的掩码生成,支持任何提示类型
- 基于会话的跟踪,解码器状态跨帧保持
- Apache-2.0 许可——商业机器人安全可用
PROTEUS 实现
- FastAPI + 异步推理与会话管理
- 每图像和每帧并发处理
- 会话存储(内存或 Redis 用于分布式)
- Prometheus 指标用于延迟 + 会话计数 + 推理时间
集成接口
- 向 MONAD 提供物体掩码(持久跟踪)
- 向操作规划模块提供分割结果
- 向下游标注(LOGOS)提供掩码边界
08论文
研究基础
- [01]SAM 2:在图像和视频中分割一切 — Meta AI 2024