- CVPR 2024 // 最佳论文
- 6DOF // 任意物体
- 零样本位姿
ERGON
完美抓取
抓取需要精确知道物体在3D空间中的位置。FoundationPose 解决了这个问题:从单张参考图像估计 6DoF 位姿,无需 CAD 模型。立即适用于新物体。无需重新训练。CVPR 2024 最佳论文,已部署于生产级机器人。
模块状态: 运行中推理速度(RTX 4090)
±2mm
- 部门
- ANIMA
- 波次
- W2
- 领域
- 理解
- 第四波 // ANIMA 套件
- 6DOF 位姿估计
ERGON // W2 // 019/079
01核心挑战
新物体击溃传统位姿估计
抓取需要精确知道物体在3D空间中的位置和方向。对于具有 CAD 模型的已知物体,位姿估计效果很好。但真实仓库中有大量新的、未标记的物品。大多数系统在从未见过的物体上失败。
你无法预先注册物流中心中的每个 SKU。你无法为每个新产品重新训练模型。你需要能够在任何物体上工作的位姿估计,仅从单张参考图像,实时运行。FoundationPose(CVPR 2024 最佳论文)是第一个实现这一点的系统。
02解决方案
ERGON 提供什么
ERGON 部署 FoundationPose — 用于任何物体的统一 6DoF 位姿估计和跟踪。三种输入模式,一种输出:带置信度的完整 SE(3) 位姿。
流程
- 01CAD 模型提供3D模型几何 → 通过渲染对比进行精确位姿优化
- 02参考图像单张物体图像 → 零样本位姿匹配,无需训练
- 03RGB-D 融合彩色+深度传感器 → 带几何特征的高精度度量位姿
能力
- 完整 6DoF 位姿输出:SE(3) 旋转 + 平移 + 置信度分数
- 新物体支持:从参考图像零样本推理,无需 CAD
- 实时:RTX 4090 上每帧 40-50ms,Apple M5 上约 100ms(MLX)
- 卡尔曼滤波跟踪,具备遮挡恢复和重新检测
- 最多 20 个同时跟踪物体,支持批处理
- 104 个测试,70% 覆盖率 — 生产级测试套件
03工程挑战
为什么这很难
6DoF 位姿估计需要同时解决三个耦合问题:
- 01特征提取:RGB 特征必须视角不变,同时足够精细以区分微妙的位姿差异
- 02位姿假设采样:高效生成候选 SO(3) 旋转,无需穷举搜索
- 03迭代优化:将渲染假设与观测比较(光度 + 几何损失)并优化
- 04新物体泛化:从单张参考图像将特征匹配到任意视角
- 05时序跟踪:通过卡尔曼滤波和遮挡处理保持跨帧位姿一致性
FoundationPose 通过 CNN 特征提取、基于深度的假设生成和可微渲染的 5 次迭代优化实现了这一点。对于新物体,参考图像匹配完全取代了 CAD 模型。
04性能基准
真实硬件性能
使用 FoundationPose 在真实传感器数据上测量:
| 指标 | 数值 |
|---|---|
| 推理速度(RTX 4090) | 每帧 40-50ms(RGB-D) |
| RGB 仅延迟 | 每帧 50-60ms |
| Apple M5(MLX) | 每帧约 100ms(4 倍 M1) |
| 平移精度(已知) | ±2-5mm |
| 平移精度(新物体) | ±10-20mm |
| 旋转精度 | ±2-5 度 |
| 内存使用 | 模型 2.5 GB,峰值 4-6 GB |
| 最大跟踪物体数 | 20(可配置) |
| 优化迭代次数 | 5(默认,最多 10) |
| 遮挡处理 | 卡尔曼滤波 + 自动重新检测 |
05构建状态
已构建的功能
已完成 10/13 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | FoundationPose 权重 — 生产就绪,CVPR 2024 最佳论文 |
| RGB-D 位姿估计 | 已完成 | 带渲染对比的迭代优化 |
| RGB 参考匹配 | 已完成 | 从参考图像零样本位姿 |
| CAD 模型注册 | 已完成 | OBJ/STL/PLY 模型加载和几何缓存 |
| 卡尔曼滤波跟踪 | 已完成 | 时序一致性与遮挡恢复 |
| 物体注册表 | 已完成 | 持久化 JSON 存储,启动时自动加载 |
| FastAPI REST API | 已完成 | /estimate、/track、/register_object、/objects |
| 设备支持 | 已完成 | 自动(MPS > CUDA > CPU),MLX 就绪 |
| Docker 部署 | 已完成 | 多容器,含 Prometheus/Grafana |
| 测试套件 | 已完成 | 104 个测试,70% 覆盖率,ruff 检查 |
| API 层 | 进行中 | 公共 REST + gRPC API — 等待数据集基础设施 |
| ROS2 集成 | 计划中 | 位姿主题发布(接口已定义) |
| ZED 2i 集成 | 计划中 | 等待硬件到货 |
06应用场景
ERGON 部署场景
- APP_01
仓储自动化
新物体位姿估计 — 无需 CAD 模型。实时处理未标记包裹。
- APP_02
取放机器人
传送线上快速 6DoF 抓取。40ms 延迟实现闭环控制。
- APP_03
视觉引导装配
装配任务中的精确物体定位。已知零件 ±2mm 精度。
- APP_04
物流与订单履行
通过零样本参考匹配处理任意 SKU。无需按产品重新训练。
- APP_05
制造业料箱拾取
立即处理新零件几何形状。卡尔曼滤波穿越遮挡跟踪。
- APP_06
研究与基准测试
FoundationPose 基线用于 BOP、YCB 和自定义数据集上的 6DoF 位姿估计。
07技术
底层技术
基础:FOUNDATIONPOSE(CVPR 2024)
- NVIDIA 研究院 — CVPR 2024 最佳论文奖
- ResNet-50 / EfficientNet 主干网络用于特征提取
- 深度编码几何特征用于位姿假设生成
- 可微渲染对比,5 次迭代优化
- 参考匹配:无需 CAD 的新物体特征相似度匹配
输入模态
- RGB-D(首选)
- 彩色+深度传感器融合 — 最精确,±2-5mm 平移精度
- 仅 RGB
- 参考图像匹配 — 相对尺度,零样本,无需训练
- 仅深度
- 几何重建 — 在低光照条件下工作
推理管线
- 特征提取 → 深度编码 → 位姿假设采样(SO(3))
- 渲染候选位姿 → 光度+几何损失 → 优化(5次迭代)
- 卡尔曼滤波用于时序跟踪和遮挡恢复
- 带持久化存储和自动加载的物体注册表
多设备运行时
- CUDA
- NVIDIA GPU(RTX 4090、A100)— 完整 FoundationPose Torch,40-50ms
- MLX
- Apple Silicon(M1–M5)— 引导推理,M5 上约 100ms(4 倍 M1)
- MPS
- Apple Metal Performance Shaders — GPU 加速回退
- CPU
- 回退 — 仅演示/开发
08论文
研究论文
- [01]FoundationPose:新物体的统一 6D 位姿估计与跟踪 — Wen 等,CVPR 2024(最佳论文)