跳至正文
RFL_GLOBAL
EN
  • CVPR 2024 // 最佳论文
  • 6DOF // 任意物体
  • 零样本位姿

ERGON

完美抓取

抓取需要精确知道物体在3D空间中的位置。FoundationPose 解决了这个问题:从单张参考图像估计 6DoF 位姿,无需 CAD 模型。立即适用于新物体。无需重新训练。CVPR 2024 最佳论文,已部署于生产级机器人。

模块状态: 运行中

推理速度(RTX 4090)

±2mm

部门
ANIMA
波次
W2
领域
理解
第四波 // ANIMA 套件
6DOF 位姿估计
ERGON // W2 // 019/079
01核心挑战

新物体击溃传统位姿估计

抓取需要精确知道物体在3D空间中的位置和方向。对于具有 CAD 模型的已知物体,位姿估计效果很好。但真实仓库中有大量新的、未标记的物品。大多数系统在从未见过的物体上失败。

你无法预先注册物流中心中的每个 SKU。你无法为每个新产品重新训练模型。你需要能够在任何物体上工作的位姿估计,仅从单张参考图像,实时运行。FoundationPose(CVPR 2024 最佳论文)是第一个实现这一点的系统。

02解决方案

ERGON 提供什么

ERGON 部署 FoundationPose — 用于任何物体的统一 6DoF 位姿估计和跟踪。三种输入模式,一种输出:带置信度的完整 SE(3) 位姿。

流程

  1. 01CAD 模型提供3D模型几何 → 通过渲染对比进行精确位姿优化
  2. 02参考图像单张物体图像 → 零样本位姿匹配,无需训练
  3. 03RGB-D 融合彩色+深度传感器 → 带几何特征的高精度度量位姿

能力

  • 完整 6DoF 位姿输出:SE(3) 旋转 + 平移 + 置信度分数
  • 新物体支持:从参考图像零样本推理,无需 CAD
  • 实时:RTX 4090 上每帧 40-50ms,Apple M5 上约 100ms(MLX)
  • 卡尔曼滤波跟踪,具备遮挡恢复和重新检测
  • 最多 20 个同时跟踪物体,支持批处理
  • 104 个测试,70% 覆盖率 — 生产级测试套件
03工程挑战

为什么这很难

6DoF 位姿估计需要同时解决三个耦合问题:

  1. 01特征提取:RGB 特征必须视角不变,同时足够精细以区分微妙的位姿差异
  2. 02位姿假设采样:高效生成候选 SO(3) 旋转,无需穷举搜索
  3. 03迭代优化:将渲染假设与观测比较(光度 + 几何损失)并优化
  4. 04新物体泛化:从单张参考图像将特征匹配到任意视角
  5. 05时序跟踪:通过卡尔曼滤波和遮挡处理保持跨帧位姿一致性

FoundationPose 通过 CNN 特征提取、基于深度的假设生成和可微渲染的 5 次迭代优化实现了这一点。对于新物体,参考图像匹配完全取代了 CAD 模型。

04性能基准

真实硬件性能

使用 FoundationPose 在真实传感器数据上测量:

真实硬件性能
指标数值
推理速度(RTX 4090)每帧 40-50ms(RGB-D)
RGB 仅延迟每帧 50-60ms
Apple M5(MLX)每帧约 100ms(4 倍 M1)
平移精度(已知)±2-5mm
平移精度(新物体)±10-20mm
旋转精度±2-5 度
内存使用模型 2.5 GB,峰值 4-6 GB
最大跟踪物体数20(可配置)
优化迭代次数5(默认,最多 10)
遮挡处理卡尔曼滤波 + 自动重新检测
05构建状态

已构建的功能

已完成 10/13 个组件
已构建的功能
组件状态说明
核心模型已完成FoundationPose 权重 — 生产就绪,CVPR 2024 最佳论文
RGB-D 位姿估计已完成带渲染对比的迭代优化
RGB 参考匹配已完成从参考图像零样本位姿
CAD 模型注册已完成OBJ/STL/PLY 模型加载和几何缓存
卡尔曼滤波跟踪已完成时序一致性与遮挡恢复
物体注册表已完成持久化 JSON 存储,启动时自动加载
FastAPI REST API已完成/estimate、/track、/register_object、/objects
设备支持已完成自动(MPS > CUDA > CPU),MLX 就绪
Docker 部署已完成多容器,含 Prometheus/Grafana
测试套件已完成104 个测试,70% 覆盖率,ruff 检查
API 层进行中公共 REST + gRPC API — 等待数据集基础设施
ROS2 集成计划中位姿主题发布(接口已定义)
ZED 2i 集成计划中等待硬件到货
06应用场景

ERGON 部署场景

  • APP_01

    仓储自动化

    新物体位姿估计 — 无需 CAD 模型。实时处理未标记包裹。

  • APP_02

    取放机器人

    传送线上快速 6DoF 抓取。40ms 延迟实现闭环控制。

  • APP_03

    视觉引导装配

    装配任务中的精确物体定位。已知零件 ±2mm 精度。

  • APP_04

    物流与订单履行

    通过零样本参考匹配处理任意 SKU。无需按产品重新训练。

  • APP_05

    制造业料箱拾取

    立即处理新零件几何形状。卡尔曼滤波穿越遮挡跟踪。

  • APP_06

    研究与基准测试

    FoundationPose 基线用于 BOP、YCB 和自定义数据集上的 6DoF 位姿估计。

07技术

底层技术

基础:FOUNDATIONPOSE(CVPR 2024)

  • NVIDIA 研究院 — CVPR 2024 最佳论文奖
  • ResNet-50 / EfficientNet 主干网络用于特征提取
  • 深度编码几何特征用于位姿假设生成
  • 可微渲染对比,5 次迭代优化
  • 参考匹配:无需 CAD 的新物体特征相似度匹配

输入模态

RGB-D(首选)
彩色+深度传感器融合 — 最精确,±2-5mm 平移精度
仅 RGB
参考图像匹配 — 相对尺度,零样本,无需训练
仅深度
几何重建 — 在低光照条件下工作

推理管线

  • 特征提取 → 深度编码 → 位姿假设采样(SO(3))
  • 渲染候选位姿 → 光度+几何损失 → 优化(5次迭代)
  • 卡尔曼滤波用于时序跟踪和遮挡恢复
  • 带持久化存储和自动加载的物体注册表

多设备运行时

CUDA
NVIDIA GPU(RTX 4090、A100)— 完整 FoundationPose Torch,40-50ms
MLX
Apple Silicon(M1–M5)— 引导推理,M5 上约 100ms(4 倍 M1)
MPS
Apple Metal Performance Shaders — GPU 加速回退
CPU
回退 — 仅演示/开发
08论文

研究论文

  1. [01]FoundationPose:新物体的统一 6D 位姿估计与跟踪 — Wen 等,CVPR 2024(最佳论文)