跳至正文
RFL_GLOBAL
EN
  • MetricAnything // 2601.22054
  • GPU-train, MLX inference
  • WAVE 6

ODIN

全视深度

ODIN通过在2000万异构3D数据源(LiDAR、立体、RGB-D和运动恢复结构)上预训练,从单张RGB图像获取绝对度量深度。与仅按距离排序像素的相对深度估计器不同,ODIN输出以米为单位的真实世界测量值,使机器人能够以厘米级精度判断距离,无需任何手动校准。该系统使用稀疏度量提示来适配各种传感器类型,使其成为整个ANIMA感知堆栈的基础深度骨干。从SLAM到操控规划的每个下游模块都依赖于ODIN精确的距离测量。

模块状态: 开发中

训练源

20M

部门
ANIMA
波次
W6
领域
深度系统
第6波 // ANIMA 套件
基础层 — 度量深度
ODIN // W6 // 056/079
01核心挑战

无真值深度

机器人需要精确的米级距离,而非相对排序。传统深度传感器昂贵且在许多条件下失效。

每个下游模块都依赖准确的距离测量。

02解决方案

ODIN 提供什么

ODIN通过在2000万异构3D数据源上预训练,从单张RGB图像获取绝对度量深度。

能力

  • 在2000万异构3D源上预训练
  • 输出米级绝对度量深度
  • 稀疏度量提示实现跨传感器适配
  • ANIMA感知堆栈基础骨干
03工程挑战

为什么这很难

构建 ODIN 需要解决多个耦合问题:

  1. 01统一不同尺度和噪声的异构深度源
  2. 02无逐场景校准学习绝对尺度
  3. 03跨环境保持精度
  4. 04机器人实时推理

ODIN 通过精心的架构设计和严格的验证来解决这些问题。

04性能基准

用数据说话

关键指标:

用数据说话
指标数值
训练源2000万+
输出度量(米)
校准无需
后端GPU + MLX
05构建状态

已构建的功能

已完成 3/6 个组件
已构建的功能
组件状态说明
预训练管线已完成2000万多模态预训练
多源融合已完成多传感器统一
度量提示进行中跨传感器适配
边缘推理进行中MLX优化
核心模型已完成基础深度已验证
API层进行中REST + 流式
06应用场景

ODIN 部署场景

  • APP_01

    自主导航

    无需LiDAR的度量深度避障。

  • APP_02

    SLAM骨干

    THOR/BALDUR/HEIMDALL的基础深度。

  • APP_03

    操作规划

    抓取规划的距离测量。

07技术

底层技术

基础:METRICANYTHING

  • 在2000万异构3D源上预训练
  • 输出米级绝对度量深度
  • 稀疏度量提示实现跨传感器适配

核心创新

ODIN通过在2000万异构3D数据源上预训练,从单张RGB图像获取绝对度量深度。

部署

  • REST API
  • Docker容器化
  • Prometheus指标
  • 可配置后端

计算

主要
GPU-train, MLX inference
边缘
优化推理
API
REST + 流式
08论文

论文

  1. [01]MetricAnything(2601.22054)