- MetricAnything // 2601.22054
- GPU-train, MLX inference
- WAVE 6
ODIN
全视深度
ODIN通过在2000万异构3D数据源(LiDAR、立体、RGB-D和运动恢复结构)上预训练,从单张RGB图像获取绝对度量深度。与仅按距离排序像素的相对深度估计器不同,ODIN输出以米为单位的真实世界测量值,使机器人能够以厘米级精度判断距离,无需任何手动校准。该系统使用稀疏度量提示来适配各种传感器类型,使其成为整个ANIMA感知堆栈的基础深度骨干。从SLAM到操控规划的每个下游模块都依赖于ODIN精确的距离测量。
模块状态: 开发中训练源
20M
- 部门
- ANIMA
- 波次
- W6
- 领域
- 深度系统
- 第6波 // ANIMA 套件
- 基础层 — 度量深度
ODIN // W6 // 056/079
01核心挑战
无真值深度
机器人需要精确的米级距离,而非相对排序。传统深度传感器昂贵且在许多条件下失效。
每个下游模块都依赖准确的距离测量。
02解决方案
ODIN 提供什么
ODIN通过在2000万异构3D数据源上预训练,从单张RGB图像获取绝对度量深度。
能力
- 在2000万异构3D源上预训练
- 输出米级绝对度量深度
- 稀疏度量提示实现跨传感器适配
- ANIMA感知堆栈基础骨干
03工程挑战
为什么这很难
构建 ODIN 需要解决多个耦合问题:
- 01统一不同尺度和噪声的异构深度源
- 02无逐场景校准学习绝对尺度
- 03跨环境保持精度
- 04机器人实时推理
ODIN 通过精心的架构设计和严格的验证来解决这些问题。
04性能基准
用数据说话
关键指标:
| 指标 | 数值 |
|---|---|
| 训练源 | 2000万+ |
| 输出 | 度量(米) |
| 校准 | 无需 |
| 后端 | GPU + MLX |
05构建状态
已构建的功能
已完成 3/6 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 预训练管线 | 已完成 | 2000万多模态预训练 |
| 多源融合 | 已完成 | 多传感器统一 |
| 度量提示 | 进行中 | 跨传感器适配 |
| 边缘推理 | 进行中 | MLX优化 |
| 核心模型 | 已完成 | 基础深度已验证 |
| API层 | 进行中 | REST + 流式 |
06应用场景
ODIN 部署场景
- APP_01
自主导航
无需LiDAR的度量深度避障。
- APP_02
SLAM骨干
THOR/BALDUR/HEIMDALL的基础深度。
- APP_03
操作规划
抓取规划的距离测量。
07技术
底层技术
基础:METRICANYTHING
- 在2000万异构3D源上预训练
- 输出米级绝对度量深度
- 稀疏度量提示实现跨传感器适配
核心创新
ODIN通过在2000万异构3D数据源上预训练,从单张RGB图像获取绝对度量深度。
部署
- REST API
- Docker容器化
- Prometheus指标
- 可配置后端
计算
- 主要
- GPU-train, MLX inference
- 边缘
- 优化推理
- API
- REST + 流式
08论文
论文
- [01]MetricAnything(2601.22054)