跳至正文
RFL_GLOBAL
EN
  • CVPR 2025 // PROMPTDA
  • 4K 密集深度
  • 多传感器融合

ABYSSOS

无底之渊

机器人以 RGB 感知世界,却在 3D 空间中操作。每次抓取、每次伸展、每次碰撞检测都需要深度信息。ABYSSOS 提供生产就绪的度量深度 — 融合任意相机和稀疏传感器(LiDAR、RealSense、ARKit),生成一张干净的 4K 深度图。

模块状态: 运行中

RTX 4090

4K

部门
ANIMA
波次
W1
领域
感知
第二波 // ANIMA 套件
度量深度估计
ABYSSOS // W1 // 001/079
01核心挑战

深度传感器在真实世界中失效

LiDAR 是稀疏的。RealSense 在阳光下漂移。iPhone 深度在远距离噪声严重。立体视觉太慢。每种深度传感器都有失效模式,使其无法可靠用于生产级机器人。纯视觉深度估计存在,但在互联网图像上训练的通用模型在真实机器人手部、夹爪工具和杂乱的仓库料箱上会严重失效。

机器人需要一个能从稀疏物理测量中学习、并将多种传感器类型融合为一张干净的、度量精确的深度图的模型。不是近似深度,不是相对深度 — 而是 4K 分辨率的真实世界度量深度,以生产速度运行。

02解决方案

ABYSSOS 提供什么

ABYSSOS 是基于 PromptDA(CVPR 2025)构建的生产就绪深度估计服务。它接受 RGB 图像和可选的稀疏深度,输出密集的 4K 度量深度,GPU 上 100-300ms。

能力

  • 密集 4K 深度(3840×2160),RGB + 稀疏提示(100-1000 点)
  • ViT-S/B/L 模型变体(25MB、90MB、350MB)
  • 稀疏融合适配器:LiDAR、RealSense、ARKit、通用深度
  • 视频序列的时间一致性与光流
  • 多设备支持:MLX(Apple Silicon M1–M5)、CUDA(NVIDIA)、CPU 回退
  • 批处理、逐图指标、标定端点
03工程挑战

为什么这很难

PromptDA 通过稀疏点提示来条件化深度,而非要求密集的真值。非常适合机器人 — 但部署并不简单:

  1. 01传感器标定因相机而异(焦距、主点)
  2. 02稀疏深度适配器必须将 LiDAR、RealSense、ARKit 归一化为通用格式
  3. 03时间一致性需要光流估计(额外计算)
  4. 04ViT 模型需要精细量化以实现实时吞吐量
  5. 05生产可观测性:指标、健康检查、批处理队列

ABYSSOS 抽象了所有这些。输入 RGB + 标定,获得干净的深度。

04性能基准

真实硬件性能

在生产设备上测量的延迟和内存:

真实硬件性能
设备模型分辨率延迟内存用途
RTX 4090ViT-S3840×2160100-150ms~4GB生产目标
RTX 3080ViT-S3840×2160200-300ms~6GB高端消费级
MacBook M5ViT-S3840×2160500ms-1.2s~2GB移动生产级(4 倍 M1)
MacBook M3ViT-S3840×21602-5s~2GB开发用
Intel i7ViT-S1920×108010-20s~3GB仅验证
05构建状态

已构建的功能

已完成 7/12 个组件
已构建的功能
组件状态说明
核心模型已完成PromptDA ViT-S/B/L 已训练验证 — 生产就绪权重
传感器适配器已完成LiDAR、RealSense、ARKit、通用格式
标定系统已完成逐相机内参矩阵
设备抽象已完成MLX、CUDA、CPU 自动检测
服务器框架已完成FastAPI + gRPC 双端点
Docker 构建已完成CPU、GPU、开发配置
配置系统已完成.env + TOML 支持
/depth 端点进行中PromptDA 推理管线
/depth/batch进行中基于队列的批处理
/depth/video进行中时间一致性引擎
API 层进行中REST + gRPC 公共 API — 等待数据集基础设施
光流计划中RAFT 或 CoTracker 集成
06应用场景

ABYSSOS 部署场景

  • APP_01

    移动操控

    自主机械臂和夹爪需要干净的度量深度用于料箱拾取、码垛和装配。

  • APP_02

    移动机器人

    通过多深度源传感器融合进行导航和避障。

  • APP_03

    感知管线

    构建需要标定深度的生产系统的计算机视觉集成商。

  • APP_04

    AR / VR 硬件

    手部追踪、场景理解和移动设备空间映射的深度。

  • APP_05

    自动驾驶

    相机 + LiDAR 的度量深度融合,用于障碍物检测和路径规划。

  • APP_06

    仓储自动化

    大规模物品检测和姿态估计的高速深度处理。

07技术

底层技术

基础:PROMPTDA(CVPR 2025)

  • 视觉 Transformer(ViT)骨干网络,在大规模深度数据上预训练
  • 稀疏提示条件化 — 无需密集真值
  • Apache-2.0 许可 — 可安全用于商业机器人

核心创新

在推理时将稀疏深度传感器(LiDAR、RealSense、ARKit)融合到 ViT 嵌入中 — 无需重新训练。

部署架构

  • 逐图像并发与设备队列管理
  • 用于延迟、吞吐量、内存的 Prometheus 指标
  • 通过 structlog 的结构化 JSON 日志
  • 多相机系统的传感器标定 API

多设备运行时

MLX
Apple Silicon(M1/M2/M3/M4/M5)— M3 上 4K 约 2-5 秒,M5 约 0.5-1.2 秒(4 倍 M1)
CUDA
NVIDIA GPU(RTX 3080+、A100)— 4K 100-300ms
CPU
验证回退 — i7 上 4K 10-20 秒

模型变体

  • ViT-S — 25MB — RTX 4090 上 100-150ms
  • ViT-B — 90MB — RTX 4090 上 150-200ms
  • ViT-L — 350MB — RTX 4090 上 250-350ms
08论文

研究论文

  1. [01]PromptDA:提示驱动的 Depth Anything — Depth Anything 团队,CVPR 2025