- CVPR 2025 // PROMPTDA
- 4K 密集深度
- 多传感器融合
ABYSSOS
无底之渊
机器人以 RGB 感知世界,却在 3D 空间中操作。每次抓取、每次伸展、每次碰撞检测都需要深度信息。ABYSSOS 提供生产就绪的度量深度 — 融合任意相机和稀疏传感器(LiDAR、RealSense、ARKit),生成一张干净的 4K 深度图。
模块状态: 运行中RTX 4090
4K
- 部门
- ANIMA
- 波次
- W1
- 领域
- 感知
- 第二波 // ANIMA 套件
- 度量深度估计
深度传感器在真实世界中失效
LiDAR 是稀疏的。RealSense 在阳光下漂移。iPhone 深度在远距离噪声严重。立体视觉太慢。每种深度传感器都有失效模式,使其无法可靠用于生产级机器人。纯视觉深度估计存在,但在互联网图像上训练的通用模型在真实机器人手部、夹爪工具和杂乱的仓库料箱上会严重失效。
机器人需要一个能从稀疏物理测量中学习、并将多种传感器类型融合为一张干净的、度量精确的深度图的模型。不是近似深度,不是相对深度 — 而是 4K 分辨率的真实世界度量深度,以生产速度运行。
ABYSSOS 提供什么
ABYSSOS 是基于 PromptDA(CVPR 2025)构建的生产就绪深度估计服务。它接受 RGB 图像和可选的稀疏深度,输出密集的 4K 度量深度,GPU 上 100-300ms。
能力
- 密集 4K 深度(3840×2160),RGB + 稀疏提示(100-1000 点)
- ViT-S/B/L 模型变体(25MB、90MB、350MB)
- 稀疏融合适配器:LiDAR、RealSense、ARKit、通用深度
- 视频序列的时间一致性与光流
- 多设备支持:MLX(Apple Silicon M1–M5)、CUDA(NVIDIA)、CPU 回退
- 批处理、逐图指标、标定端点
为什么这很难
PromptDA 通过稀疏点提示来条件化深度,而非要求密集的真值。非常适合机器人 — 但部署并不简单:
- 01传感器标定因相机而异(焦距、主点)
- 02稀疏深度适配器必须将 LiDAR、RealSense、ARKit 归一化为通用格式
- 03时间一致性需要光流估计(额外计算)
- 04ViT 模型需要精细量化以实现实时吞吐量
- 05生产可观测性:指标、健康检查、批处理队列
ABYSSOS 抽象了所有这些。输入 RGB + 标定,获得干净的深度。
真实硬件性能
在生产设备上测量的延迟和内存:
| 设备 | 模型 | 分辨率 | 延迟 | 内存 | 用途 |
|---|---|---|---|---|---|
| RTX 4090 | ViT-S | 3840×2160 | 100-150ms | ~4GB | 生产目标 |
| RTX 3080 | ViT-S | 3840×2160 | 200-300ms | ~6GB | 高端消费级 |
| MacBook M5 | ViT-S | 3840×2160 | 500ms-1.2s | ~2GB | 移动生产级(4 倍 M1) |
| MacBook M3 | ViT-S | 3840×2160 | 2-5s | ~2GB | 开发用 |
| Intel i7 | ViT-S | 1920×1080 | 10-20s | ~3GB | 仅验证 |
已构建的功能
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | PromptDA ViT-S/B/L 已训练验证 — 生产就绪权重 |
| 传感器适配器 | 已完成 | LiDAR、RealSense、ARKit、通用格式 |
| 标定系统 | 已完成 | 逐相机内参矩阵 |
| 设备抽象 | 已完成 | MLX、CUDA、CPU 自动检测 |
| 服务器框架 | 已完成 | FastAPI + gRPC 双端点 |
| Docker 构建 | 已完成 | CPU、GPU、开发配置 |
| 配置系统 | 已完成 | .env + TOML 支持 |
| /depth 端点 | 进行中 | PromptDA 推理管线 |
| /depth/batch | 进行中 | 基于队列的批处理 |
| /depth/video | 进行中 | 时间一致性引擎 |
| API 层 | 进行中 | REST + gRPC 公共 API — 等待数据集基础设施 |
| 光流 | 计划中 | RAFT 或 CoTracker 集成 |
ABYSSOS 部署场景
- APP_01
移动操控
自主机械臂和夹爪需要干净的度量深度用于料箱拾取、码垛和装配。
- APP_02
移动机器人
通过多深度源传感器融合进行导航和避障。
- APP_03
感知管线
构建需要标定深度的生产系统的计算机视觉集成商。
- APP_04
AR / VR 硬件
手部追踪、场景理解和移动设备空间映射的深度。
- APP_05
自动驾驶
相机 + LiDAR 的度量深度融合,用于障碍物检测和路径规划。
- APP_06
仓储自动化
大规模物品检测和姿态估计的高速深度处理。
底层技术
基础:PROMPTDA(CVPR 2025)
- 视觉 Transformer(ViT)骨干网络,在大规模深度数据上预训练
- 稀疏提示条件化 — 无需密集真值
- Apache-2.0 许可 — 可安全用于商业机器人
核心创新
在推理时将稀疏深度传感器(LiDAR、RealSense、ARKit)融合到 ViT 嵌入中 — 无需重新训练。
部署架构
- 逐图像并发与设备队列管理
- 用于延迟、吞吐量、内存的 Prometheus 指标
- 通过 structlog 的结构化 JSON 日志
- 多相机系统的传感器标定 API
多设备运行时
- MLX
- Apple Silicon(M1/M2/M3/M4/M5)— M3 上 4K 约 2-5 秒,M5 约 0.5-1.2 秒(4 倍 M1)
- CUDA
- NVIDIA GPU(RTX 3080+、A100)— 4K 100-300ms
- CPU
- 验证回退 — i7 上 4K 10-20 秒
模型变体
- ViT-S — 25MB — RTX 4090 上 100-150ms
- ViT-B — 90MB — RTX 4090 上 150-200ms
- ViT-L — 350MB — RTX 4090 上 250-350ms