- 任意相机深度 // CVPR 2025
- 相机无关
- 零样本
PANOPTES
全视之眼
深度估计模型被锁定在特定相机类型上。在透视相机上训练?鱼眼上不行。在智能手机上训练?360 全景上失败。PANOPTES 从任何相机模型预测度量深度 — 透视、鱼眼、等距矩形、全向 — 无需特定相机训练。一个模型,所有相机。
模块状态: 运行中深度精度 (AbsRel)
ANY
- 部门
- ANIMA
- 波次
- W4
- 领域
- 感知
- 第四波 // ANIMA 套件
- 通用深度估计
PANOPTES // W4 // 058/079
01核心挑战
一种相机,一个模型
深度估计模型被锁定在特定相机类型上。在透视相机上训练?鱼眼上不行。在智能手机上训练?360 全景上失败。每种新的相机几何都需要重新训练。
真实机器人使用异构传感器 — 运动相机、ZED 立体相机、手机相机、RealSense。没有一个深度模型可以在所有地方工作。PANOPTES 提供了缺失的通用层。
02解决方案
PANOPTES 提供什么
PANOPTES 是相机无关的深度估计系统。任何相机的任何 RGB 图像,自动适配,输出度量深度 + 不确定性。
流程
- 01任意相机零样本深度:透视、鱼眼、等距矩形、全向
- 02相机自适应嵌入,动态编码相机类型和视场角
- 03ViT 骨干 (DINOv2) → 相机自适应层 → DPT 解码器 → 度量深度
- 04度量深度范围:1mm 至 100m,带不确定性估计
能力
- 模型变体三种尺寸:SMALL (50M)、BASE (86M)、LARGE (170M 参数)→ 从边缘设备扩展到数据中心
- 设备支持MLX Apple Silicon (M1–M5, M5 约 45ms, 4 倍 M1) + CUDA + CPU→ 无需代码更改即可部署到任何地方
- REST API/depth、/depth/batch、/pointcloud、/cameras、/configure_camera→ 面向任何平台的生产就绪集成
03工程挑战
为什么这很难
每种相机都有不同的投影几何。PANOPTES 必须全部处理:
- 01透视:针孔模型。鱼眼:非线性径向畸变(等距、等面积、立体投影)
- 02等距矩形:360 相机的球面展开。全向:多个重叠透视
- 03相机自适应嵌入必须编码类型和视场角,然后动态调整特征提取
- 04对数压缩深度编码在多种传感器类型间保持 1mm 到 100m 的尺度
- 05推理必须在所有相机类型上保持快速,无需逐相机微调
PANOPTES 学习相机自适应嵌入,编码相机类型和视场角,在推理过程中动态调整特征提取。一个模型,任何相机。
04性能基准
真实硬件性能
使用 ViT+DPT 相机自适应管线测量:
| 指标 | 数值 |
|---|---|
| 深度精度 (AbsRel) | NYU 0.098 / KITTI 0.089 / ScanNet 0.108 |
| 推理速度 (A100) | 45–180ms (512×512 至 1024×1024) |
| Apple M5 (MLX) | 512×512 约 45ms (4 倍 M1) |
| 吞吐量 (BASE) | 5.5–22 fps (512×512) |
| 内存 | 200–700MB(模型),500–2000MB(运行时) |
| 深度范围 | 1mm 至 100m(度量尺度) |
| 模型变体 | SMALL (50M)、BASE (86M)、LARGE (170M) |
| 相机类型 | 透视、鱼眼、等距矩形、全向 |
05构建状态
已构建的功能
已完成 9/11 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | ViT+DPT 相机自适应管线,生产就绪权重 |
| API 层 | 进行中 | 公共 API,待数据集基础设施 |
| 相机自适应模块 | 已完成 | 类型嵌入、FOV 投影、特征融合 |
| ViT 骨干 | 已完成 | 基于 DINOv2 的视觉编码器 |
| DPT 解码器 | 已完成 | 粗到细深度细化 |
| REST API | 已完成 | /depth、/depth/batch、/pointcloud、/cameras |
| 点云生成 | 已完成 | 从深度 + 相机参数导出 3D |
| Docker 部署 | 已完成 | 完整堆栈含 Prometheus/Grafana |
| 设备支持 | 已完成 | 自动(MLX > MPS > CUDA > CPU) |
| Prometheus 指标 | 已完成 | 推理计数、延迟、错误追踪 |
| gRPC 接口 | 计划中 | 未实现;REST 已就绪 |
06应用场景
PANOPTES 部署场景
- APP_01
机器人感知
多相机机器人平台的单一模型。无需逐传感器重训。
- APP_02
移动机器人
在手机、运动相机、USB 摄像头上部署,无需重训。
- APP_03
监控
360 相机深度用于异常检测和空间感知。
- APP_04
AR/VR 平台
从异构手机/头显相机快速获取度量深度。
- APP_05
嵌入式机器人
小型模型变体在边缘设备上实现轻量级深度。
- APP_06
自动驾驶
实时深度用于障碍物检测和路径规划。
07技术
底层技术
基础:任意相机深度
- 相机无关深度估计(CVPR 2025,Guo 等)
- 视觉 Transformer (ViT) 骨干,DINOv2 预训练
- 相机自适应特征融合与学习类型嵌入
- 密集预测 Transformer (DPT) 实现粗到细深度
PANOPTES 实现
- FastAPI REST 服务器,多相机输入架构
- 三种模型尺寸:SMALL (50M) BASE (86M) LARGE (170M)
- 对数压缩深度编码 (1mm–100m)
- Prometheus 指标与 Docker 部署
集成点
- 向 ABYSSOS(单目深度基线)输出度量深度
- 向 PETRA(深度基础模型)提供相机无关特征
- 输出点云用于下游 3D 重建(PLEROMA)
08论文
研究基础
- [01]Depth Any Camera:零样本度量深度估计 — CVPR 2025