跳至正文
RFL_GLOBAL
EN
  • 任意相机深度 // CVPR 2025
  • 相机无关
  • 零样本

PANOPTES

全视之眼

深度估计模型被锁定在特定相机类型上。在透视相机上训练?鱼眼上不行。在智能手机上训练?360 全景上失败。PANOPTES 从任何相机模型预测度量深度 — 透视、鱼眼、等距矩形、全向 — 无需特定相机训练。一个模型,所有相机。

模块状态: 运行中

深度精度 (AbsRel)

ANY

部门
ANIMA
波次
W4
领域
感知
第四波 // ANIMA 套件
通用深度估计
PANOPTES // W4 // 058/079
01核心挑战

一种相机,一个模型

深度估计模型被锁定在特定相机类型上。在透视相机上训练?鱼眼上不行。在智能手机上训练?360 全景上失败。每种新的相机几何都需要重新训练。

真实机器人使用异构传感器 — 运动相机、ZED 立体相机、手机相机、RealSense。没有一个深度模型可以在所有地方工作。PANOPTES 提供了缺失的通用层。

02解决方案

PANOPTES 提供什么

PANOPTES 是相机无关的深度估计系统。任何相机的任何 RGB 图像,自动适配,输出度量深度 + 不确定性。

流程

  1. 01任意相机零样本深度:透视、鱼眼、等距矩形、全向
  2. 02相机自适应嵌入,动态编码相机类型和视场角
  3. 03ViT 骨干 (DINOv2) → 相机自适应层 → DPT 解码器 → 度量深度
  4. 04度量深度范围:1mm 至 100m,带不确定性估计

能力

  • 模型变体三种尺寸:SMALL (50M)、BASE (86M)、LARGE (170M 参数)→ 从边缘设备扩展到数据中心
  • 设备支持MLX Apple Silicon (M1–M5, M5 约 45ms, 4 倍 M1) + CUDA + CPU→ 无需代码更改即可部署到任何地方
  • REST API/depth、/depth/batch、/pointcloud、/cameras、/configure_camera→ 面向任何平台的生产就绪集成
03工程挑战

为什么这很难

每种相机都有不同的投影几何。PANOPTES 必须全部处理:

  1. 01透视:针孔模型。鱼眼:非线性径向畸变(等距、等面积、立体投影)
  2. 02等距矩形:360 相机的球面展开。全向:多个重叠透视
  3. 03相机自适应嵌入必须编码类型和视场角,然后动态调整特征提取
  4. 04对数压缩深度编码在多种传感器类型间保持 1mm 到 100m 的尺度
  5. 05推理必须在所有相机类型上保持快速,无需逐相机微调

PANOPTES 学习相机自适应嵌入,编码相机类型和视场角,在推理过程中动态调整特征提取。一个模型,任何相机。

04性能基准

真实硬件性能

使用 ViT+DPT 相机自适应管线测量:

真实硬件性能
指标数值
深度精度 (AbsRel)NYU 0.098 / KITTI 0.089 / ScanNet 0.108
推理速度 (A100)45–180ms (512×512 至 1024×1024)
Apple M5 (MLX)512×512 约 45ms (4 倍 M1)
吞吐量 (BASE)5.5–22 fps (512×512)
内存200–700MB(模型),500–2000MB(运行时)
深度范围1mm 至 100m(度量尺度)
模型变体SMALL (50M)、BASE (86M)、LARGE (170M)
相机类型透视、鱼眼、等距矩形、全向
05构建状态

已构建的功能

已完成 9/11 个组件
已构建的功能
组件状态说明
核心模型已完成ViT+DPT 相机自适应管线,生产就绪权重
API 层进行中公共 API,待数据集基础设施
相机自适应模块已完成类型嵌入、FOV 投影、特征融合
ViT 骨干已完成基于 DINOv2 的视觉编码器
DPT 解码器已完成粗到细深度细化
REST API已完成/depth、/depth/batch、/pointcloud、/cameras
点云生成已完成从深度 + 相机参数导出 3D
Docker 部署已完成完整堆栈含 Prometheus/Grafana
设备支持已完成自动(MLX > MPS > CUDA > CPU)
Prometheus 指标已完成推理计数、延迟、错误追踪
gRPC 接口计划中未实现;REST 已就绪
06应用场景

PANOPTES 部署场景

  • APP_01

    机器人感知

    多相机机器人平台的单一模型。无需逐传感器重训。

  • APP_02

    移动机器人

    在手机、运动相机、USB 摄像头上部署,无需重训。

  • APP_03

    监控

    360 相机深度用于异常检测和空间感知。

  • APP_04

    AR/VR 平台

    从异构手机/头显相机快速获取度量深度。

  • APP_05

    嵌入式机器人

    小型模型变体在边缘设备上实现轻量级深度。

  • APP_06

    自动驾驶

    实时深度用于障碍物检测和路径规划。

07技术

底层技术

基础:任意相机深度

  • 相机无关深度估计(CVPR 2025,Guo 等)
  • 视觉 Transformer (ViT) 骨干,DINOv2 预训练
  • 相机自适应特征融合与学习类型嵌入
  • 密集预测 Transformer (DPT) 实现粗到细深度

PANOPTES 实现

  • FastAPI REST 服务器,多相机输入架构
  • 三种模型尺寸:SMALL (50M) BASE (86M) LARGE (170M)
  • 对数压缩深度编码 (1mm–100m)
  • Prometheus 指标与 Docker 部署

集成点

  • 向 ABYSSOS(单目深度基线)输出度量深度
  • 向 PETRA(深度基础模型)提供相机无关特征
  • 输出点云用于下游 3D 重建(PLEROMA)
08论文

研究基础

  1. [01]Depth Any Camera:零样本度量深度估计 — CVPR 2025