跳至正文
RFL_GLOBAL
EN
  • DEFM // 苏黎世联邦理工 2026
  • 11 种架构
  • 自监督学习

PETRA

基石

深度图像包含丰富的三维几何信息,但大多数管线忽略了这一信号。PETRA 是一个深度基础模型(DeFM),在 6000 万张深度图像上使用 DINO 目标进行自监督训练。11 个变体从 3M 到 307M 参数 — 从超轻量边缘机器人到研究级蒸馏源。零样本迁移实现 87–93% 的场景分类精度。

模块状态: 运行中

零样本精度

60M

部门
ANIMA
波次
W4
领域
基础
第四波 // ANIMA 套件
深度基础模型
PETRA // W4 // 059/079
01核心挑战

深度被忽视

深度图像包含丰富的三维几何信息,但大多数机器人管线忽略了这一信号。RGB 基础模型占主导地位,因为它们在数十亿互联网图像上预训练。深度被降级为事后细化。

我们需要一个在 6000 万张深度图像上训练的深度基础模型,有 11 个变体从 3M 扩展到 307M 参数,使每个机器人技术栈都能从原始深度中提取丰富的几何特征。PETRA 提供了这一基础。

02解决方案

PETRA 提供什么

PETRA 是一个拥有 11 种骨干架构的深度基础模型。选择你的骨干,为你的任务微调,或使用零样本特征。

流程

  1. 0111 种骨干架构:ViT-S/B/L、EfficientNet-B0/B3、ResNet50、RegNet、ConvNeXt
  2. 02在 6000 万张深度图像上进行自监督 DINO 训练(模拟 + 真实)
  3. 03零样本场景分类:87–93% 精度
  4. 04通过线性探测抓取成功率:78–85%
  5. 05模拟导航:89–94% 成功率
  6. 06微调输出头:仅需 5–10% 参数即可适配你的任务
  7. 07MLX Apple Silicon(M1–M5,M5 上 ViT-S 约 12ms,M1 的 4 倍)+ CUDA + CPU
  8. 08REST API:/features、/features/batch、/adapt、/classify、/segment

能力

  • 零样本迁移无需微调即可实现 87–93% 场景分类→ 开箱即用的特征,实现快速部署
  • 可扩展骨干11 种架构从 3M 到 307M 参数→ 从边缘机器人扩展到研究蒸馏
  • 跨平台MLX、CUDA、MPS 和 CPU 配合 REST API→ 随处部署 — 从 Apple Silicon 到云端 GPU
03工程挑战

为什么这很难

深度上的自监督学习需要重新思考增强和表示:

  1. 01深度增强:随机裁剪需要仔细处理尺度和遮挡边界,而不仅仅是 RGB 风格的裁剪
  2. 02度量感知编码:对数压缩深度以保留从 1mm 到 100m 的尺度,使用 3 通道(对数、线性、逆)
  3. 03尺度多样性:在模拟器(Isaac、MuJoCo)和真实环境(四足、人形、移动操作臂)上训练
  4. 04带动量更新的学生-教师 DINO 训练需要针对深度进行仔细的超参数调优
  5. 0511 种架构变体意味着需要在非常不同的骨干之间维护一致的训练管线

PETRA 通过学生-教师 DINO 训练、对数压缩深度编码和来自模拟器与真实机器人的 6000 万张多样化深度图像实现了这一目标。

04性能基准

真实硬件性能

跨 11 种 DeFM 骨干架构测量:

真实硬件性能
指标数值
零样本精度87–93%(场景分类)
抓取成功率(线性探测)78–85%(ViT-S 到 ViT-L)
导航成功率89–94% 模拟环境
ViT-S 延迟12.5ms(batch 1)
ViT-S 吞吐量390 fps(batch 32)
RegNet-400MF 延迟4.2ms(batch 1)
Apple M5(MLX)ViT-S 约 12ms(M1 的 4 倍)
训练数据6000 万张深度图像
模型范围3M 至 307M 参数
05构建状态

已构建的功能

已完成 9/11 个组件
已构建的功能
组件状态说明
核心模型已完成11 种 DeFM 架构,生产就绪权重
API 层进行中公共 API,等待数据集基础设施
11 种骨干架构已完成ViT-S/B/L、EfficientNet、ResNet、RegNet、ConvNeXt
对数压缩编码已完成3 通道深度表示
FastAPI 服务器已完成/features、/features/batch、/adapt、/classify、/segment
模型加载已完成HuggingFace 集成,本地缓存
任务适配已完成轻量级下游头
零样本迁移已完成场景/障碍物任务的线性探测
Docker 部署已完成多容器配 Prometheus/Grafana
设备支持已完成自动(MLX > MPS > CUDA > CPU)
gRPC 接口计划中架构已设计,未实现
06应用场景

PETRA 部署场景

  • APP_01

    机器人感知

    即插即用的深度特征骨干,用于视觉技术栈

  • APP_02

    导航

    几何感知特征用于地形可通行性

  • APP_03

    抓取

    从深度特征预测抓取点

  • APP_04

    移动机器人

    边缘设备上的低延迟深度(RegNet 变体)

  • APP_05

    研究实验室

    深度自监督学习基准

  • APP_06

    模拟到真实

    可迁移到真实深度传感器的预训练特征

07技术

底层技术

基础:DEFM(苏黎世联邦理工 2026)

  • 基于学生-教师框架的自监督 DINO 目标
  • 对数压缩深度编码:3 通道(1mm–100m)
  • 来自模拟器 + 真实机器人的 6000 万张深度图像
  • 增强:随机裁剪 + 深度噪声 + 镜头畸变 + 时间偏移

骨干规格

RegNet-Y-400MF
320 万参数 / 440 维 — 边缘机器人
ViT-S
2100 万参数 / 384 维 — 标准任务
ViT-B
8700 万参数 / 768 维 — 高性能
ViT-L
3.07 亿参数 / 1024 维 — 研究/蒸馏

集成点

  • 为 ABYSSOS(单目深度)提供深度特征
  • 向 PANOPTES(相机无关)输送基础表示
  • 为下游操作模块提供几何嵌入
08论文

研究基础

  1. [01]DeFM:从深度学习机器人基础表示 — 苏黎世联邦理工 2026