- DEFM // 苏黎世联邦理工 2026
- 11 种架构
- 自监督学习
PETRA
基石
深度图像包含丰富的三维几何信息,但大多数管线忽略了这一信号。PETRA 是一个深度基础模型(DeFM),在 6000 万张深度图像上使用 DINO 目标进行自监督训练。11 个变体从 3M 到 307M 参数 — 从超轻量边缘机器人到研究级蒸馏源。零样本迁移实现 87–93% 的场景分类精度。
模块状态: 运行中零样本精度
60M
- 部门
- ANIMA
- 波次
- W4
- 领域
- 基础
- 第四波 // ANIMA 套件
- 深度基础模型
PETRA // W4 // 059/079
01核心挑战
深度被忽视
深度图像包含丰富的三维几何信息,但大多数机器人管线忽略了这一信号。RGB 基础模型占主导地位,因为它们在数十亿互联网图像上预训练。深度被降级为事后细化。
我们需要一个在 6000 万张深度图像上训练的深度基础模型,有 11 个变体从 3M 扩展到 307M 参数,使每个机器人技术栈都能从原始深度中提取丰富的几何特征。PETRA 提供了这一基础。
02解决方案
PETRA 提供什么
PETRA 是一个拥有 11 种骨干架构的深度基础模型。选择你的骨干,为你的任务微调,或使用零样本特征。
流程
- 0111 种骨干架构:ViT-S/B/L、EfficientNet-B0/B3、ResNet50、RegNet、ConvNeXt
- 02在 6000 万张深度图像上进行自监督 DINO 训练(模拟 + 真实)
- 03零样本场景分类:87–93% 精度
- 04通过线性探测抓取成功率:78–85%
- 05模拟导航:89–94% 成功率
- 06微调输出头:仅需 5–10% 参数即可适配你的任务
- 07MLX Apple Silicon(M1–M5,M5 上 ViT-S 约 12ms,M1 的 4 倍)+ CUDA + CPU
- 08REST API:/features、/features/batch、/adapt、/classify、/segment
能力
- 零样本迁移无需微调即可实现 87–93% 场景分类→ 开箱即用的特征,实现快速部署
- 可扩展骨干11 种架构从 3M 到 307M 参数→ 从边缘机器人扩展到研究蒸馏
- 跨平台MLX、CUDA、MPS 和 CPU 配合 REST API→ 随处部署 — 从 Apple Silicon 到云端 GPU
03工程挑战
为什么这很难
深度上的自监督学习需要重新思考增强和表示:
- 01深度增强:随机裁剪需要仔细处理尺度和遮挡边界,而不仅仅是 RGB 风格的裁剪
- 02度量感知编码:对数压缩深度以保留从 1mm 到 100m 的尺度,使用 3 通道(对数、线性、逆)
- 03尺度多样性:在模拟器(Isaac、MuJoCo)和真实环境(四足、人形、移动操作臂)上训练
- 04带动量更新的学生-教师 DINO 训练需要针对深度进行仔细的超参数调优
- 0511 种架构变体意味着需要在非常不同的骨干之间维护一致的训练管线
PETRA 通过学生-教师 DINO 训练、对数压缩深度编码和来自模拟器与真实机器人的 6000 万张多样化深度图像实现了这一目标。
04性能基准
真实硬件性能
跨 11 种 DeFM 骨干架构测量:
| 指标 | 数值 |
|---|---|
| 零样本精度 | 87–93%(场景分类) |
| 抓取成功率(线性探测) | 78–85%(ViT-S 到 ViT-L) |
| 导航成功率 | 89–94% 模拟环境 |
| ViT-S 延迟 | 12.5ms(batch 1) |
| ViT-S 吞吐量 | 390 fps(batch 32) |
| RegNet-400MF 延迟 | 4.2ms(batch 1) |
| Apple M5(MLX) | ViT-S 约 12ms(M1 的 4 倍) |
| 训练数据 | 6000 万张深度图像 |
| 模型范围 | 3M 至 307M 参数 |
05构建状态
已构建的功能
已完成 9/11 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | 11 种 DeFM 架构,生产就绪权重 |
| API 层 | 进行中 | 公共 API,等待数据集基础设施 |
| 11 种骨干架构 | 已完成 | ViT-S/B/L、EfficientNet、ResNet、RegNet、ConvNeXt |
| 对数压缩编码 | 已完成 | 3 通道深度表示 |
| FastAPI 服务器 | 已完成 | /features、/features/batch、/adapt、/classify、/segment |
| 模型加载 | 已完成 | HuggingFace 集成,本地缓存 |
| 任务适配 | 已完成 | 轻量级下游头 |
| 零样本迁移 | 已完成 | 场景/障碍物任务的线性探测 |
| Docker 部署 | 已完成 | 多容器配 Prometheus/Grafana |
| 设备支持 | 已完成 | 自动(MLX > MPS > CUDA > CPU) |
| gRPC 接口 | 计划中 | 架构已设计,未实现 |
06应用场景
PETRA 部署场景
- APP_01
机器人感知
即插即用的深度特征骨干,用于视觉技术栈
- APP_02
导航
几何感知特征用于地形可通行性
- APP_03
抓取
从深度特征预测抓取点
- APP_04
移动机器人
边缘设备上的低延迟深度(RegNet 变体)
- APP_05
研究实验室
深度自监督学习基准
- APP_06
模拟到真实
可迁移到真实深度传感器的预训练特征
07技术
底层技术
基础:DEFM(苏黎世联邦理工 2026)
- 基于学生-教师框架的自监督 DINO 目标
- 对数压缩深度编码:3 通道(1mm–100m)
- 来自模拟器 + 真实机器人的 6000 万张深度图像
- 增强:随机裁剪 + 深度噪声 + 镜头畸变 + 时间偏移
骨干规格
- RegNet-Y-400MF
- 320 万参数 / 440 维 — 边缘机器人
- ViT-S
- 2100 万参数 / 384 维 — 标准任务
- ViT-B
- 8700 万参数 / 768 维 — 高性能
- ViT-L
- 3.07 亿参数 / 1024 维 — 研究/蒸馏
集成点
- 为 ABYSSOS(单目深度)提供深度特征
- 向 PANOPTES(相机无关)输送基础表示
- 为下游操作模块提供几何嵌入
08论文
研究基础
- [01]DeFM:从深度学习机器人基础表示 — 苏黎世联邦理工 2026