- MAPANYTHING // 3DV 2026
- 前馈式
- 多视角3D
PLEROMA
几何之完满
从图像进行3D重建速度很慢。传统SfM管线需要数分钟。PLEROMA 通过单次前馈通过从图像重建3D几何。多视角重建(1-16张图像,RTX 4090上1250ms),单目度量深度(125ms),相机定位,COLMAP导出。基于 MapAnything(Facebook Research,3DV 2026)。
模块状态: 开发中单目深度(512×512,RTX 4090)
1PASS
- 部门
- ANIMA
- 波次
- W2
- 领域
- 基础
- 第二波 // ANIMA 套件
- 前馈式三维重建
PLEROMA // W2 // 060/079
01核心挑战
三维重建太慢
从图像进行3D重建速度很慢。传统运动恢复结构管线需要手动相机定位、光束法平差和昂贵的MVS通道。对于机器人来说,这意味着在行动之前需要数分钟的处理时间。
机器人行业需要从图像获得即时、度量精确的3D。一次通过。任意数量的视角(1-16)。无中间步骤。无需等待。PLEROMA 实现了这一目标。
02解决方案
PLEROMA 提供什么
PLEROMA 是一个生产就绪的 REST API,通过单次前馈通过从图像重建3D几何。它封装了 MapAnything,支持多设备、指标监控和容器化部署。
能力
- 多视角3D1-16张图像,RTX 4090上1250ms
- 单目深度RTX 4090上512×512分辨率125ms
- 相机定位从部分地图定位
- 深度补全对不完整观测进行修复
- COLMAP导出用于下游MVS管线
- MLX + CUDA + CPUApple Silicon(M1–M5,M5约200ms,4倍M1),NVIDIA,CPU回退
- 并发处理逐图像设备队列和优雅关闭
03工程挑战
为什么这很难
MapAnything 是最先进的,但部署需要精细的工程:
- 01设备抽象:Apple Silicon、NVIDIA、CPU回退在3D推理中行为各不相同
- 02商业许可合规:生产部署需要Apache-2.0安全变体
- 03生产可观测性:Prometheus指标、结构化日志、健康检查
- 04多视角批处理逻辑,可变图像数量(1-16)和不同分辨率
- 05长时间运行重建任务的优雅关闭和超时处理
PLEROMA 解决了这些问题。它不仅仅是模型封装——它是为机器人设计的推理服务,具有完善的可观测性和设备抽象。
04性能基准
真实硬件性能
使用 MapAnything 前馈管线测量:
| 指标 | 数值 |
|---|---|
| 单目深度(512×512,RTX 4090) | 50ms,20 图/秒 |
| 单目深度(512×512,A100) | 30ms,33 图/秒 |
| 单目深度(512×512,M5 MLX) | 约50ms(4倍M1) |
| 多视角(4视角,1024,RTX 4090) | 250ms,4 场景/秒 |
| 多视角(4视角,1024,A100) | 140ms,7 场景/秒 |
| 模型变体 | ViT骨干网络,前馈设计 |
| 许可证 | Apache-2.0(商业安全) |
| 存储 | 每变体50-100GB |
05构建状态
已构建的功能
已完成 4/11 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 进行中 | MapAnything模型推理集成中 |
| API层 | 进行中 | 公共API,等待模型集成 |
| 设备抽象 | 已完成 | MLX、CUDA、CPU自动检测 |
| 服务器框架 | 已完成 | FastAPI + Prometheus就绪 |
| Docker构建 | 已完成 | CPU、GPU、开发配置 |
| 配置系统 | 已完成 | .env + TOML,自动设备选择 |
| 模型加载 | 进行中 | HuggingFace集成 |
| /reconstruct 端点 | 进行中 | 多视角管线 |
| /depth 端点 | 进行中 | 单目深度API |
| /localize 端点 | 计划中 | 相机位姿估计 |
| gRPC 接口 | 计划中 | 第三阶段,消息定义就绪 |
06应用场景
PLEROMA 部署场景
- APP_01
移动机器人
用于导航和抓取的快速3D场景理解。
- APP_02
仓储物流
AMR执行拣选、托盘装载、库存建图。
- APP_03
AR / VR
移动端和头戴设备的实时空间捕获。
- APP_04
自动驾驶
用于障碍物检测的深度和几何信息。
- APP_05
摄影测量
基于COLMAP生产管线的集成点。
- APP_06
巡检
从无人机图像进行基础设施3D重建。
07技术
底层技术
基础:MAPANYTHING(3DV 2026)
- Vision Transformer骨干网络,用于鲁棒特征提取
- 前馈设计(无迭代优化)
- Apache-2.0许可,可用于商业
- Facebook Research — 从图像获取最先进3D
PLEROMA 实现
- FastAPI + 异步推理,逐图像并发
- 通过structlog实现结构化JSON日志
- Prometheus指标(请求计数 + 延迟直方图)
- 优雅关闭与超时处理
集成点
- 为GENESIS(场景生成)提供3D几何
- 为ABYSSOS(单目深度优化)提供深度图
- 输出COLMAP格式数据用于下游重建
08论文
研究基础
- [01]MapAnything:卫星图像到矢量地图 — Facebook Research,3DV 2026