- AsyncMDE // 2603.10438
- MLX-OK
- WAVE 6
GRID
加速器
GRID在RTX 4090上实现237FPS深度估计,在Jetson AGX Orin上实现161FPS,仅需383万参数——比标准模型减少25倍。它仅在关键帧(10-15%的帧)上运行ODIN等昂贵的基础模型,并通过轻量级异步空间记忆网络以全帧率传播深度。基础深度模型对于实时机器人来说太慢——GRID将计算成本分摊到时间上,在不牺牲精度的情况下实现可边缘部署的深度感知。对无人机、移动机器人及任何有严格功耗和算力预算的平台至关重要。
模块状态: 开发中FPS(4090)
237FPS
- 部门
- ANIMA
- 波次
- W6
- 领域
- 深度系统
- 第6波 // ANIMA 套件
- 基础层 — 实时边缘深度
GRID // W6 // 030/079
01核心挑战
基础模型太慢
基础深度模型效果好但仅5-10 FPS。实时机器人需要30+ FPS。
边缘硬件有严格的功耗和计算预算,大模型超出。
02解决方案
GRID 提供什么
GRID通过仅在关键帧运行昂贵模型并通过异步空间记忆传播深度,在RTX 4090上实现237 FPS。
能力
- RTX 4090 237FPS,Jetson AGX Orin 161FPS
- 仅383万参数 — 25倍缩减
- 关键帧昂贵模型摊销
- 异步空间记忆全速传播
03工程挑战
为什么这很难
构建 GRID 需要解决多个耦合问题:
- 01摊销昂贵计算同时保持精度
- 02跨帧异步空间记忆一致性
- 03关键帧选择策略
- 04严格功耗预算的边缘部署
GRID 通过精心的架构设计和严格的验证来解决这些问题。
04性能基准
用数据说话
关键指标:
| 指标 | 数值 |
|---|---|
| FPS(4090) | 237 |
| FPS(Jetson) | 161 |
| 参数 | 383万 |
| 缩减 | 25倍 |
05构建状态
已构建的功能
已完成 3/6 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 关键帧提取 | 已完成 | 智能关键帧选择 |
| 异步记忆 | 已完成 | 空间记忆网络 |
| 全速传播 | 进行中 | 全帧率深度 |
| 边缘优化 | 进行中 | Jetson/MLX调优 |
| 核心模型 | 已完成 | 边缘深度已验证 |
| API层 | 进行中 | 流式深度服务 |
06应用场景
GRID 部署场景
- APP_01
实时机器人
响应式导航的全速深度。
- APP_02
边缘部署
最小功耗部署在Jetson上。
- APP_03
高速系统
快速平台200+FPS深度。
07技术
底层技术
基础:ASYNCMDE
- RTX 4090 237FPS,Jetson AGX Orin 161FPS
- 仅383万参数 — 25倍缩减
- 关键帧昂贵模型摊销
核心创新
GRID通过仅在关键帧运行昂贵模型并通过异步空间记忆传播深度,在RTX 4090上实现237 FPS。
部署
- REST API
- Docker容器化
- Prometheus指标
- 可配置后端
计算
- 主要
- MLX-OK
- 边缘
- 优化推理
- API
- REST + 流式
08论文
论文
- [01]AsyncMDE(2603.10438)