- CVPR 2025 亮点
- RTX 4090 上 60+ FPS
- APACHE-2.0 许可
CHRONOS
时间揭示一切深度
单帧深度是噪声的。闪烁伪影会破坏机器人控制。CHRONOS 通过时间一致性处理视频 — 滑动窗口缓冲区、关键帧策略和光流插值 — 将抖动的逐帧深度转化为平滑、可靠的深度流。Apache-2.0 许可,用于商业机器人。
模块状态: 运行中RTX 4090
60FPS
- 部门
- ANIMA
- 波次
- W2
- 领域
- 感知
- 第二波 // ANIMA 套件
- 时间深度估计
单帧深度闪烁。机器人需要时间真相。
单帧深度是噪声的。闪烁伪影会破坏机器人控制回路 — 基于一帧深度规划的抓取会在下一帧给出不同读数时失败。基于视频的深度估计应该在时间上平滑这些,但现有方法要么仅限研究(CC-BY-NC 许可)要么需要在专有数据上昂贵的重新训练。
机器人专家需要跨视频序列的一致深度。一帧是错误的;十帧收敛到真相。但他们还需要商业安全许可 — 真实部署不受研究限制。而且需要 30+ FPS 以跟上机器人控制回路。
CHRONOS 提供什么
CHRONOS 是基于 Video Depth Anything(CVPR 2025 亮点)构建的生产就绪时间深度服务。它以时间一致性、光流插值和关键帧策略处理视频帧。Small 模型变体是 Apache-2.0 许可 — 可安全用于商业机器人。
能力
- 逐帧深度估计,带时间平滑(窗口=5)
- 长视频处理的关键帧策略(1800 帧通过 900 关键帧处理,步长=2)
- 实时逐帧深度的 WebSocket 流 API
- 多设备:MLX(Apple M1–M5)、CUDA(RTX、A100)、MPS、CPU 回退
- RTX 4090 上 60+ FPS,Apple M1 上 25-30 FPS,M5 上预估 80+ FPS
- Prometheus 指标、健康检查、结构化 JSON 日志
为什么这很难
视频深度与单帧深度是根本不同的问题。它需要解决:
- 01时间状态管理:维护帧的滑动窗口以实现跨帧一致性
- 02光流:在关键帧之间插值而无需重新计算每一帧 — 节省 50% 计算
- 03许可纪律:只有 Small 模型是 Apache-2.0;Base 和 Large 是 CC-BY-NC(仅限研究)
- 04流式传输:通过 WebSocket 实时逐帧输出,同时保持时间一致性
- 05长序列处理:30 分钟视频的关键帧步长为 2,不会内存耗尽
CHRONOS 不仅仅是推理 — 它是一个时间一致性引擎。滑动窗口、关键帧策略和平滑因子将噪声逐帧深度转化为可靠的视频深度。
真实硬件性能
使用 Small 模型(Apache-2.0)在生产设备上测量:
| 设备 | 模型 | FPS | 延迟 | 内存 | 用途 |
|---|---|---|---|---|---|
| RTX 4090 | 小型 | 60+ | 16-20ms | ~6GB | 实时(30fps 目标) |
| RTX 4080 | 小型 | 40-50 | 20-25ms | ~4GB | 生产 |
| Apple M5 | 小型 | ~80+ | ~12ms | ~2GB | 移动生产级(4× M1) |
| Apple M1 | 小型 | 25-30 | 33-40ms | ~2GB | 开发 |
| CPU (i7) | 小型 | 5-10 | 100-200ms | ~2GB | 仅验证 |
已构建的功能
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | Video Depth Anything Small 权重 — 生产就绪,Apache-2.0 |
| 设备抽象 | 已完成 | MLX/MPS、CUDA、CPU 自动检测 |
| 服务器框架 | 已完成 | FastAPI + WebSocket 就绪 |
| 时间引擎 | 已完成 | SlidingWindowBuffer、KeyframeStrategy |
| 配置系统 | 已完成 | .env + TOML,动态窗口大小 |
| Docker 构建 | 已完成 | CPU、GPU、开发配置 |
| /health 端点 | 已完成 | 设备、版本、模型信息 |
| /depth/keyframes | 已完成 | API 定义就绪 |
| /depth/frame | 进行中 | 单帧推理管线 |
| /depth/video | 进行中 | 完整视频处理 |
| /ws/depth WebSocket | 进行中 | 流式逐帧深度 |
| API 层 | 进行中 | 公共 REST + gRPC API — 等待数据集基础设施 |
| 光流 | 计划中 | RAFT 或基于流的插值 |
| 微调 | 计划中 | 自定义视频领域适应 |
CHRONOS 部署场景
- APP_01
机器人操控
时间深度一致性的抓取和操控,实现更平滑的伺服控制回路。
- APP_02
移动导航
通过视频相机实现时间平滑的障碍物检测的自主导航。
- APP_03
仓储自动化
高速料箱拾取和物品追踪,具有时间一致的深度。
- APP_04
AR / VR
视频实时深度用于手部追踪、手势识别和空间映射。
- APP_05
自动驾驶
前向相机的时间深度融合用于障碍物和行人检测。
- APP_06
无人机载荷
飞行中实时场景理解的轻量级深度流。
底层技术
基础:VIDEO DEPTH ANYTHING(CVPR 2025 亮点)
- 针对时间一致性优化的视觉 Transformer(ViT)骨干
- 用于帧插值的密集光流集成
- Small 变体:Apache-2.0 许可(商业安全)
- CVPR 亮点评分:85/100 — 百度研究团队
核心创新
时间一致性引擎:SlidingWindowBuffer 维护本地上下文(窗口=5),KeyframeStrategy 智能选择关键帧(步长=2),TemporalSmoothing 在它们之间插值(因子=0.7)— 将噪声单帧深度转化为可靠的视频深度流。
部署架构
- FastAPI + 异步推理与 WebSocket 流
- 逐帧并发与时间状态管理
- 用于 FPS、帧延迟、队列深度的 Prometheus 指标
- 通过 structlog 的结构化 JSON 日志,优雅关闭
多设备运行时
- MLX
- Apple Silicon(M1–M5)通过 Metal — M1 25-30 FPS,M5 约 80+ FPS(4 倍 M1)
- CUDA
- NVIDIA GPU(RTX 3080+、A100、H100)配合 cuDNN — RTX 4090 上 60+ FPS
- MPS
- PyTorch Metal Performance Shaders — 替代 Apple 路径
- CPU
- 验证回退 — i7 上 5-10 FPS
许可(关键)
- Small:Apache-2.0 — 商业安全,生产默认
- Base:CC-BY-NC — 仅限研究,不可商业使用
- Large:CC-BY-NC — 仅限研究,不可商业使用