跳至正文
RFL_GLOBAL
EN
  • CVPR 2025 亮点
  • RTX 4090 上 60+ FPS
  • APACHE-2.0 许可

CHRONOS

时间揭示一切深度

单帧深度是噪声的。闪烁伪影会破坏机器人控制。CHRONOS 通过时间一致性处理视频 — 滑动窗口缓冲区、关键帧策略和光流插值 — 将抖动的逐帧深度转化为平滑、可靠的深度流。Apache-2.0 许可,用于商业机器人。

模块状态: 运行中

RTX 4090

60FPS

部门
ANIMA
波次
W2
领域
感知
第二波 // ANIMA 套件
时间深度估计
CHRONOS // W2 // 011/079
01核心挑战

单帧深度闪烁。机器人需要时间真相。

单帧深度是噪声的。闪烁伪影会破坏机器人控制回路 — 基于一帧深度规划的抓取会在下一帧给出不同读数时失败。基于视频的深度估计应该在时间上平滑这些,但现有方法要么仅限研究(CC-BY-NC 许可)要么需要在专有数据上昂贵的重新训练。

机器人专家需要跨视频序列的一致深度。一帧是错误的;十帧收敛到真相。但他们还需要商业安全许可 — 真实部署不受研究限制。而且需要 30+ FPS 以跟上机器人控制回路。

02解决方案

CHRONOS 提供什么

CHRONOS 是基于 Video Depth Anything(CVPR 2025 亮点)构建的生产就绪时间深度服务。它以时间一致性、光流插值和关键帧策略处理视频帧。Small 模型变体是 Apache-2.0 许可 — 可安全用于商业机器人。

能力

  • 逐帧深度估计,带时间平滑(窗口=5)
  • 长视频处理的关键帧策略(1800 帧通过 900 关键帧处理,步长=2)
  • 实时逐帧深度的 WebSocket 流 API
  • 多设备:MLX(Apple M1–M5)、CUDA(RTX、A100)、MPS、CPU 回退
  • RTX 4090 上 60+ FPS,Apple M1 上 25-30 FPS,M5 上预估 80+ FPS
  • Prometheus 指标、健康检查、结构化 JSON 日志
03工程挑战

为什么这很难

视频深度与单帧深度是根本不同的问题。它需要解决:

  1. 01时间状态管理:维护帧的滑动窗口以实现跨帧一致性
  2. 02光流:在关键帧之间插值而无需重新计算每一帧 — 节省 50% 计算
  3. 03许可纪律:只有 Small 模型是 Apache-2.0;Base 和 Large 是 CC-BY-NC(仅限研究)
  4. 04流式传输:通过 WebSocket 实时逐帧输出,同时保持时间一致性
  5. 05长序列处理:30 分钟视频的关键帧步长为 2,不会内存耗尽

CHRONOS 不仅仅是推理 — 它是一个时间一致性引擎。滑动窗口、关键帧策略和平滑因子将噪声逐帧深度转化为可靠的视频深度。

04性能基准

真实硬件性能

使用 Small 模型(Apache-2.0)在生产设备上测量:

真实硬件性能
设备模型FPS延迟内存用途
RTX 4090小型60+16-20ms~6GB实时(30fps 目标)
RTX 4080小型40-5020-25ms~4GB生产
Apple M5小型~80+~12ms~2GB移动生产级(4× M1)
Apple M1小型25-3033-40ms~2GB开发
CPU (i7)小型5-10100-200ms~2GB仅验证
05构建状态

已构建的功能

已完成 8/14 个组件
已构建的功能
组件状态说明
核心模型已完成Video Depth Anything Small 权重 — 生产就绪,Apache-2.0
设备抽象已完成MLX/MPS、CUDA、CPU 自动检测
服务器框架已完成FastAPI + WebSocket 就绪
时间引擎已完成SlidingWindowBuffer、KeyframeStrategy
配置系统已完成.env + TOML,动态窗口大小
Docker 构建已完成CPU、GPU、开发配置
/health 端点已完成设备、版本、模型信息
/depth/keyframes已完成API 定义就绪
/depth/frame进行中单帧推理管线
/depth/video进行中完整视频处理
/ws/depth WebSocket进行中流式逐帧深度
API 层进行中公共 REST + gRPC API — 等待数据集基础设施
光流计划中RAFT 或基于流的插值
微调计划中自定义视频领域适应
06应用场景

CHRONOS 部署场景

  • APP_01

    机器人操控

    时间深度一致性的抓取和操控,实现更平滑的伺服控制回路。

  • APP_02

    移动导航

    通过视频相机实现时间平滑的障碍物检测的自主导航。

  • APP_03

    仓储自动化

    高速料箱拾取和物品追踪,具有时间一致的深度。

  • APP_04

    AR / VR

    视频实时深度用于手部追踪、手势识别和空间映射。

  • APP_05

    自动驾驶

    前向相机的时间深度融合用于障碍物和行人检测。

  • APP_06

    无人机载荷

    飞行中实时场景理解的轻量级深度流。

07技术

底层技术

基础:VIDEO DEPTH ANYTHING(CVPR 2025 亮点)

  • 针对时间一致性优化的视觉 Transformer(ViT)骨干
  • 用于帧插值的密集光流集成
  • Small 变体:Apache-2.0 许可(商业安全)
  • CVPR 亮点评分:85/100 — 百度研究团队

核心创新

时间一致性引擎:SlidingWindowBuffer 维护本地上下文(窗口=5),KeyframeStrategy 智能选择关键帧(步长=2),TemporalSmoothing 在它们之间插值(因子=0.7)— 将噪声单帧深度转化为可靠的视频深度流。

部署架构

  • FastAPI + 异步推理与 WebSocket 流
  • 逐帧并发与时间状态管理
  • 用于 FPS、帧延迟、队列深度的 Prometheus 指标
  • 通过 structlog 的结构化 JSON 日志,优雅关闭

多设备运行时

MLX
Apple Silicon(M1–M5)通过 Metal — M1 25-30 FPS,M5 约 80+ FPS(4 倍 M1)
CUDA
NVIDIA GPU(RTX 3080+、A100、H100)配合 cuDNN — RTX 4090 上 60+ FPS
MPS
PyTorch Metal Performance Shaders — 替代 Apple 路径
CPU
验证回退 — i7 上 5-10 FPS

许可(关键)

  • Small:Apache-2.0 — 商业安全,生产默认
  • Base:CC-BY-NC — 仅限研究,不可商业使用
  • Large:CC-BY-NC — 仅限研究,不可商业使用
08论文

研究论文

  1. [01]Video Depth Anything:揭示视频中隐藏的深度 — Lihe Yang、Bingyi Kang 等,CVPR 2025 亮点