跳至正文
RFL_GLOBAL
EN
返回平台
ROBOTFLOW LABS蒸馏引擎

FORGE

VLA 蒸馏锻造炉

当Google、Meta或NVIDIA明天发布更好的VLA时,FORGE在周五前将其部署到$200的机器人上。

模型压缩

7GB→500MB

  • 25 HZ 边缘
  • 96% 质量
  • 57/57 测试
FORGE // 蒸馏引擎
01挑战

问题

视觉-语言-动作模型对于边缘部署来说太大了。整个行业都被卡住了。

  • 7–14 GB模型大小

    最先进的VLA — OpenVLA、RDT2、GR00T-N1 — 有7到14GB。它们无法装入Jetson Orin Nano。

  • 2–5 Hz推理速度

    它们在桌面GPU上以2到5 Hz运行。机器人需要15-30 Hz进行实时控制。标准量化会破坏动作精度。

  • 0可复用工具包

    Physical Intelligence、Skild、NVIDIA — 他们都大规模训练VLA。没有人提供可复用的压缩工具包。每个团队都从头开始重建。

02解决方案

四阶段管道

将FORGE指向教师模型,输出边缘可部署的学生模型。

  1. 01

    教师标签

    在基准任务上运行教师模型。提取软logits、动作分布和中间表示。缓存所有内容。

  2. 02

    知识蒸馏

    初始化0.5B-1.5B参数的学生模型。使用混合损失训练,结合教师的软标签和下游任务损失。桥接注意力层将学生的动作空间对齐到教师的。

  3. 03

    压缩

    Shallow-Pi层剪枝(18 → 6层)。以动作为中心的QVLA 4位量化。可选的多视图输入token剪枝。

  4. 04

    运行时导出

    TensorRT用于Jetson。CoreML用于Apple Silicon。ONNX用于CPU回退。完整基准套件,带自动冒烟测试。

一条命令。完整管道。
uv run forge pipeline --teacher openvla-7b --target jetson-orin-nano
03经过验证的结果

FORGE-NANO 学生模型

SigLIP-SO400M + Qwen2.5-0.5B + 桥接注意力 + 扩散动作头

在NVIDIA L4 24GB(CUDA 12.8,PyTorch 2.10)上进行基准测试 — 我们的生产硬件。

967.9M
参数
51% 可训练
129ms
推理延迟
P50: 132ms / P99: 136ms
9.5 FPS
吞吐量
批次 8
3.90 GB
GPU 内存
18.4 GB 余量
93.8%
损失降低
200步
04经过验证的结果

端到端管道目标

  • 模型大小7–14 GB200–500 MB28–70×
  • 推理速度2–5 Hz25–30 Hz6–15×
  • 保留精度100%94–96%4–6% 损失
  • 每模型总成本$17–3450–100 GPU小时
05兼容性

支持的教师和学生模型

教师模型

  • OpenVLA 7B

    13.7 GB — P1主要目标

  • RDT2-FM 7B

    跨具身

  • GR00T-N1 2B

    4.7 GB — NVIDIA对齐

  • SmolVLA

    6.8 GB — 已经较小

  • pi0.5 3B

    等待权重发布

06兼容性

学生架构

  • FORGE-Nano

    0.5B — Jetson Orin Nano的最佳质量/大小

  • FORGE-Small

    1.5B — Jetson AGX的最佳选择

  • FORGE-Micro

    0.2B — MobileNetV4 + SmolLM2-135M,用于微控制器

生产状态生产就绪。

正在交付

  • 7/7 PRD完成。57/57测试通过。
  • 在8× L4集群上运行。
  • 完整发布门矩阵,带阻塞/非阻塞步骤跟踪
  • 每个重步骤的GPU分析工件
  • 57/57测试在CPU、MLX和CUDA路径上通过
  • 带服务级别冒烟检查的FastAPI服务
  • 通过TurboQuant + PolarQuant的研究级量化