模型压缩
7GB→500MB
- 25 HZ 边缘
- 96% 质量
- 57/57 测试
FORGE // 蒸馏引擎
01挑战
问题
视觉-语言-动作模型对于边缘部署来说太大了。整个行业都被卡住了。
- 7–14 GB模型大小
最先进的VLA — OpenVLA、RDT2、GR00T-N1 — 有7到14GB。它们无法装入Jetson Orin Nano。
- 2–5 Hz推理速度
它们在桌面GPU上以2到5 Hz运行。机器人需要15-30 Hz进行实时控制。标准量化会破坏动作精度。
- 0可复用工具包
Physical Intelligence、Skild、NVIDIA — 他们都大规模训练VLA。没有人提供可复用的压缩工具包。每个团队都从头开始重建。
02解决方案
四阶段管道
将FORGE指向教师模型,输出边缘可部署的学生模型。
- 01
教师标签
在基准任务上运行教师模型。提取软logits、动作分布和中间表示。缓存所有内容。
- 02
知识蒸馏
初始化0.5B-1.5B参数的学生模型。使用混合损失训练,结合教师的软标签和下游任务损失。桥接注意力层将学生的动作空间对齐到教师的。
- 03
压缩
Shallow-Pi层剪枝(18 → 6层)。以动作为中心的QVLA 4位量化。可选的多视图输入token剪枝。
- 04
运行时导出
TensorRT用于Jetson。CoreML用于Apple Silicon。ONNX用于CPU回退。完整基准套件,带自动冒烟测试。
uv run forge pipeline --teacher openvla-7b --target jetson-orin-nano03经过验证的结果
FORGE-NANO 学生模型
SigLIP-SO400M + Qwen2.5-0.5B + 桥接注意力 + 扩散动作头
在NVIDIA L4 24GB(CUDA 12.8,PyTorch 2.10)上进行基准测试 — 我们的生产硬件。
- 967.9M
- 参数
- 51% 可训练
- 129ms
- 推理延迟
- P50: 132ms / P99: 136ms
- 9.5 FPS
- 吞吐量
- 批次 8
- 3.90 GB
- GPU 内存
- 18.4 GB 余量
- 93.8%
- 损失降低
- 200步
04经过验证的结果
端到端管道目标
- 模型大小7–14 GB200–500 MB28–70×
- 推理速度2–5 Hz25–30 Hz6–15×
- 保留精度100%94–96%4–6% 损失
- 每模型总成本$17–3450–100 GPU小时
05兼容性
支持的教师和学生模型
教师模型
OpenVLA 7B
13.7 GB — P1主要目标
RDT2-FM 7B
跨具身
GR00T-N1 2B
4.7 GB — NVIDIA对齐
SmolVLA
6.8 GB — 已经较小
pi0.5 3B
等待权重发布
06兼容性
学生架构
FORGE-Nano
0.5B — Jetson Orin Nano的最佳质量/大小
FORGE-Small
1.5B — Jetson AGX的最佳选择
FORGE-Micro
0.2B — MobileNetV4 + SmolLM2-135M,用于微控制器
生产状态生产就绪。
正在交付
- 7/7 PRD完成。57/57测试通过。
- 在8× L4集群上运行。
- 完整发布门矩阵,带阻塞/非阻塞步骤跟踪
- 每个重步骤的GPU分析工件
- 57/57测试在CPU、MLX和CUDA路径上通过
- 带服务级别冒烟检查的FastAPI服务
- 通过TurboQuant + PolarQuant的研究级量化