- BITNET // 2024
- 3.35× 压缩
- 三值权重
ATOMOS
不可分割的基本单元
一个 4.5 亿参数模型仅权重就占用 1.8GB。ATOMOS 将每个权重量化为三个值 — {-1, 0, 1} — 实现 3.35 倍压缩且精度几乎无损。同样的 7 自由度操控能力,可部署在手机、嵌入式 ARM 板和物联网边缘设备上。
模块状态: 运行中全精度基线
3.35×
- 部门
- ANIMA
- 波次
- W2
- 领域
- 基础
- 第四波 // ANIMA 套件
- 1-BIT VLA 量化
全精度模型无法适配边缘设备
即使是 4.5 亿参数的模型,仅权重就需要 1.8GB GPU 内存。部署到嵌入式机器人、边缘设备或资源受限的环境意味着要么训练微型模型(丧失能力),要么支付昂贵的云推理费用。32 位浮点数表示模型权重存在巨大的开销。
机器人需要能在普通硬件上运行且不牺牲操控精度的模型。不是依赖云的推理,不是精简版的玩具模型 — 而是以原始内存占用的一小部分,在任何设备上以生产速度运行的真正 VLA 能力。
ATOMOS 提供什么
ATOMOS 是一个使用三值权重量化的 1-bit 视觉-语言-动作模型(BitVLA)。它接受 RGB 输入 + 指令,输出 10 个时间步长的 7D 动作 — 仅占原始内存的 29.8%。
能力
- 三值权重 {-1, 0, 1} 配合逐层比例因子 — 3.35 倍压缩
- RGB 224×224 输入 + 语言指令 → 7 自由度动作输出
- ViT 编码器 + transformer 解码器 + 动作头(12 层、12 头、768 维)
- CPU 推理 50-100ms(Apple M 系列),GPU 10-20ms(NVIDIA L4)
- 多设备支持:CUDA、Apple Metal Performance Shaders、CPU 回退
- REST API + WebSocket 流式传输,实时延迟追踪
为什么这很难
量化到 1 bit 需要同时解决三个耦合问题:
- 01权重量化:缩放到 [-1, 0, 1] 范围而不破坏学习的特征 — 逐层 AbsMax 缩放
- 02激活量化:中间激活需要 AbsMean 归一化以避免信息损失
- 03保持表达能力:仅 3 个权重值时,必须在反向传播中保留梯度信息
- 04比例因子管理:逐层绝对最大比例归一化必须正确存储和应用
- 05部署一致性:确保量化模型在 CUDA、Metal 和 CPU 后端产生相同输出
ATOMOS 通过将所有权重量化为三值、逐层存储比例因子、并通过精心初始化保持梯度流来实现 3.35 倍压缩。
用数据说话
在生产硬件上的实测数据:
| 指标 | 数值 |
|---|---|
| 全精度基线 | 100% 内存 |
| 1-Bit 量化 | 29.8% 内存 |
| 压缩比 | 3.35× |
| 量化方法 | 三值 {-1, 0, 1} + 比例 |
| 图像输入 | 224×224 RGB |
| 动作维度 | 7 自由度 |
| 预测时域 | 10 个时间步 |
| 嵌入维度 | 768 |
| 注意力头 | 12 |
| Transformer 层数 | 12 |
| CPU 推理(Apple M5) | 30-60ms / 样本 |
| CPU 推理(Apple M3) | 50-100ms / 样本 |
| GPU 推理(NVIDIA L4) | 10-20ms / 样本 |
| 内存占用 | 1.2-1.8 GB(权重 + 激活) |
| 批大小范围 | 1-16(可配置) |
| 量化开销 | <1% 精度损失 |
已构建的功能
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | BitVLA 三值权重已训练验证 — 生产就绪 |
| BitVLA 架构 | 已完成 | ViT 编码器 + transformer 解码器 + 动作头 |
| 权重量化 | 已完成 | AbsMax 缩放、三值舍入、逐层比例 |
| REST API (FastAPI) | 已完成 | /health、/predict、/quantize、/memory |
| WebSocket 流 | 已完成 | 实时预测与延迟追踪 |
| 设备支持 | 已完成 | CPU、CUDA、Metal Performance Shaders |
| 内存分析 | 已完成 | 实时追踪、压缩比报告 |
| Prometheus 指标 | 已完成 | 延迟、吞吐量、内存使用 |
| Docker 部署 | 已完成 | 多阶段构建、健康检查、自动扩缩 |
| 测试套件 | 已完成 | 配置、设备、服务器测试,覆盖率门控 |
| API 层 | 进行中 | 公共 REST + gRPC API — 等待数据集基础设施 |
| gRPC 接口 | 计划中 | 架构已设计,未实现 |
| 微调路径 | 计划中 | 目前仅支持零样本推理 |
ATOMOS 部署场景
- APP_01
移动机器人
资源受限机器人平台的设备端 VLA 推理 — 无需云依赖。
- APP_02
物联网边缘设备
ONNX 导出后在嵌入式 ARM 板和微控制器上运行操控模型。
- APP_03
边缘数据中心
最小 GPU 占用的批量推理 — 每块 GPU 可运行 3.35 倍更多模型。
- APP_04
实时推理
内存带宽节省直接转化为时间关键型操控的更低延迟。
- APP_05
研究
研究量化对不同压缩级别下操控任务成功率的影响。
- APP_06
机队部署
在异构硬件上部署相同的 VLA 能力 — 从手机到数据中心。
底层技术
基础:BITNET(2024)
- 三值权重量化 {-1, 0, 1} 配合 BitLinear 层
- AbsMean 激活量化实现信息保持推理
- 逐层绝对最大比例归一化
- 3.35 倍实际压缩(10.6 倍理论值)
核心创新
将 BitNet 的三值量化应用于完整的 VLA 管线 — 视觉编码器、语言嵌入、transformer 解码器和动作头 — 同时保持梯度流以支持下游微调。
部署架构
- FastAPI + WebSocket 双模式服务
- 用于延迟、吞吐量、内存的 Prometheus 指标
- Docker 多阶段构建配合健康检查
- 可配置批大小(1-16),按设备配置文件
多设备运行时
- CUDA
- NVIDIA GPU(L4、RTX 3080+)— 10-20ms / 样本
- Metal
- Apple Silicon(M1–M5)— M5 30-60ms,M3 50-100ms
- CPU
- x86/ARM 回退 — 适用于单样本推理
研究论文
- [01]BitNet: Scaling Bitwise Neural Networks to Transformers(Ahn 等,2024)
- [02]Vision Transformers (ViT) — Dosovitskiy 等
- [03]神经网络的训练后量化