- SMOLVLA // HUGGINGFACE
- 4.5亿参数
- 15倍压缩
PYGMALION
从粘土到创造
大规模机器人操控需要足够小的模型在本地运行,同时又足够强大以处理复杂任务。PYGMALION 是一个4.5亿参数的 SmolVLA,从图像和语言指令预测机器人动作。比7B基线模型小15倍。约45ms推理。在 Apple Silicon 和 CUDA 上运行。从粘土到创造 — 指令输入,动作输出。
模块状态: 运行中模型大小
450M
- 部门
- ANIMA
- 波次
- W4
- 领域
- 行动
- 第四波 // ANIMA 套件
- 紧凑型 VLA 模型
PYGMALION // W4 // 063/079
01核心挑战
太大无法部署
大规模机器人操控需要足够小的模型在机器人上本地运行,同时又足够强大以处理复杂任务。现有的 VLA 模型超过7B参数,需要昂贵的 GPU。没有中间方案。
大多数操控栈迫使你做出选择:支付云推理的延迟和成本,或部署无法理解复杂场景的模型。PYGMALION 用一个4.5亿参数的模型打破了这一权衡,达到了7B级别的性能。
02解决方案
PYGMALION 提供什么
PYGMALION 是一个4.5亿参数的 SmolVLA,从图像和自然语言预测机器人动作。图像 + 指令输入,7D 动作轨迹输出。
流程
- 014.5亿参数:比7B基线 VLA 模型小15倍
- 02输入:RGB 图像(224×224)+ 文本指令
- 03输出:7D 机器人动作(6D 位姿 + 夹爪)覆盖10个时间步
- 04约45ms 单次推理延迟(通过 REST API)
能力
- 边缘推理SmolViT 视觉编码器(384特征)+ SmolLM2 语言模型(576特征)→ MLX Apple Silicon(M1–M5,M5上约45ms,M1的4倍)+ CUDA + CPU
- 实时流式WebSocket 流式传输实时动作预测 + REST + 批处理→ 逐图像和批量推理,可配置最大批次
- 自动设备设备检测,MPS/CUDA/CPU 自动选择→ 一流支持 Apple Silicon、NVIDIA GPU 和 CPU 回退
03工程挑战
为什么这很难
视觉-语言-动作建模需要三个编码器-解码器管线同步工作:
- 01视觉编码器必须提取空间特征,同时不破坏细粒度操控细节
- 02语言编码器必须将指令与视觉上下文对齐 — 不仅嵌入文本,还要与图像对齐
- 03动作解码器必须在学习的动作空间中预测机器人关节轨迹(7D 归一化)
- 04参数高效融合:小视觉 + 小语言 + 轻量适配器 = 总计4.5亿
- 05用少15倍的参数达到与7B模型相当的性能需要精心的架构设计
SmolVLA 通过参数高效融合解决了这一问题。SmolViT(384维)+ SmolLM2(576维)+ 轻量融合适配器。在 Apple Silicon 和 CUDA 上生产就绪。
04性能基准
真实硬件性能
使用 SmolVLA 4.5亿管线测量:
| 指标 | 数值 |
|---|---|
| 模型大小 | 4.5亿参数 |
| 基线对比 | 7B+(小15倍) |
| 动作维度 | 7自由度(6D 位姿 + 夹爪) |
| 预测范围 | 10个时间步 |
| 单次推理 | 约45ms(REST API) |
| Apple M5(MLX) | 约45ms(M1的4倍) |
| 视觉编码器 | SmolViT(384特征) |
| 语言编码器 | SmolLM2(576特征) |
| 最大批次 | 16(可配置) |
05构建状态
已构建的功能
已完成 9/12 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | SmolVLA 4.5亿架构及生产权重 |
| API 层 | 进行中 | 公共 API,待数据集基础设施 |
| 模型加载 | 已完成 | HuggingFace 集成,本地缓存 |
| REST API | 已完成 | /health、/predict、/batch_predict、/info |
| WebSocket API | 已完成 | 通过 ws:// 实时流式传输 |
| 设备检测 | 已完成 | 自动(MPS > CUDA > CPU) |
| Apple Silicon(MPS) | 已完成 | 一流 MLX 就绪打包 |
| Prometheus 指标 | 已完成 | 请求延迟、推理时间、吞吐量 |
| Docker / Compose | 已完成 | 多容器健康检查 |
| 单元测试 | 已完成 | pytest 覆盖测试套件 |
| gRPC 接口 | 计划中 | 架构已规划,未实现 |
| ROS2 集成 | 计划中 | 基于话题的 VLA 动作订阅 |
06应用场景
PYGMALION 部署场景
- APP_01
机器人手臂制造商
无需云依赖即可部署操控。设备端 VLA 推理用于拾取放置、组装和通用操控任务。
- APP_02
物流与仓储
边缘推理用于拾取放置操作。语言引导的分拣和码垛,无需云端往返。
- APP_03
研究实验室
模仿学习实验的基线 VLA。足够小可快速迭代,足够大可产生真实结果。
- APP_04
移动操控机器人
协作任务的板载模型。在计算资源有限的移动平台上实时动作预测。
- APP_05
边缘 AI 开发者
小型模型大规模应用的概念验证。在消费级硬件上展示 VLA 能力。
- APP_06
装配自动化
语言引导的机器人装配步骤。指令驱动的操控用于柔性制造线。
07技术
底层技术
基础:SMOLVLA(HUGGINGFACE LEROBOT)
- SmolViT 视觉编码器:384维补丁嵌入
- SmolLM2 语言模型:576维标记嵌入
- 融合适配器:跨模态注意力 + 动作解码器
- 动作空间:7D 归一化轨迹(关节控制)
PYGMALION 实现
- FastAPI REST + WebSocket 用于实时动作流
- 逐图像和批量推理,可配置最大批次
- 设备检测,MPS/CUDA/CPU 自动选择
- Prometheus 指标和 Docker 部署
集成接口
- 向 CHIRON(控制回路)提供动作轨迹
- 向 ERGON(位姿估计)提供操控计划
- 从 LOGOS(语言定位)获取场景理解
08论文
研究基础
- [01]SmolVLA:小型视觉-语言-动作模型 — HuggingFace LeRobot,Apache-2.0