跳至正文
RFL_GLOBAL
EN
  • SMOLVLA // HUGGINGFACE
  • 4.5亿参数
  • 15倍压缩

PYGMALION

从粘土到创造

大规模机器人操控需要足够小的模型在本地运行,同时又足够强大以处理复杂任务。PYGMALION 是一个4.5亿参数的 SmolVLA,从图像和语言指令预测机器人动作。比7B基线模型小15倍。约45ms推理。在 Apple Silicon 和 CUDA 上运行。从粘土到创造 — 指令输入,动作输出。

模块状态: 运行中

模型大小

450M

部门
ANIMA
波次
W4
领域
行动
第四波 // ANIMA 套件
紧凑型 VLA 模型
PYGMALION // W4 // 063/079
01核心挑战

太大无法部署

大规模机器人操控需要足够小的模型在机器人上本地运行,同时又足够强大以处理复杂任务。现有的 VLA 模型超过7B参数,需要昂贵的 GPU。没有中间方案。

大多数操控栈迫使你做出选择:支付云推理的延迟和成本,或部署无法理解复杂场景的模型。PYGMALION 用一个4.5亿参数的模型打破了这一权衡,达到了7B级别的性能。

02解决方案

PYGMALION 提供什么

PYGMALION 是一个4.5亿参数的 SmolVLA,从图像和自然语言预测机器人动作。图像 + 指令输入,7D 动作轨迹输出。

流程

  1. 014.5亿参数:比7B基线 VLA 模型小15倍
  2. 02输入:RGB 图像(224×224)+ 文本指令
  3. 03输出:7D 机器人动作(6D 位姿 + 夹爪)覆盖10个时间步
  4. 04约45ms 单次推理延迟(通过 REST API)

能力

  • 边缘推理SmolViT 视觉编码器(384特征)+ SmolLM2 语言模型(576特征)→ MLX Apple Silicon(M1–M5,M5上约45ms,M1的4倍)+ CUDA + CPU
  • 实时流式WebSocket 流式传输实时动作预测 + REST + 批处理→ 逐图像和批量推理,可配置最大批次
  • 自动设备设备检测,MPS/CUDA/CPU 自动选择→ 一流支持 Apple Silicon、NVIDIA GPU 和 CPU 回退
03工程挑战

为什么这很难

视觉-语言-动作建模需要三个编码器-解码器管线同步工作:

  1. 01视觉编码器必须提取空间特征,同时不破坏细粒度操控细节
  2. 02语言编码器必须将指令与视觉上下文对齐 — 不仅嵌入文本,还要与图像对齐
  3. 03动作解码器必须在学习的动作空间中预测机器人关节轨迹(7D 归一化)
  4. 04参数高效融合:小视觉 + 小语言 + 轻量适配器 = 总计4.5亿
  5. 05用少15倍的参数达到与7B模型相当的性能需要精心的架构设计

SmolVLA 通过参数高效融合解决了这一问题。SmolViT(384维)+ SmolLM2(576维)+ 轻量融合适配器。在 Apple Silicon 和 CUDA 上生产就绪。

04性能基准

真实硬件性能

使用 SmolVLA 4.5亿管线测量:

真实硬件性能
指标数值
模型大小4.5亿参数
基线对比7B+(小15倍)
动作维度7自由度(6D 位姿 + 夹爪)
预测范围10个时间步
单次推理约45ms(REST API)
Apple M5(MLX)约45ms(M1的4倍)
视觉编码器SmolViT(384特征)
语言编码器SmolLM2(576特征)
最大批次16(可配置)
05构建状态

已构建的功能

已完成 9/12 个组件
已构建的功能
组件状态说明
核心模型已完成SmolVLA 4.5亿架构及生产权重
API 层进行中公共 API,待数据集基础设施
模型加载已完成HuggingFace 集成,本地缓存
REST API已完成/health、/predict、/batch_predict、/info
WebSocket API已完成通过 ws:// 实时流式传输
设备检测已完成自动(MPS > CUDA > CPU)
Apple Silicon(MPS)已完成一流 MLX 就绪打包
Prometheus 指标已完成请求延迟、推理时间、吞吐量
Docker / Compose已完成多容器健康检查
单元测试已完成pytest 覆盖测试套件
gRPC 接口计划中架构已规划,未实现
ROS2 集成计划中基于话题的 VLA 动作订阅
06应用场景

PYGMALION 部署场景

  • APP_01

    机器人手臂制造商

    无需云依赖即可部署操控。设备端 VLA 推理用于拾取放置、组装和通用操控任务。

  • APP_02

    物流与仓储

    边缘推理用于拾取放置操作。语言引导的分拣和码垛,无需云端往返。

  • APP_03

    研究实验室

    模仿学习实验的基线 VLA。足够小可快速迭代,足够大可产生真实结果。

  • APP_04

    移动操控机器人

    协作任务的板载模型。在计算资源有限的移动平台上实时动作预测。

  • APP_05

    边缘 AI 开发者

    小型模型大规模应用的概念验证。在消费级硬件上展示 VLA 能力。

  • APP_06

    装配自动化

    语言引导的机器人装配步骤。指令驱动的操控用于柔性制造线。

07技术

底层技术

基础:SMOLVLA(HUGGINGFACE LEROBOT)

  • SmolViT 视觉编码器:384维补丁嵌入
  • SmolLM2 语言模型:576维标记嵌入
  • 融合适配器:跨模态注意力 + 动作解码器
  • 动作空间:7D 归一化轨迹(关节控制)

PYGMALION 实现

  • FastAPI REST + WebSocket 用于实时动作流
  • 逐图像和批量推理,可配置最大批次
  • 设备检测,MPS/CUDA/CPU 自动选择
  • Prometheus 指标和 Docker 部署

集成接口

  • 向 CHIRON(控制回路)提供动作轨迹
  • 向 ERGON(位姿估计)提供操控计划
  • 从 LOGOS(语言定位)获取场景理解
08论文

研究基础

  1. [01]SmolVLA:小型视觉-语言-动作模型 — HuggingFace LeRobot,Apache-2.0