跳至正文
RFL_GLOBAL
EN
  • 第五波 // 后训练
  • PYGMALION
  • 冻结 VLA 升级

CHRYSALIS

蜕变

无需重新训练即可改进现有 VLA 模型。CHRYSALIS 通过两阶段对齐和残差校正,将技能组合世界模型的动力学先验迁移到冻结的 VLA 中。VLA 权重保持冻结 — CHRYSALIS 添加轻量级校正层,将基础模型输出转化为专家级轨迹。

模块状态: 研究中

无需重新训练

0-TRAIN

部门
ANIMA
波次
W5
领域
操控
第五波 // ANIMA 套件
操控 — VLA 潜在后训练
CHRYSALIS // W5 // 012/079
01核心挑战

重新训练 VLA 成本过高

视觉-语言-动作模型规模巨大。从零训练需要数百万的算力。微调有灾难性遗忘的风险 — 模型在新任务上改进但丢失了之前学到的能力。每个部署环境都不同,但为每个环境重新训练在规模上是不可能的。

需要的是一种在部署后改进 VLA 而不触碰其权重的方法。一个后训练校正层,吸收世界模型和技能库的动力学先验 — 将通用 VLA 变成领域专家,而无需重新训练的成本。目前没有人干净地实现过这一点。

02解决方案

CHRYSALIS 提供什么

CHRYSALIS 在冻结的 VLA 输出之上添加轻量级残差校正层。它通过两阶段对齐过程从技能组合世界模型迁移动力学先验 — 首先对齐潜在表示,然后学习 VLA 动作输出的残差校正。

能力

  • 冻结 VLA 改进:增强现有 VLA 模型而不修改其权重
  • 两阶段对齐:潜在表示对齐 + 动作残差校正
  • 技能分解:将复杂任务分解为来自世界模型的可组合技能原语
  • 世界模型耦合:将训练好的世界模型的动力学先验迁移到校正层
  • 灾难性遗忘预防:基础 VLA 能力保留 — 校正是叠加的
  • 轻量级部署:校正层对基础 VLA 推理增加最小的计算开销
03工程挑战

为什么这很难

冻结 VLA 的潜在后训练是一个未解决的问题,需要:

  1. 01表示对齐:世界模型潜在空间和 VLA 潜在空间必须在没有共享训练的情况下桥接
  2. 02残差学习:校正必须小到足以保留基础模型行为,但大到足以有意义地提升性能
  3. 03技能组合:将世界模型知识分解为可跨任务迁移的可重用技能原语
  4. 04稳定性保证:校正层绝不能降低基础 VLA 性能 — 只能改进或保持中性
  5. 05高效推理:添加的校正层不能显著增加延迟或内存需求

CHRYSALIS 通过精心的两阶段对齐实现这一点:首先桥接潜在空间,然后学习残差校正。蝴蝶破茧而出 — 比以前更好,所有原始能力完好无损。

04性能基准

关键性能指标

CHRYSALIS 架构的目标指标:

关键性能指标
指标值详情
无需重新训练已确认VLA 权重完全冻结 — 校正层是唯一可训练组件
技能分解已激活复杂任务分解为来自世界模型动力学的可组合原语
世界模型耦合已启用从技能组合世界模型迁移动力学先验
冻结 VLA 改进目标在操控基准上不修改权重的可测量性能提升
05构建状态

已构建的功能

已完成 1/5 个组件
已构建的功能
组件状态说明
PRD 与架构设计已完成完整产品需求文档和系统架构
核心模型进行中世界模型 + 校正层架构 — 设计阶段
两阶段对齐计划中潜在空间桥接 + 残差校正学习
残差校正层计划中冻结 VLA 输出的轻量级叠加校正
API 层计划中REST + gRPC 端点 — 等待核心模型实现
06应用场景

CHRYSALIS 部署场景

  • APP_01

    后训练升级

    在不重新训练的情况下改进已部署的 VLA 模型 — 将校正层作为轻量级补丁发送。

  • APP_02

    持续改进

    通过在领域特定世界模型数据上训练新的校正层,迭代优化 VLA 性能。

  • APP_03

    灾难性遗忘预防

    安全添加新能力而不丢失现有技能 — 基础 VLA 保持不变,校正是叠加的。

07技术

底层技术

基础:潜在后训练

  • 冻结 VLA 骨干网络:后训练期间基础模型权重不被修改
  • 技能组合世界模型:动力学先验分解为可重用原语
  • 两阶段对齐:(1) 桥接潜在空间,(2) 学习残差动作校正
  • 叠加校正:outputs = VLA_output + correction_layer(VLA_latents, world_model_priors)

核心创新

CHRYSALIS 将 VLA 改进视为后训练问题。不是重新训练蝴蝶,而是添加新的翅膀图案。校正层吸收世界模型的动力学知识,对 VLA 输出施加小而精准的校正 — 保留基础模型学到的一切,同时添加领域特定的专业能力。

ANIMA 模块依赖

PYGMALION
提供冻结的 VLA 骨干网络和用于对齐的潜在表示

部署架构

  • 带世界模型动力学先验的校正层训练管线
  • 两阶段对齐:潜在桥接 + 残差学习
  • 轻量级推理插件 — 对基础 VLA 的最小延迟开销
  • 校正层版本管理和 A/B 测试基础设施