- 第五波 // 后训练
- PYGMALION
- 冻结 VLA 升级
CHRYSALIS
蜕变
无需重新训练即可改进现有 VLA 模型。CHRYSALIS 通过两阶段对齐和残差校正,将技能组合世界模型的动力学先验迁移到冻结的 VLA 中。VLA 权重保持冻结 — CHRYSALIS 添加轻量级校正层,将基础模型输出转化为专家级轨迹。
模块状态: 研究中无需重新训练
0-TRAIN
- 部门
- ANIMA
- 波次
- W5
- 领域
- 操控
- 第五波 // ANIMA 套件
- 操控 — VLA 潜在后训练
CHRYSALIS // W5 // 012/079
01核心挑战
重新训练 VLA 成本过高
视觉-语言-动作模型规模巨大。从零训练需要数百万的算力。微调有灾难性遗忘的风险 — 模型在新任务上改进但丢失了之前学到的能力。每个部署环境都不同,但为每个环境重新训练在规模上是不可能的。
需要的是一种在部署后改进 VLA 而不触碰其权重的方法。一个后训练校正层,吸收世界模型和技能库的动力学先验 — 将通用 VLA 变成领域专家,而无需重新训练的成本。目前没有人干净地实现过这一点。
02解决方案
CHRYSALIS 提供什么
CHRYSALIS 在冻结的 VLA 输出之上添加轻量级残差校正层。它通过两阶段对齐过程从技能组合世界模型迁移动力学先验 — 首先对齐潜在表示,然后学习 VLA 动作输出的残差校正。
能力
- 冻结 VLA 改进:增强现有 VLA 模型而不修改其权重
- 两阶段对齐:潜在表示对齐 + 动作残差校正
- 技能分解:将复杂任务分解为来自世界模型的可组合技能原语
- 世界模型耦合:将训练好的世界模型的动力学先验迁移到校正层
- 灾难性遗忘预防:基础 VLA 能力保留 — 校正是叠加的
- 轻量级部署:校正层对基础 VLA 推理增加最小的计算开销
03工程挑战
为什么这很难
冻结 VLA 的潜在后训练是一个未解决的问题,需要:
- 01表示对齐:世界模型潜在空间和 VLA 潜在空间必须在没有共享训练的情况下桥接
- 02残差学习:校正必须小到足以保留基础模型行为,但大到足以有意义地提升性能
- 03技能组合:将世界模型知识分解为可跨任务迁移的可重用技能原语
- 04稳定性保证:校正层绝不能降低基础 VLA 性能 — 只能改进或保持中性
- 05高效推理:添加的校正层不能显著增加延迟或内存需求
CHRYSALIS 通过精心的两阶段对齐实现这一点:首先桥接潜在空间,然后学习残差校正。蝴蝶破茧而出 — 比以前更好,所有原始能力完好无损。
04性能基准
关键性能指标
CHRYSALIS 架构的目标指标:
| 指标 | 值 | 详情 |
|---|---|---|
| 无需重新训练 | 已确认 | VLA 权重完全冻结 — 校正层是唯一可训练组件 |
| 技能分解 | 已激活 | 复杂任务分解为来自世界模型动力学的可组合原语 |
| 世界模型耦合 | 已启用 | 从技能组合世界模型迁移动力学先验 |
| 冻结 VLA 改进 | 目标 | 在操控基准上不修改权重的可测量性能提升 |
05构建状态
已构建的功能
已完成 1/5 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| PRD 与架构设计 | 已完成 | 完整产品需求文档和系统架构 |
| 核心模型 | 进行中 | 世界模型 + 校正层架构 — 设计阶段 |
| 两阶段对齐 | 计划中 | 潜在空间桥接 + 残差校正学习 |
| 残差校正层 | 计划中 | 冻结 VLA 输出的轻量级叠加校正 |
| API 层 | 计划中 | REST + gRPC 端点 — 等待核心模型实现 |
06应用场景
CHRYSALIS 部署场景
- APP_01
后训练升级
在不重新训练的情况下改进已部署的 VLA 模型 — 将校正层作为轻量级补丁发送。
- APP_02
持续改进
通过在领域特定世界模型数据上训练新的校正层,迭代优化 VLA 性能。
- APP_03
灾难性遗忘预防
安全添加新能力而不丢失现有技能 — 基础 VLA 保持不变,校正是叠加的。
07技术
底层技术
基础:潜在后训练
- 冻结 VLA 骨干网络:后训练期间基础模型权重不被修改
- 技能组合世界模型:动力学先验分解为可重用原语
- 两阶段对齐:(1) 桥接潜在空间,(2) 学习残差动作校正
- 叠加校正:outputs = VLA_output + correction_layer(VLA_latents, world_model_priors)
核心创新
CHRYSALIS 将 VLA 改进视为后训练问题。不是重新训练蝴蝶,而是添加新的翅膀图案。校正层吸收世界模型的动力学知识,对 VLA 输出施加小而精准的校正 — 保留基础模型学到的一切,同时添加领域特定的专业能力。
ANIMA 模块依赖
- PYGMALION
- 提供冻结的 VLA 骨干网络和用于对齐的潜在表示
部署架构
- 带世界模型动力学先验的校正层训练管线
- 两阶段对齐:潜在桥接 + 残差学习
- 轻量级推理插件 — 对基础 VLA 的最小延迟开销
- 校正层版本管理和 A/B 测试基础设施