- 第五波 // 仿真
- CHIRON + PYGMALION
- 协同训练
CENTAUR
仿真-人类协同训练
SimHum 协同训练框架:在仿真轨迹和人类演示上联合预训练,在少量真实机器人数据上微调。仿真提供规模和多样性,人类数据提供物理真实性。结果:策略的泛化能力远超任何单一数据源。
模块状态: 开发中超越纯真实基线
SIM+H
- 部门
- ANIMA
- 波次
- W5
- 领域
- 仿真
- 第五波 // ANIMA 套件
- 仿真 — 仿真-人类协同训练
CENTAUR // W5 // 009/079
01核心挑战
真实数据昂贵。仿真数据廉价但不准确。
训练鲁棒的机器人策略需要数千次演示,但收集真实世界数据缓慢、昂贵且危险。单个操控任务可能需要数百小时的人类遥操作 — 而最终的策略在未见过的分布外场景中仍然失败。
仿真提供无限的规模和多样性,但仿真到现实的迁移仍然脆弱。物理引擎只是近似现实,渲染不完美,接触动力学存在偏差。纯仿真训练的策略在真实硬件上部署时会失败。该领域需要一个能提取两者优势的框架。
- +40%
- 超越纯真实基线
- 62.5%
- OOD 成功率
- 80
- 所需真实演示数
02解决方案
CENTAUR 提供什么
CENTAUR 实现了 SimHum 协同训练框架,在仿真轨迹和人类演示上联合预训练,然后在少量真实机器人数据上微调。仿真提供泛化所需的规模和多样性;人类演示提供部署所需的物理真实性。
能力
- 在混合仿真+人类演示数据上联合预训练,采用域感知加权
- MuJoCo 仿真管道大规模生成多样化操控轨迹
- 真实机器人微调阶段仅需 80 次演示即可实现鲁棒迁移
- 分布外泛化:在最少真实数据下,未见场景达到 62.5% 成功率
03工程挑战
为什么这很难
将仿真和人类数据合并到单一训练管道中需要解决多个耦合问题:
- 01域对齐:仿真观测和真实世界观测占据不同分布 — 简单混合会降低两者效果
- 02动作空间不匹配:MuJoCo 关节空间动作与人类遥操作笛卡尔命令需要统一表示
- 03课程设计:在预训练阶段何时加权仿真数据与人类数据以实现最大迁移效果
- 04微调稳定性:将协同训练的骨干网络适应到真实硬件,同时不灾难性遗忘仿真学到的多样性
- 05评估严格性:OOD 基准必须测试真正的泛化,而非记忆的仿真场景
CENTAUR 通过域感知数据混合、统一动作表示和针对最小真实数据需求优化的分阶段预训练→微调管道解决了这些问题。
04性能基准
协同训练性能
与纯真实和纯仿真基线的对比:
| 指标 | 数值 |
|---|---|
| 超越纯真实基线 | +40% |
| OOD 成功率 | 62.5% |
| 所需真实演示数 | 80 |
| 仿真到现实改进倍数 | 7.1× |
05构建状态
已构建的功能
已完成 3/6 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| MuJoCo 训练循环 | 已完成 | 稳定的仿真轨迹生成,带域随机化 |
| 仿真轨迹生成器 | 已完成 | 在 MuJoCo 中大规模生成多样化操控轨迹 |
| 人类演示集成 | 进行中 | 混合数据训练的统一动作表示 |
| 真实机器人微调 | 进行中 | 带灾难性遗忘缓解的分阶段微调管道 |
| 核心模型 | 已完成 | 协同训练骨干在基准任务上已验证 |
| API 层 | 进行中 | 训练任务提交和模型服务的 REST API |
06应用场景
CENTAUR 部署场景
- APP_01
数据高效训练
用 80 次真实演示代替数千次训练鲁棒的操控策略 — 仿真提供缺失的多样性。
- APP_02
仿真到现实迁移
通过结合仿真规模和人类物理真实性的协同训练弥合现实差距,实现可靠的硬件部署。
- APP_03
小数据机器人
在收集大型真实数据集不切实际的场景中实现新的机器人部署 — 初创企业、新型硬件、受限环境。