跳至正文
RFL_GLOBAL
EN
  • 第五波 // 仿真
  • CHIRON + PYGMALION
  • 协同训练

CENTAUR

仿真-人类协同训练

SimHum 协同训练框架:在仿真轨迹和人类演示上联合预训练,在少量真实机器人数据上微调。仿真提供规模和多样性,人类数据提供物理真实性。结果:策略的泛化能力远超任何单一数据源。

模块状态: 开发中

超越纯真实基线

SIM+H

部门
ANIMA
波次
W5
领域
仿真
第五波 // ANIMA 套件
仿真 — 仿真-人类协同训练
CENTAUR // W5 // 009/079
01核心挑战

真实数据昂贵。仿真数据廉价但不准确。

训练鲁棒的机器人策略需要数千次演示,但收集真实世界数据缓慢、昂贵且危险。单个操控任务可能需要数百小时的人类遥操作 — 而最终的策略在未见过的分布外场景中仍然失败。

仿真提供无限的规模和多样性,但仿真到现实的迁移仍然脆弱。物理引擎只是近似现实,渲染不完美,接触动力学存在偏差。纯仿真训练的策略在真实硬件上部署时会失败。该领域需要一个能提取两者优势的框架。

+40%
超越纯真实基线
62.5%
OOD 成功率
80
所需真实演示数
02解决方案

CENTAUR 提供什么

CENTAUR 实现了 SimHum 协同训练框架,在仿真轨迹和人类演示上联合预训练,然后在少量真实机器人数据上微调。仿真提供泛化所需的规模和多样性;人类演示提供部署所需的物理真实性。

能力

  • 在混合仿真+人类演示数据上联合预训练,采用域感知加权
  • MuJoCo 仿真管道大规模生成多样化操控轨迹
  • 真实机器人微调阶段仅需 80 次演示即可实现鲁棒迁移
  • 分布外泛化:在最少真实数据下,未见场景达到 62.5% 成功率
03工程挑战

为什么这很难

将仿真和人类数据合并到单一训练管道中需要解决多个耦合问题:

  1. 01域对齐:仿真观测和真实世界观测占据不同分布 — 简单混合会降低两者效果
  2. 02动作空间不匹配:MuJoCo 关节空间动作与人类遥操作笛卡尔命令需要统一表示
  3. 03课程设计:在预训练阶段何时加权仿真数据与人类数据以实现最大迁移效果
  4. 04微调稳定性:将协同训练的骨干网络适应到真实硬件,同时不灾难性遗忘仿真学到的多样性
  5. 05评估严格性:OOD 基准必须测试真正的泛化,而非记忆的仿真场景

CENTAUR 通过域感知数据混合、统一动作表示和针对最小真实数据需求优化的分阶段预训练→微调管道解决了这些问题。

04性能基准

协同训练性能

与纯真实和纯仿真基线的对比:

协同训练性能
指标数值
超越纯真实基线+40%
OOD 成功率62.5%
所需真实演示数80
仿真到现实改进倍数7.1×
05构建状态

已构建的功能

已完成 3/6 个组件
已构建的功能
组件状态说明
MuJoCo 训练循环已完成稳定的仿真轨迹生成,带域随机化
仿真轨迹生成器已完成在 MuJoCo 中大规模生成多样化操控轨迹
人类演示集成进行中混合数据训练的统一动作表示
真实机器人微调进行中带灾难性遗忘缓解的分阶段微调管道
核心模型已完成协同训练骨干在基准任务上已验证
API 层进行中训练任务提交和模型服务的 REST API
06应用场景

CENTAUR 部署场景

  • APP_01

    数据高效训练

    用 80 次真实演示代替数千次训练鲁棒的操控策略 — 仿真提供缺失的多样性。

  • APP_02

    仿真到现实迁移

    通过结合仿真规模和人类物理真实性的协同训练弥合现实差距,实现可靠的硬件部署。

  • APP_03

    小数据机器人

    在收集大型真实数据集不切实际的场景中实现新的机器人部署 — 初创企业、新型硬件、受限环境。