跳至正文
RFL_GLOBAL
EN
  • 第五波 // 世界预测
  • DAEMON + PYGMALION
  • 零样本泛化

SIBYL

神谕者

SIBYL 不直接将观测映射到动作,而是先想象动作执行后世界的样子,然后生成实现预测结果的动作。复现 WoG(World of Generation):在潜在空间中预测未来世界状态以条件化动作生成。神谕者预见未来 — 策略紧随其后。

模块状态: 开发中

零样本泛化

PRED

部门
ANIMA
波次
W5
领域
操控
第五波 // ANIMA 套件
操控 — 面向动作的世界预测
SIBYL // W5 // 066/079
01核心挑战

直接观测→动作映射在新场景中失败

当前的操控策略将观测直接映射到动作。这在训练分布内有效,但在新物体、未见过的排列和意外场景配置中会严重失败。策略没有成功的内部模型 — 它只是重复学过的动作。

人类不是这样工作的。在伸手抓物体之前,你会想象结果 — 杯子在手中,盖子在盒子上。这种心理模拟引导你的动作。没有世界预测,机器人只是盲目的模式匹配器。它们需要一个在行动前预见未来的神谕者。

02解决方案

SIBYL 提供什么

SIBYL 在学习的潜在空间中预测未来世界状态,然后基于这些预测条件化动作生成。不是 obs→action,而是 obs→predicted_future→action。预测结果充当目标信号,引导在新环境中的操控。

能力

  • 潜在世界预测:编码当前状态,预测动作后的未来潜在状态
  • 动作条件化:生成实现预测结果的动作
  • 对新物体和场景配置的零样本泛化
  • 结果驱动策略:动作由成功的样子引导,而非记忆的轨迹
  • 可配置世界模型架构的广泛训练管线
  • 投资者演示导出,带有预测 vs 实际结果的可视化
03工程挑战

为什么这很难

面向动作条件化的世界预测是前沿研究问题,需要:

  1. 01潜在空间设计:世界模型必须将高维观测压缩到预测可行且对动作有意义的空间中
  2. 02时间一致性:预测的未来在多步视野上必须连贯,不能漂移或模式崩溃
  3. 03动作条件化:弥合抽象潜在预测与具体电机命令之间的差距
  4. 04训练稳定性:联合学习世界模型和动作生成器,互不崩溃
  5. 05泛化能力:潜在空间必须捕获任务相关结构,而非像素级记忆

SIBYL 通过两阶段架构解决这个问题:在潜在空间中预测结果,然后生成以该预测为条件的动作。神谕者预见 — 策略执行。

04性能基准

关键性能指标

在操控基准上测量:

关键性能指标
指标值详情
零样本泛化已启用通过结果预测处理新物体/场景 — 无需重新训练
潜在预测精度高世界模型在多步视野上忠实预测未来潜在状态
结果驱动动作已激活策略以预测未来为条件,而非记忆的轨迹
新场景处理稳健泛化到未见过的物体排列和工作空间配置
05构建状态

已构建的功能

已完成 4/6 个组件
已构建的功能
组件状态说明
潜在世界预测已完成编码当前状态 → 预测未来潜在状态
动作条件化已完成生成实现预测结果的动作
核心模型已完成世界模型 + 动作生成器 — 已训练和验证
演示导出已完成投资者演示带预测 vs 实际可视化
训练管线进行中可配置世界模型架构的广泛管线
API 层进行中REST + gRPC 推理端点 — 等待基础设施
06应用场景

SIBYL 部署场景

  • APP_01

    新物体操控

    抓取和操控训练中从未见过的物体 — 神谕者预测任何物体的成功样子。

  • APP_02

    预测性动作规划

    由预测的未来状态引导的多步操控序列,实现复杂的装配和重排任务。

  • APP_03

    大规模泛化

    部署一次,处理一切。零样本迁移到新场景、新物体和新工作空间配置,无需重新训练。

07技术

底层技术

基础:世界生成(WoG)

  • 潜在世界模型:将观测压缩到预测性潜在空间中
  • 未来状态预测:预测动作执行后世界的样子
  • 动作条件化:生成实现预测结果的电机命令
  • 两阶段推理:预测 → 行动(非直接 obs → action 映射)

核心创新

SIBYL 将"应该发生什么"与"如何实现"解耦。世界模型预测结果;动作生成器产生电机命令。这种分离实现了零样本泛化 — 为任何场景预测正确的未来,然后生成到达它的动作。

ANIMA 模块依赖

DAEMON
视觉轨迹提示为动作条件化提供轨迹引导
PYGMALION
具身基础模型提供观测编码骨干网络

部署架构

  • 可配置潜在维度的世界模型推理
  • 带预测结果条件化的动作生成器
  • 多 GPU 支持的训练管线
  • 可视化工具:预测 vs 实际结果对比