- 第五波 // 世界预测
- DAEMON + PYGMALION
- 零样本泛化
SIBYL
神谕者
SIBYL 不直接将观测映射到动作,而是先想象动作执行后世界的样子,然后生成实现预测结果的动作。复现 WoG(World of Generation):在潜在空间中预测未来世界状态以条件化动作生成。神谕者预见未来 — 策略紧随其后。
模块状态: 开发中零样本泛化
PRED
- 部门
- ANIMA
- 波次
- W5
- 领域
- 操控
- 第五波 // ANIMA 套件
- 操控 — 面向动作的世界预测
SIBYL // W5 // 066/079
01核心挑战
直接观测→动作映射在新场景中失败
当前的操控策略将观测直接映射到动作。这在训练分布内有效,但在新物体、未见过的排列和意外场景配置中会严重失败。策略没有成功的内部模型 — 它只是重复学过的动作。
人类不是这样工作的。在伸手抓物体之前,你会想象结果 — 杯子在手中,盖子在盒子上。这种心理模拟引导你的动作。没有世界预测,机器人只是盲目的模式匹配器。它们需要一个在行动前预见未来的神谕者。
02解决方案
SIBYL 提供什么
SIBYL 在学习的潜在空间中预测未来世界状态,然后基于这些预测条件化动作生成。不是 obs→action,而是 obs→predicted_future→action。预测结果充当目标信号,引导在新环境中的操控。
能力
- 潜在世界预测:编码当前状态,预测动作后的未来潜在状态
- 动作条件化:生成实现预测结果的动作
- 对新物体和场景配置的零样本泛化
- 结果驱动策略:动作由成功的样子引导,而非记忆的轨迹
- 可配置世界模型架构的广泛训练管线
- 投资者演示导出,带有预测 vs 实际结果的可视化
03工程挑战
为什么这很难
面向动作条件化的世界预测是前沿研究问题,需要:
- 01潜在空间设计:世界模型必须将高维观测压缩到预测可行且对动作有意义的空间中
- 02时间一致性:预测的未来在多步视野上必须连贯,不能漂移或模式崩溃
- 03动作条件化:弥合抽象潜在预测与具体电机命令之间的差距
- 04训练稳定性:联合学习世界模型和动作生成器,互不崩溃
- 05泛化能力:潜在空间必须捕获任务相关结构,而非像素级记忆
SIBYL 通过两阶段架构解决这个问题:在潜在空间中预测结果,然后生成以该预测为条件的动作。神谕者预见 — 策略执行。
04性能基准
关键性能指标
在操控基准上测量:
| 指标 | 值 | 详情 |
|---|---|---|
| 零样本泛化 | 已启用 | 通过结果预测处理新物体/场景 — 无需重新训练 |
| 潜在预测精度 | 高 | 世界模型在多步视野上忠实预测未来潜在状态 |
| 结果驱动动作 | 已激活 | 策略以预测未来为条件,而非记忆的轨迹 |
| 新场景处理 | 稳健 | 泛化到未见过的物体排列和工作空间配置 |
05构建状态
已构建的功能
已完成 4/6 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 潜在世界预测 | 已完成 | 编码当前状态 → 预测未来潜在状态 |
| 动作条件化 | 已完成 | 生成实现预测结果的动作 |
| 核心模型 | 已完成 | 世界模型 + 动作生成器 — 已训练和验证 |
| 演示导出 | 已完成 | 投资者演示带预测 vs 实际可视化 |
| 训练管线 | 进行中 | 可配置世界模型架构的广泛管线 |
| API 层 | 进行中 | REST + gRPC 推理端点 — 等待基础设施 |
06应用场景
SIBYL 部署场景
- APP_01
新物体操控
抓取和操控训练中从未见过的物体 — 神谕者预测任何物体的成功样子。
- APP_02
预测性动作规划
由预测的未来状态引导的多步操控序列,实现复杂的装配和重排任务。
- APP_03
大规模泛化
部署一次,处理一切。零样本迁移到新场景、新物体和新工作空间配置,无需重新训练。
07技术
底层技术
基础:世界生成(WoG)
- 潜在世界模型:将观测压缩到预测性潜在空间中
- 未来状态预测:预测动作执行后世界的样子
- 动作条件化:生成实现预测结果的电机命令
- 两阶段推理:预测 → 行动(非直接 obs → action 映射)
核心创新
SIBYL 将"应该发生什么"与"如何实现"解耦。世界模型预测结果;动作生成器产生电机命令。这种分离实现了零样本泛化 — 为任何场景预测正确的未来,然后生成到达它的动作。
ANIMA 模块依赖
- DAEMON
- 视觉轨迹提示为动作条件化提供轨迹引导
- PYGMALION
- 具身基础模型提供观测编码骨干网络
部署架构
- 可配置潜在维度的世界模型推理
- 带预测结果条件化的动作生成器
- 多 GPU 支持的训练管线
- 可视化工具:预测 vs 实际结果对比