- 第五波 // 开发中
- 世界模型
- 动力学感知
TITAN
世界模型VLA
GigaBrain-0.5M架构:预训练世界模型预测环境动力学,VLA策略以世界模型预测为条件,收集展开用于改进,人在回路校正。世界模型提供动力学先验,提高样本效率和长时域推理。
模块状态: 开发中PYGMALION + ATOMOS
世界
- 部门
- ANIMA
- 波次
- W5
- 领域
- 操控
- 第五波 // ANIMA 套件
- 操纵 — 世界模型VLA
TITAN // W5 // 075/079
01核心挑战
没有物理的策略是盲目的
标准VLA策略将观测直接映射到动作,而没有任何世界运作模型。它们无法预测推动物体时会发生什么,无法预期物理规律,必须通过昂贵的试错从零学习每个因果关系。
这种缺乏世界理解意味着样本效率低下 — 孩子几分钟就能学会的任务需要数千次演示。长时域任务使问题更加严重:没有动力学预测,每一步都在累积不确定性。TITAN为VLA策略提供了一个可推理的世界模型。
02解决方案
TITAN 提供什么
TITAN以预训练的世界模型为条件来预测环境动力学。世界模型提供物理先验,VLA策略基于预测的未来生成动作,展开细化两者,人工校正闭合回路。
流程
- 01世界模型预训练 — 从观测数据学习环境动力学,根据当前状态和动作预测未来状态
- 02VLA条件化 — 策略网络接收世界模型预测作为额外上下文,将动作扎根于预测的物理中
- 03展开收集 — 自主和引导的展开为世界模型和策略生成改进数据
- 04人在回路校正 — 专家对预测轨迹的校正细化世界模型精度和策略行为
能力
- 世界模型条件化VLA策略以PYGMALION预测的环境动力学为条件→ 动作扎根于物理预测,而非盲目模式匹配
- 样本高效学习世界模型提供动力学先验,减少演示需求→ 比端到端方法需要更少的演示学习复杂操纵
- 长时域推理通过ATOMOS时间建模经由预测的未来状态进行多步规划→ 通过物理感知预测在延长时间范围内链接动作
- 人工校正回路专家对预测轨迹的反馈细化世界模型和策略→ 从人类专业知识持续改进,无需完全重新训练
03工程挑战
为什么这很难
在世界模型上条件化VLA创造了复合复杂性:
- 01世界模型必须足够精确才有用,但不能复杂到成为瓶颈
- 02条件化接口:VLA必须消费世界模型预测而不依赖其准确性
- 03预测范围权衡:更长的预测能更好地规划但指数级积累误差
- 04展开分布偏移:自生成数据偏离人工演示,需要仔细混合
- 05人工校正必须高效 — 专家校正轨迹预测,而非原始模型权重
TITAN通过模块化架构处理这个问题:世界模型(PYGMALION)和时间推理(ATOMOS)是具有清晰接口的独立组件,允许各自独立改进,同时条件化机制保持稳定。
04性能基准
系统性能
跨世界模型条件化管线测量:
| 指标 | 数值 |
|---|---|
| 世界模型条件化 | 策略扎根于动力学预测 |
| 样本效率 | 通过动力学先验改进 — 需要更少演示 |
| 长时域推理 | 通过预测的未来进行多步规划 |
| 物理理解 | 用于操纵的习得动力学模型 |
05构建状态
已构建的功能
已完成 2/6 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 世界模型预训练 | 已完成 | GigaBrain-0.5M动力学模型在操纵数据上训练 |
| VLA条件化 | 进行中 | 策略-世界模型接口正在细化 |
| 展开收集 | 进行中 | 带质量过滤的自主展开管线 |
| 人工校正回路 | 计划中 | 专家校正界面设计完成 |
| 核心模型 | 已完成 | 世界模型和基础VLA生产就绪 |
| API层 | 进行中 | 公共API,待数据集基础设施 |
06应用场景
TITAN 部署场景
- APP_01
长时域规划
需要预测动作后果的多步操纵任务 — 装配、烹饪、工具使用 — 物理理解减少失败。
- APP_02
样本高效学习
从最少演示学习新的操纵技能 — 世界模型填补原本需要数千个示例的物理知识。
- APP_03
物理感知操纵
涉及动态交互的任务 — 倒入、推动、堆叠 — 预测物体动力学对成功执行至关重要。
07技术
底层技术
基础:GIGABRAIN-0.5M架构
- 在操纵观测数据上预训练的世界模型
- 动力学预测:当前状态 + 动作 → 预测下一状态
- VLA策略以世界模型潜在表征为条件
- 通过展开收集和人工校正进行迭代细化
TITAN 实现
- 世界模型:PYGMALION视频生成骨干适配动力学预测
- 时间推理:ATOMOS序列建模用于多步未来状态预测
- 条件化接口:世界模型潜在量通过交叉注意力注入VLA策略
- 展开管线:带质量评分和分布跟踪的自动收集
ANIMA模块集成
- PYGMALION提供动力学预测的世界模型骨干
- ATOMOS提供长时域推理的时间序列建模
- 组合为用于操纵规划的世界模型条件化VLA
架构规格
- 世界模型:0.5M参数动力学预测器
- 条件化:交叉注意力潜在量注入
- 展开:质量过滤的自动收集
- 校正:人工轨迹标注界面
08论文
研究基础
- [01]GigaBrain启发的世界模型条件化VLA — 具有人在回路细化的动力学感知策略学习