- 第五波 // 开发中
- 评估
- 认证
MNEMOSYNE
VLA记忆基准
机器人策略的标准化记忆评估框架(RoboMME基准)。评估场景回忆、时序推理、空间记忆和多步跟踪,涵盖16个任务类别。生成投资者安全的认证报告,包含论文基线对比。
模块状态: 开发中所有VLA模型
16
- 部门
- ANIMA
- 波次
- W5
- 领域
- 仿真
- 第五波 // ANIMA 套件
- 评估 — VLA记忆基准
MNEMOSYNE // W5 // 047/079
01核心挑战
无法衡量就无法改进
机器人VLA模型声称具有记忆能力——场景理解、时序推理、空间感知——但没有标准化方法来验证这些声明。每个团队使用不同的基准、不同的指标和不同的评估条件。结果无法比较。
没有严格评估,你无法区分真正记忆的模型和模式匹配的模型。投资者得到无法验证的声明,团队在部署时失败的模型上浪费数月,该领域缺乏系统性进步所需的共享基准。MNEMOSYNE提供缺失的度量标准。
02解决方案
MNEMOSYNE 提供什么
MNEMOSYNE是一个标准化评估框架,在16个任务类别中测试VLA记忆能力。它产生可复现的基准分数,与已发表的基线进行比较,并生成认证报告,让投资者和部署者对模型能力充满信心。
流程
- 01任务注册表 — 16个标准化评估任务,覆盖场景回忆、时序推理、空间记忆和多步跟踪
- 02评估框架 — 自动测试执行,具有受控条件、确定性环境和可复现评分
- 03基线比较 — 结果与已发表的论文基线和领先VLA模型进行比较,进行相对定位
- 04认证导出 — 投资者安全的报告,包含基准分数、比较分析和能力验证
能力
- 场景回忆测试记忆和回忆先前观察到的场景元素的能力→ 对需要返回先前状态或多房间导航的任务至关重要
- 时序推理评估对事件序列、时间和因果链的理解→ 对动作顺序决定成功的多步操纵至关重要
- 空间记忆测量物体位置、空间关系和环境布局的保持→ 涉及精确物体放置和检索的操纵任务所必需
- 多步跟踪测试在扩展动作序列中维持状态的能力→ 验证长时域能力——VLA模型最困难的记忆挑战
03工程挑战
为什么这很难
构建一个真正衡量记忆而非模式匹配的基准需要仔细设计:
- 01任务隔离:每个测试必须隔离特定的记忆能力,不与感知、规划或运动技能混淆
- 02可复现性:评估条件必须是确定性的——相同模型、相同测试、相同分数——跨硬件和时间
- 03基线公平性:与已发表结果的比较需要匹配其精确条件,而不仅仅是数字
- 04防作弊:测试必须抵御通过记忆基准特定模式而非真正记忆获得高分的模型
- 05认证严格性:报告必须经得起投资者尽职调查——方法论、统计显著性和失败模式分析
MNEMOSYNE通过同行评审的任务注册表、受控评估环境、评分的统计严谨性,以及确保基准分数反映真正记忆能力的防记忆保障措施来处理此问题。
04性能基准
系统性能
跨RoboMME评估框架测量:
| 指标 | 数值 |
|---|---|
| 任务注册表 | 16个标准化评估任务 |
| 基准质量 | 可复现——确定性评分 |
| 认证导出 | 包含基线的投资者安全报告 |
| 基线比较 | 包含已发表的论文基准 |
05构建状态
已构建的功能
已完成 4/6 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 任务注册表 | 已完成 | 16个评估任务已定义,包含评分标准 |
| 评估框架 | 已完成 | 具有确定性条件的自动测试执行 |
| 基线比较 | 进行中 | 正在集成已发表的论文基线用于相对评分 |
| 认证导出 | 已完成 | 报告生成,包含基准分数和分析 |
| 核心模型 | 已完成 | 评估管线已针对所有VLA模型测试 |
| API层 | 进行中 | 用于外部模型评估提交的公共API |
06应用场景
MNEMOSYNE 部署场景
- APP_01
模型认证
部署前认证VLA模型——标准化基准分数让部署者确信记忆能力满足目标应用的要求。
- APP_02
研究比较
使用共享基准比较跨模型的记忆能力——消除困扰当前VLA评估的不可比较性。
- APP_03
投资者尽职调查
产生严格的、第三方可验证的基准报告——投资者得到标准化分数,而非精心挑选的演示和无法验证的声明。
07技术
底层技术
基础:ROBOMME基准
- 跨4个记忆能力类别的16个标准化评估任务
- 可复现评分的确定性评估环境
- 统计严谨性:置信区间、显著性检验、效应量
- 带动态任务变体的防记忆保障措施
MNEMOSYNE 实现
- 具有版本化评估协议和评分标准的任务注册表
- 执行受控测试序列并完整记录的自动框架
- 包含已发表论文结果的基线数据库用于比较分析
- 生成投资者级认证文件的报告生成器
ANIMA模块集成
- 在ANIMA套件中开发的所有VLA模型进行评估
- 基准结果反馈到模型改进管线中
- 认证门控控制哪些模型进入部署
评估规格
- 16个任务类别
- 4个记忆维度
- 确定性评分
- 论文基线数据库
- 投资者安全报告
- 防作弊保障
08论文
研究基础
- [01]RoboMME基准——具有可复现评分和认证导出的机器人策略标准化记忆评估框架