跳至正文
RFL_GLOBAL
EN
返回技术栈
第二梯队 — 硬件到达中7个模块7个集成模型100倍数据效率

ATHENA

一次演示即学会

给机器人展示一次任务。一次人类演示。87.8%准确率。传统方法需要100次演示才能达到57.2%。这是100倍的数据效率。

单次演示成功率

87.8%

梯队 2 // 04

演示: GENESIS → MONAD → AZOTH → DAEMON → ERGON // 执行: PYGMALION → CHIRON
01问题

机器人编程陷入困境

机器人学习每项新任务需要花费$5K–$50K的集成商时间。企业被锁定在系统集成商依赖中——数月的交付周期,僵化的程序在单个物体改变时就会崩溃。传统模仿学习每个任务需要100+次演示,准确率仅达57.2%。这种经济模式无法扩展。

$50K
每个新任务成本
100
当前所需演示次数
57.2%
传统方法准确率
02解决方案

演示一次·永久部署

ATHENA采用两阶段方法。第一阶段捕获单次人类演示——对场景进行高斯泼溅、分割物体、语言标注、追踪手部运动、估计6自由度姿态。第二阶段泛化执行:4.5亿参数的视觉-语言-动作模型将感知映射为动作,1kHz柔顺控制器确保机器人在真实世界中安全运行。

模块链:演示: GENESIS → MONAD → AZOTH → DAEMON → ERGON // 执行: PYGMALION → CHIRON

  1. 01第一阶段 — 演示捕获

    GENESIS

    3D高斯泼溅

    将演示场景重建为逼真的3D高斯场——一个可迁移的空间记忆,记录任务如何被执行。

  2. 02第一阶段 — 演示捕获

    MONAD

    分割与追踪

    以持久蒙版隔离场景中的每个物体。机器人知道什么移动了、什么被抓取了、什么保持不动。

  3. 03第一阶段 — 演示捕获

    AZOTH

    语言标注

    将每个分割区域关联到自然语言。不是"蒙版#12"而是"蓝色六角螺栓,M6,左托盘"。支持口头任务指定。

  4. 04第一阶段 — 演示捕获

    DAEMON

    运动轨迹

    从演示视频中提取完整的3D手部轨迹——机器人将复制的运动骨架。

  5. 05第一阶段 — 演示捕获

    ERGON

    6自由度姿态估计

    为每个被操作的物体计算精确的6自由度姿态。方向、位置、接近角度——全部捕获。

  6. 06第二阶段 — 执行与泛化

    PYGMALION

    4.5亿参数VLA策略

    4.5亿参数的视觉-语言-动作模型,将场景感知+语言指令映射为电机动作。泛化的大脑。

  7. 07第二阶段 — 执行与泛化

    CHIRON

    1kHz柔顺控制

    以1kHz运行的实时柔顺控制器。吸收接触力,适应物体变化,确保执行期间机器人安全。

03这意味着什么

对机器人产业的影响

这是机器人编程的iPhone时刻。不再需要花$50K雇集成商等三个月,车间主管只需给机器人演示一次任务。五分钟后即可运行。新产品变体?再演示一次。ATHENA将机器人部署从资本项目变成日常工作流。

  • 01单次学习:单次人类演示即达87.8%准确率
  • 02无需集成商——工厂员工直接教机器人
  • 03边缘可部署:4.5亿参数模型在设备端运行,无云依赖
04数据

关键数据

87.8%
单次演示准确率
100×
数据效率
5分钟
任务习得时间
$19B
可寻址市场
05市场

价值所在

价值所在
家用机器人$11B
小批量制造$5B
护理与辅助$3B
现场服务与维护$0.5B

护城河

一次演示。87.8%。高斯泼溅是可迁移的知识——一个任务如何被执行的3D记忆,能泛化到新物体和新场景。

一次演示。不是一百次。