对比已发表论文
2.2×
- 100% 立方体抬升
- 179 测试
- 零训练
NAKA // 代码即策略
01瓶颈
问题
整个VLA领域都假设你需要10万次示范、一个十亿参数的策略模型,然后祈祷它能泛化。当它在新物体上失败时——它总是会失败——你重新训练。从"客户想要X"到"机器人能做X"需要数月时间。
VLA社区一直在优化错误的维度。瓶颈不是模型——而是模型必须包含行为的假设。
这种方式适用于谷歌。但不适用于其他所有人。
02范式转变
反转
当ANIMA遇到新任务时,NAKA不会搜索预训练策略。它实时用Python编写一个。
无需训练。无需微调。无需数据集收集。代码生成、视觉反馈和迭代。
from anima import azoth, ergon, haptos, prism
objects = azoth.detect(camera_image)
mug = [o for o in objects if o.label == "red mug"][0]
pose = ergon.estimate_pose(mug.crop, mug.depth)
grasp = compute_grasp(pose, gripper="parallel")
trajectory = ik_solve(grasp, current_joints)
robot.move(trajectory)
robot.close_gripper()
contact = haptos.verify_grasp()03验证性能
重要的结果
CaP-BENCH 对比 — PASS@1,50轮次
| 任务 | NAKA 最佳 | 论文 Gemini 3 Pro | 论文 人类专家 |
|---|---|---|---|
| cube_lift | 100% | 45% | 93% |
| cube_stack | 93% | 30% | 73% |
- 2.2×
- 对比CaP-X论文 cube_lift
- 2.7×
- 对比论文 cube_stack
- 100%
- cube_lift — 超越人类专家 (93%)
- 93%
- cube_stack — 超越人类专家 (73%)
- 187
- 可用操作任务
- 179
- 真实MuJoCo仿真通过测试
与CaP-X论文基准测试(NVIDIA + 伯克利 + 斯坦福 + CMU)
04系统架构
ANIMA 堆栈内部
NAKA是ANIMA堆栈中唯一使用所有其他模块的模块。它是一种全新的机器人构建方式的首要公民。
感知作为库
ABYSSOS、AZOTH、ERGON、SOL、HAPTOS、PRISM — 全部可作为库导入。按需场景理解。
from anima import *VLA策略作为API调用
MORPHEUS、PYGMALION、TITAN — NAKA生成代码中的可调用工具,而非机器人的控制器。
policy.infer()视觉差异反馈
前后帧驱动代码重写循环。机器人观察失败并重写自己的计划。
diff(frame_a, frame_b)技能库自动合成
成功的NAKA生成代码成为命名的、可重用的技能,供未来任务引用。
skills.register()
部署状态
生产就绪
- 超过已发表结果2倍以上。
- 超越人类专家基准。
- 零强化学习训练。
- 179项测试在真实MuJoCo仿真中通过。