跳至正文
RFL_GLOBAL
EN
  • RSS 2025 // ROBOSPLAT
  • 1 次演示 → 87.8% 成功
  • 100 倍数据效率

GENESIS

形态之源

学习操控技能传统上需要每个任务 50-300 次演示。GENESIS 通过高斯溅射从一次演示重建完整的 3D 场景,生成 50 个新视角,训练出的策略实现 87.8% 的成功率 — 仅从单次演示。100 倍数据效率。

模块状态: 运行中

单次演示成功率

87.8%

部门
ANIMA
波次
W3
领域
理解
第四波 // ANIMA 套件
高斯溅射
GENESIS // W3 // 027/079
01核心挑战

数百次演示无法规模化

学习机器人操控技能传统上需要每个任务 50-300 次演示。收集数百个视频既昂贵又耗时,且无法规模化。然而机器人只看到一个人展示一次任务。如何从最少数据中提取最大信息?

大多数操控学习忽略了多视角图像中丰富的 3D 几何信息。我们重建 3D 场景,然后丢弃结构,仅在 2D 像素空间上训练策略。这是巨大的信息损失。几何信息就在那里 — 我们只需要利用它。

02解决方案

GENESIS 提供什么

GENESIS 实现 RoboSplat:通过 3D 高斯溅射,一次人类演示变成无限的训练视角。

流程

  1. 01使用 100,000+ 高斯从多视角图像重建 3D 场景
  2. 02通过操控高斯并重新渲染生成 50 个新演示
  3. 03在增强演示上训练轻量级 CNN 策略
  4. 04在新物体位姿和光照下以 87.8% 成功率执行

能力

  • 3D 高斯溅射:从多视角 RGB 进行可微分场景重建
  • 球谐函数(3 阶)用于视角相关颜色渲染
  • 基于中心的物体分割用于操控感知增强
  • 场景重建:5-10 分钟,增强:1-2 分钟
  • 策略推理:每帧 50-100ms,M5 上约 40ms(MLX)
  • 完整 REST API:/reconstruct、/augment、/predict、/scene/{id}
03工程挑战

为什么这很难

用于机器人的 3D 高斯溅射需要解决三个交织的问题:

  1. 01场景重建:优化 100,000+ 高斯以匹配多视角 RGB,同时保留抓取所需的精细细节
  2. 02演示增强:识别物体高斯,应用真实操控,从扰动视角重新渲染
  3. 03策略学习:在增强演示上训练轻量级网络,使其泛化到新位姿和光照
  4. 04可微分渲染:基于瓦片的光栅化,具有高效的梯度计算
  5. 05物体分割:在高斯云中基于中心识别可操控物体

GENESIS 通过可微分 3D 高斯渲染、基于中心的物体分割和迭代优化实现了这一点。一次演示 → 50 个增强视角 → 可泛化的策略。

04性能基准

真实硬件性能

RoboSplat 在真实操控任务上验证:

真实硬件性能
指标数值
单次演示成功率87.8%
传统方法(100 次演示)57.2%
传统方法(1 次演示)12.4%
数据效率提升100 倍更少演示
场景重建时间5-10 分钟
增强时间(50 次演示)1-2 分钟
策略训练时间30-60 秒
推理时间(GPU)每帧 50-100ms
推理时间(Apple M5)每帧约 40ms(4 倍 M1)
场景高斯数约 100,000
SH 阶数3(视角相关颜色)
05构建状态

已构建的功能

已完成 9/12 个组件
已构建的功能
组件状态说明
核心模型已完成Gaussian3D + 渲染器 + 增强器 — 生产就绪权重
Gaussian3D 表示已完成位置、旋转、缩放、不透明度、SH 系数
高斯渲染器已完成基于瓦片的光栅化,视角相关 SH,可微分
场景重建器已完成多视角优化,迭代细化
演示增强器已完成物体识别、操控、重新渲染
操控策略已完成轻量级 CNN(RGB → 7D 动作)
FastAPI 服务器已完成/reconstruct、/augment、/predict、/scene/{id}
Docker 部署已完成多容器,含 Prometheus/Grafana
本地引导已完成MacBook 摄像头捕获 + 棋盘标定
API 层进行中公共 REST + gRPC API — 等待数据集基础设施
完整论文复现进行中多视角 3DGS,硬件 ZED 集成计划中
ROS2 集成计划中基于主题的场景/动作流
06应用场景

GENESIS 部署场景

  • APP_01

    操控研究

    100 倍更快的技能学习 — 从一次演示到可用策略只需几分钟。

  • APP_02

    工厂自动化

    以最少的人类演示收集实现快速任务部署。

  • APP_03

    协作机器人

    单次人类演示 → 策略转移到多台协作机器人。

  • APP_04

    操控创业公司

    降低昂贵操控任务的数据收集风险。更快交付。

  • APP_05

    小样本学习

    单次和少样本模仿学习研究的基准。

  • APP_06

    数字孪生

    3D 高斯溅射用于照片级真实场景重建和仿真。

07技术

底层技术

基础:ROBOSPLAT(RSS 2025)

  • 3D 高斯溅射:用于照片级真实 3D 场景的可微分渲染器
  • 球谐函数 3 阶用于视角相关颜色渲染
  • 基于瓦片的光栅化:大规模高效梯度计算
  • 基于中心的物体分割:在高斯云中识别可操控物体
  • 通过变换增强:采样新位姿,重新渲染演示

单次流水线

  • 多视角 RGB 捕获 → 3D 高斯溅射场景重建
  • 物体分割 → 高斯操控(平移 + 旋转)
  • 从 50 个新视角重新渲染 → 增强演示数据集
  • 训练轻量级 CNN 策略(RGB → 7D 动作),30-60 秒

多设备运行时

CUDA
NVIDIA GPU(RTX 4090、A100)— 完整可微分渲染,50-100ms
MLX
Apple Silicon(M1–M5)— 推理,M5 上约 40ms(4 倍 M1)
CPU
回退 — 重建和推理,较慢
08论文

研究论文

  1. [01]RoboSplat:通过高斯溅射实现单次操控的新型演示生成 — OpenRobotLab,RSS 2025