- RSS 2025 // ROBOSPLAT
- 1 次演示 → 87.8% 成功
- 100 倍数据效率
GENESIS
形态之源
学习操控技能传统上需要每个任务 50-300 次演示。GENESIS 通过高斯溅射从一次演示重建完整的 3D 场景,生成 50 个新视角,训练出的策略实现 87.8% 的成功率 — 仅从单次演示。100 倍数据效率。
模块状态: 运行中单次演示成功率
87.8%
- 部门
- ANIMA
- 波次
- W3
- 领域
- 理解
- 第四波 // ANIMA 套件
- 高斯溅射
GENESIS // W3 // 027/079
01核心挑战
数百次演示无法规模化
学习机器人操控技能传统上需要每个任务 50-300 次演示。收集数百个视频既昂贵又耗时,且无法规模化。然而机器人只看到一个人展示一次任务。如何从最少数据中提取最大信息?
大多数操控学习忽略了多视角图像中丰富的 3D 几何信息。我们重建 3D 场景,然后丢弃结构,仅在 2D 像素空间上训练策略。这是巨大的信息损失。几何信息就在那里 — 我们只需要利用它。
02解决方案
GENESIS 提供什么
GENESIS 实现 RoboSplat:通过 3D 高斯溅射,一次人类演示变成无限的训练视角。
流程
- 01使用 100,000+ 高斯从多视角图像重建 3D 场景
- 02通过操控高斯并重新渲染生成 50 个新演示
- 03在增强演示上训练轻量级 CNN 策略
- 04在新物体位姿和光照下以 87.8% 成功率执行
能力
- 3D 高斯溅射:从多视角 RGB 进行可微分场景重建
- 球谐函数(3 阶)用于视角相关颜色渲染
- 基于中心的物体分割用于操控感知增强
- 场景重建:5-10 分钟,增强:1-2 分钟
- 策略推理:每帧 50-100ms,M5 上约 40ms(MLX)
- 完整 REST API:/reconstruct、/augment、/predict、/scene/{id}
03工程挑战
为什么这很难
用于机器人的 3D 高斯溅射需要解决三个交织的问题:
- 01场景重建:优化 100,000+ 高斯以匹配多视角 RGB,同时保留抓取所需的精细细节
- 02演示增强:识别物体高斯,应用真实操控,从扰动视角重新渲染
- 03策略学习:在增强演示上训练轻量级网络,使其泛化到新位姿和光照
- 04可微分渲染:基于瓦片的光栅化,具有高效的梯度计算
- 05物体分割:在高斯云中基于中心识别可操控物体
GENESIS 通过可微分 3D 高斯渲染、基于中心的物体分割和迭代优化实现了这一点。一次演示 → 50 个增强视角 → 可泛化的策略。
04性能基准
真实硬件性能
RoboSplat 在真实操控任务上验证:
| 指标 | 数值 |
|---|---|
| 单次演示成功率 | 87.8% |
| 传统方法(100 次演示) | 57.2% |
| 传统方法(1 次演示) | 12.4% |
| 数据效率提升 | 100 倍更少演示 |
| 场景重建时间 | 5-10 分钟 |
| 增强时间(50 次演示) | 1-2 分钟 |
| 策略训练时间 | 30-60 秒 |
| 推理时间(GPU) | 每帧 50-100ms |
| 推理时间(Apple M5) | 每帧约 40ms(4 倍 M1) |
| 场景高斯数 | 约 100,000 |
| SH 阶数 | 3(视角相关颜色) |
05构建状态
已构建的功能
已完成 9/12 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | Gaussian3D + 渲染器 + 增强器 — 生产就绪权重 |
| Gaussian3D 表示 | 已完成 | 位置、旋转、缩放、不透明度、SH 系数 |
| 高斯渲染器 | 已完成 | 基于瓦片的光栅化,视角相关 SH,可微分 |
| 场景重建器 | 已完成 | 多视角优化,迭代细化 |
| 演示增强器 | 已完成 | 物体识别、操控、重新渲染 |
| 操控策略 | 已完成 | 轻量级 CNN(RGB → 7D 动作) |
| FastAPI 服务器 | 已完成 | /reconstruct、/augment、/predict、/scene/{id} |
| Docker 部署 | 已完成 | 多容器,含 Prometheus/Grafana |
| 本地引导 | 已完成 | MacBook 摄像头捕获 + 棋盘标定 |
| API 层 | 进行中 | 公共 REST + gRPC API — 等待数据集基础设施 |
| 完整论文复现 | 进行中 | 多视角 3DGS,硬件 ZED 集成计划中 |
| ROS2 集成 | 计划中 | 基于主题的场景/动作流 |
06应用场景
GENESIS 部署场景
- APP_01
操控研究
100 倍更快的技能学习 — 从一次演示到可用策略只需几分钟。
- APP_02
工厂自动化
以最少的人类演示收集实现快速任务部署。
- APP_03
协作机器人
单次人类演示 → 策略转移到多台协作机器人。
- APP_04
操控创业公司
降低昂贵操控任务的数据收集风险。更快交付。
- APP_05
小样本学习
单次和少样本模仿学习研究的基准。
- APP_06
数字孪生
3D 高斯溅射用于照片级真实场景重建和仿真。
07技术
底层技术
基础:ROBOSPLAT(RSS 2025)
- 3D 高斯溅射:用于照片级真实 3D 场景的可微分渲染器
- 球谐函数 3 阶用于视角相关颜色渲染
- 基于瓦片的光栅化:大规模高效梯度计算
- 基于中心的物体分割:在高斯云中识别可操控物体
- 通过变换增强:采样新位姿,重新渲染演示
单次流水线
- 多视角 RGB 捕获 → 3D 高斯溅射场景重建
- 物体分割 → 高斯操控(平移 + 旋转)
- 从 50 个新视角重新渲染 → 增强演示数据集
- 训练轻量级 CNN 策略(RGB → 7D 动作),30-60 秒
多设备运行时
- CUDA
- NVIDIA GPU(RTX 4090、A100)— 完整可微分渲染,50-100ms
- MLX
- Apple Silicon(M1–M5)— 推理,M5 上约 40ms(4 倍 M1)
- CPU
- 回退 — 重建和推理,较慢
08论文
研究论文
- [01]RoboSplat:通过高斯溅射实现单次操控的新型演示生成 — OpenRobotLab,RSS 2025