- FUSIONSENSE // ICRA 2025
- 跨模态
- 触觉融合
TACTIS
感知之触
仅靠视觉无法重建相机看不到的表面:夹持器内部、遮挡手指下方、高光材料。TACTIS 将 RGB-D 视觉与触觉传感器数据融合为习得的跨模态表征,实现抓取和操纵过程中的实时 3D 重建。基于 FusionSense(ICRA 2025)。
模块状态: 运行中视觉 + 触觉 // 融合
SUB-MM
- 部门
- ANIMA
- 波次
- W3
- 领域
- 基础
- 第三波 // ANIMA 套件
- 视觉-触觉融合
TACTIS // W3 // 073/079
01核心挑战
视觉无法感触
仅靠视觉无法重建相机看不到的表面:夹持器内部、遮挡手指下方、令 RGB-D 传感器失明的高光材料。触觉传感器揭示视觉遗漏的几何形状,但需要接触 — 缓慢且可能危险。
结合视觉与触觉可实现快速、安全、精细的重建。但学习融合表征需要操纵配对训练数据(昂贵)和新架构(视觉特征 ≠ 触觉特征)。TACTIS 解决了这个问题。
02解决方案
TACTIS 提供什么
TACTIS 是基于 FusionSense(ICRA 2025)的容器化视觉-触觉融合重建服务。融合视觉 + 触觉,重建遮挡表面,量化材料属性。
流程
- 01融合视觉与触觉 — 从 RGB-D + 触觉传感器学习共享 3D 表征
- 02重建遮挡区域 — 从触觉反馈预测隐藏几何
- 03量化材料属性 — 推断刚度、摩擦力和可变形性
- 04灵活输出 — 网格、点云或符号距离场
能力
- 跨模态学习基于抓取和操纵轨迹的对比学习→ 从原始多模态传感器数据端到端融合
- 设备灵活性MLX Apple Silicon(M1–M5,M5 约 50ms,4 倍 M1)+ CUDA + CPU→ 随处运行:笔记本、工作站、机器人
- 实时 APIREST + gRPC API 实现控制回路中的实时多模态融合→ 亚 50ms 延迟用于在线决策
03工程挑战
为什么这很难
视觉和触觉在不同尺度和模态下运行 — 融合它们本质上很困难:
- 01RGB 图像有数百万像素;触觉阵列只有数十到数百个传感器 — 完全不同的尺度
- 02跨模态嵌入:学习视觉和触觉观测对齐的共享潜在空间
- 03操纵轨迹上的对比学习需要仔细的数据收集和对齐
- 04机器人控制回路中的实时推理 — 不允许批处理,需要亚 50ms
- 05支持多样化的触觉硬件:GelSight、电容阵列、力/力矩传感器
FusionSense 使用操纵轨迹上的对比学习端到端训练该嵌入。TACTIS 通过适当的设备抽象和实时 API 使其可部署。
04性能基准
真实硬件性能
使用 FusionSense 跨模态管线测量:
| 指标 | 数值 |
|---|---|
| 融合延迟 | 约 50ms(M5 MLX),约 15ms(RTX 4090) |
| Apple M5(MLX) | 每步约 50ms(4 倍 M1) |
| 表面分辨率 | 触觉亚毫米级 |
| 输出格式 | 网格、点云、SDF |
| 材料属性 | 刚度、摩擦力、可变形性 |
| 触觉传感器 | GelSight、Xela uSkin、Weiss、ATI |
| 视觉输入 | RGB-D 相机 |
| 学习方法 | 跨模态对比 |
05构建状态
已构建的功能
已完成 9/10 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 核心模型 | 已完成 | FusionSense 跨模态管线,生产就绪 |
| API 层 | 进行中 | 公共 API,待数据集基础设施 |
| REST API | 已完成 | FastAPI 多模态输入模式 |
| gRPC 服务 | 已完成 | Protobuf 视觉-触觉协议 |
| 视觉骨干 | 已完成 | RGB-D 特征提取 |
| 触觉编码器 | 已完成 | 触觉阵列嵌入 |
| 跨模态融合 | 已完成 | 习得共享表征 |
| 表面重建 | 已完成 | 网格、点云、SDF 生成 |
| 材料推理 | 已完成 | 刚度和摩擦力预测 |
| 质量门禁 | 已完成 | ruff、pytest、mypy 通过 |
06应用场景
TACTIS 部署场景
- APP_01
灵巧操纵
复杂抓取和手内重新定位,实时表面重建用于自适应握力控制。
- APP_02
假肢与康复
精细的手-物体反馈,实现自然交互和精确力调制。
- APP_03
食品与易碎品
夹持力精确控制用于精密物品 — 无损伤水果处理和玻璃操纵。
- APP_04
装配自动化
装配过程中的高精度接触检测 — 来自触觉反馈的亚毫米级对齐。
- APP_05
触觉遥操作
远程操作的精细表面模型 — 操作员感受机器人触摸的一切。
- APP_06
手术机器人
精细手术的触觉反馈 — 实时组织刚度和变形映射。
07技术
底层技术
基础:FUSIONSENSE(ICRA 2025)
- 面向操纵感知的视觉-触觉融合 3D 重建
- 基于抓取任务的跨模态对比学习
- Apache-2.0 许可的参考实现
- 端到端习得的共享潜在空间
TACTIS 实现
- FastAPI REST 支持 RGB-D + 触觉传感器输入模式
- gRPC 实现实时多模态融合
- 设备抽象:MLX → CUDA → CPU
- 视觉骨干:用于深度/RGB 的 CNN 或 ViT
- 触觉编码器:密集触觉阵列处理
集成接口
- 从 NEXUS(语义理解)消费操纵器状态
- 向下游抓取规划提供表面几何
- 向 HARMONIA(传感器加权)反馈重建置信度
触觉硬件
- GelSight 光学触觉传感器
- 电容阵列(Xela uSkin、Weiss Robotics)
- 力/力矩传感器(ATI、JR3)
- 自定义模态通过传感器标定协议
08论文
研究基础
- [01]FusionSense — 面向操纵 3D 重建的视觉-触觉融合(ICRA 2025)