跳至正文
RFL_GLOBAL
EN
  • FUSIONSENSE // ICRA 2025
  • 跨模态
  • 触觉融合

TACTIS

感知之触

仅靠视觉无法重建相机看不到的表面:夹持器内部、遮挡手指下方、高光材料。TACTIS 将 RGB-D 视觉与触觉传感器数据融合为习得的跨模态表征,实现抓取和操纵过程中的实时 3D 重建。基于 FusionSense(ICRA 2025)。

模块状态: 运行中

视觉 + 触觉 // 融合

SUB-MM

部门
ANIMA
波次
W3
领域
基础
第三波 // ANIMA 套件
视觉-触觉融合
TACTIS // W3 // 073/079
01核心挑战

视觉无法感触

仅靠视觉无法重建相机看不到的表面:夹持器内部、遮挡手指下方、令 RGB-D 传感器失明的高光材料。触觉传感器揭示视觉遗漏的几何形状,但需要接触 — 缓慢且可能危险。

结合视觉与触觉可实现快速、安全、精细的重建。但学习融合表征需要操纵配对训练数据(昂贵)和新架构(视觉特征 ≠ 触觉特征)。TACTIS 解决了这个问题。

02解决方案

TACTIS 提供什么

TACTIS 是基于 FusionSense(ICRA 2025)的容器化视觉-触觉融合重建服务。融合视觉 + 触觉,重建遮挡表面,量化材料属性。

流程

  1. 01融合视觉与触觉 — 从 RGB-D + 触觉传感器学习共享 3D 表征
  2. 02重建遮挡区域 — 从触觉反馈预测隐藏几何
  3. 03量化材料属性 — 推断刚度、摩擦力和可变形性
  4. 04灵活输出 — 网格、点云或符号距离场

能力

  • 跨模态学习基于抓取和操纵轨迹的对比学习→ 从原始多模态传感器数据端到端融合
  • 设备灵活性MLX Apple Silicon(M1–M5,M5 约 50ms,4 倍 M1)+ CUDA + CPU→ 随处运行:笔记本、工作站、机器人
  • 实时 APIREST + gRPC API 实现控制回路中的实时多模态融合→ 亚 50ms 延迟用于在线决策
03工程挑战

为什么这很难

视觉和触觉在不同尺度和模态下运行 — 融合它们本质上很困难:

  1. 01RGB 图像有数百万像素;触觉阵列只有数十到数百个传感器 — 完全不同的尺度
  2. 02跨模态嵌入:学习视觉和触觉观测对齐的共享潜在空间
  3. 03操纵轨迹上的对比学习需要仔细的数据收集和对齐
  4. 04机器人控制回路中的实时推理 — 不允许批处理,需要亚 50ms
  5. 05支持多样化的触觉硬件:GelSight、电容阵列、力/力矩传感器

FusionSense 使用操纵轨迹上的对比学习端到端训练该嵌入。TACTIS 通过适当的设备抽象和实时 API 使其可部署。

04性能基准

真实硬件性能

使用 FusionSense 跨模态管线测量:

真实硬件性能
指标数值
融合延迟约 50ms(M5 MLX),约 15ms(RTX 4090)
Apple M5(MLX)每步约 50ms(4 倍 M1)
表面分辨率触觉亚毫米级
输出格式网格、点云、SDF
材料属性刚度、摩擦力、可变形性
触觉传感器GelSight、Xela uSkin、Weiss、ATI
视觉输入RGB-D 相机
学习方法跨模态对比
05构建状态

已构建的功能

已完成 9/10 个组件
已构建的功能
组件状态说明
核心模型已完成FusionSense 跨模态管线,生产就绪
API 层进行中公共 API,待数据集基础设施
REST API已完成FastAPI 多模态输入模式
gRPC 服务已完成Protobuf 视觉-触觉协议
视觉骨干已完成RGB-D 特征提取
触觉编码器已完成触觉阵列嵌入
跨模态融合已完成习得共享表征
表面重建已完成网格、点云、SDF 生成
材料推理已完成刚度和摩擦力预测
质量门禁已完成ruff、pytest、mypy 通过
06应用场景

TACTIS 部署场景

  • APP_01

    灵巧操纵

    复杂抓取和手内重新定位,实时表面重建用于自适应握力控制。

  • APP_02

    假肢与康复

    精细的手-物体反馈,实现自然交互和精确力调制。

  • APP_03

    食品与易碎品

    夹持力精确控制用于精密物品 — 无损伤水果处理和玻璃操纵。

  • APP_04

    装配自动化

    装配过程中的高精度接触检测 — 来自触觉反馈的亚毫米级对齐。

  • APP_05

    触觉遥操作

    远程操作的精细表面模型 — 操作员感受机器人触摸的一切。

  • APP_06

    手术机器人

    精细手术的触觉反馈 — 实时组织刚度和变形映射。

07技术

底层技术

基础:FUSIONSENSE(ICRA 2025)

  • 面向操纵感知的视觉-触觉融合 3D 重建
  • 基于抓取任务的跨模态对比学习
  • Apache-2.0 许可的参考实现
  • 端到端习得的共享潜在空间

TACTIS 实现

  • FastAPI REST 支持 RGB-D + 触觉传感器输入模式
  • gRPC 实现实时多模态融合
  • 设备抽象:MLX → CUDA → CPU
  • 视觉骨干:用于深度/RGB 的 CNN 或 ViT
  • 触觉编码器:密集触觉阵列处理

集成接口

  • 从 NEXUS(语义理解)消费操纵器状态
  • 向下游抓取规划提供表面几何
  • 向 HARMONIA(传感器加权)反馈重建置信度

触觉硬件

  • GelSight 光学触觉传感器
  • 电容阵列(Xela uSkin、Weiss Robotics)
  • 力/力矩传感器(ATI、JR3)
  • 自定义模态通过传感器标定协议
08论文

研究基础

  1. [01]FusionSense — 面向操纵 3D 重建的视觉-触觉融合(ICRA 2025)