GelSight Mini 富接触任务实战:OmniTacTune用”手感”搞定充电头插入与开瓶盖
近日,马里兰大学与佐治亚理工学院联合推出全新真实世界触觉残差强化学习框架 OmniTacTune,依托 GelSight Mini 视触觉传感器完成真机验证,相关研究论文已对外公开。

一、研究背景:纯视觉机器人难以完成精密接触操作
当前依托人类视频、VR 遥操作数据训练的各类视觉机器人策略,虽可完成大范围抓取、全局运动规划,但在插销装配、充电器插接、开瓶盖、薄边开箱等接触密集任务中表现不佳。 仅依靠相机无法捕捉接触力、物体微小形变、接触面滑移等微观物理信息,论文实测显示,纯视觉方案在四项实操任务中的成功率仅 5%~40%,存在明显的操作短板。
二、OmniTacTune 核心两阶段技术方案
该框架核心创新为策略无关触觉残差适配,全程冻结已训练好的视觉模型,仅新增轻量化触觉修正分支,无需从零训练视触觉混合模型,整体分为两大阶段:

- 触觉感知热身阶段:机器人自主运行原有视觉策略采集真实交互数据,构建回放缓存;同时采用 ControlTac 轨迹级触觉增强算法扩充样本,同步完成触觉编码器、流触觉评论家网络的优化,解决离线触觉数据缺失问题。
- 在线残差强化学习阶段:基于物体中心多模态稠密奖励开展真机在线训练,残差网络输出小幅接触修正量;采用通用接口设计,无需改动底层网络即可兼容 Flow Policy、ACT、Diffusion Policy、π0.5 等主流视觉架构。 整套奖励体系融合抵达引导、物体运动流匹配、稳定抓取、接触安全多重约束,精准约束机器人操作行为。
三、实验核心硬件:GelSight Mini 视触觉传感器
本次全部真机实验统一采用 xArm7 机械臂搭配 GelSight Mini 视触觉传感器,GelSight是整套算法稳定收敛的核心硬件支撑,核心适配优势如下:

- 高分辨率触觉成像,可输出带标记点位移触觉图像,论文接触检测、抓取判定、安全约束全部依靠该设备像素级数据计算;
- 采用光度立体 + 透明凝胶成像结构,充电塑料、玻璃瓶、金属盒等透光、反光材质均可稳定生成 2D 纹理与 3D 接触形变数据;
- 结构紧凑,夹爪直接搭载,原生支持 ROS、PyTouch 开发工具,40–80 分钟长时间连续训练运行稳定;
- 输出完整接触变形场,可直接接入 AnyTouch2 等主流触觉编码器提取 32 维触觉特征,无缝对接强化学习价值网络。
四、完整真机实验结果

研究团队完成四项标准富接触机器人任务,并设置多组对照基线,全部训练时长、前后成功率数据完整如下:
- 插销入孔:训练 40 分钟,纯视觉基线 40%,OmniTacTune 优化后 100%
- 充电器精密插接:训练 50 分钟,纯视觉基线 10%,OmniTacTune 优化后 100%
- 瓶盖动态开启:训练 50 分钟,纯视觉基线 5%,OmniTacTune 优化后 90%
- 薄边金属盒开箱:训练 80 分钟,纯视觉基线 5%,OmniTacTune 优化后 85%
四项任务平均成功率达 93.75%,大幅优于 PLD(52.5%)、纯视觉 PLD(37.5%)、ViTAL(43.75%)三类主流对比方案。
五、研究行业价值
OmniTacTune 提供轻量化机器人触觉升级路径,无需大规模采集专用触觉数据集,仅通过短时真机交互即可为现有视觉模型补充接触感知能力。 该研究揭示行业核心趋势:高质量视触觉数据已成为机器人精密操作的核心数据源。GelSight Mini 这类标准化光学视触觉设备,是将算法理论落地真机的关键物理基础。 随着视触觉硬件与强化学习技术持续迭代,未来更多机器人将依托细腻触觉反馈,实现类人精密接触作业。
论文链接
项目主页:https://colinyu1.github.io/omnitactune-site/
