一平方厘米上万个触觉点,秘密藏在手指里的那个摄像头上
阅读:146
更新时间:2026-09-02 15:49:00
上海有家做传感器选型的客户,技术团队最近在给一款协作机器人配触觉,把市面上几条技术路线的资料摊在会议室里研究了好几天。压阻的、电容的、霍尔磁传的,还有一种叫"视触觉"的,参数表摆在一起,他们越看越纳闷:传统方案一平方厘米能布几十个点已经算不错,视触觉那边张口就是几万个、几十万个信息点,分辨率差了上千倍。这中间是不是有什么噱头?同样是感知触碰,凭什么它能密到这个程度?
我跟他们说,这还真不是参数游戏,背后是两条完全不同的技术思路在赛跑。传统的阵列式传感器,思路是"铺"——在手指表面排布密密麻麻的微型传感单元,一个单元测一个点,想要更高分辨率,就得把单元做得更小、排得更密。可物理结构摆在那儿,每个单元都要有自己的敏感材料、电极、走线,小到一定程度,工艺、串扰、良率全都成问题,密度天然上不去。这也是为什么压阻、电容、霍尔这些路线,每平方厘米做到几十个点就接近工程极限了。
视触觉的思路完全绕开了这个死结,它干脆不去铺传感器,而是转过身去“看”。这个方向最早的灵感来自人的手指:人的手指接触物体时,皮肤会发生形变,形变刺激神经末梢,大脑据此感知力和纹理。视触觉用一层弹性体来模拟这层皮肤,当手指碰到物体、弹性体受压变形时,藏在它后面的一个微型摄像头,就把形变的图像拍下来,再通过算法从这张形变图里反推出触觉信息——法向力多大、切向力多大、有没有滑动。
最巧妙的地方就在这层转化:它把一个触觉问题,变成了一个视觉问题。既然信息最终是以图像的形式被摄像头采集的,那么摄像头能拍到多高分辨率的图像,触觉就能做到多高的分辨率。做视触觉的人有一句话说得很直白:摄像头分辨率有多高,触觉传感器的分辨率就有多高。这不是修辞,是物理事实。
算笔直观的账就明白了。一个640乘480分辨率的摄像头,大概有三十万个像素点,理论上每一个像素都可以对应一个触觉信息点。如果这块传感器的接触面积是三平方厘米,摊下来每平方厘米就是十万个信息点。相比传统阵列式每平方厘米几十个点,这中间是上千倍、甚至上万倍的分辨率差距。过去触觉受限于"铺点"工艺始终做不密,视触觉直接借用了消费电子里已经高度成熟、成本被摊得极低的摄像头产业,等于站在了视觉传感器几十年摩尔式进步的肩膀上。
高分辨率带来的,不只是数字好看,而是实打实的感知能力跃升。第一个直接回报,是能测的力的维度变全了。传统阵列式传感器大多只能测法向力——也就是垂直压向接触面的力,对于平行于接触面的切向力,往往束手无策。而切向力,也就是摩擦力,恰恰是抓取和插拔任务里最关键的信息:拿水瓶靠它判断握力够不够、会不会滑,拿鸡蛋靠它控制力度不捏碎,插接口靠它感知有没有到位。视触觉凭借高分辨率的形变图像,可以把法向力和切向力都灵敏地解算出来,信息维度上就压过一头。
第二个回报,是对材质和细节的辨识力。弹性体在高分辨率摄像头下,能捕捉到极其丰富的表面信息——物体是光滑还是粗糙、是哑光还是拉丝、纹理走向如何,这些都藏在皮肤受压形变的细微差别里。机器人不只用手"用力",还能用手"摸"出材料。这对分拣、质检这类需要判断物料的场景,价值很大。此外,它还能感知物体在手中的位姿,这些高保真数据可以被精准回放,适配到不同的机器人上,等于把一次精细操作的经验完整录了下来。
把视触觉和传统路线放在一起系统比较,做这行的人总结了四个实打实的优势。第一就是前面说的超高分辨率,能做到传统触觉传感器的成千上万倍。第二是多维力探测,法向力、切向力、滑动信息都能测,而不是只有一个笼统的压力值。第三,它特别擅长柔性物体操作——像衣服、线缆、食物这类容易变形、状态千奇百怪的东西,传统刚性传感器很难拿捏,视触觉靠连续的形变图像,能更好地应对。
第四个优势,是抗环境干扰的能力。这一点在工业现场尤其重要。压阻式和电容式传感器,对温度、湿度比较敏感,车间里冬夏温差大、有油污水汽,标定参数容易漂移;霍尔磁传方案则容易受周围电磁场干扰,焊机、电机一多就可能受影响。而视触觉的核心是封闭在手指内部的摄像头和弹性体,靠成像工作,对温湿度和电磁环境都不那么敏感,稳定性天然更适合复杂的工业环境。对我们做产品的人来说,“在实验室里准”和“在车间里三年都准”,完全是两个要求,后者往往才是决定性能不能落地的关键。
把这四点优势落到具体工况上,差别就更直观。举个例子,一个要在潮湿清洗工位上抓取不同形状、不同软硬食材的机器人,用传统阵列传感器,要么怕水汽、测不准力,要么点太少、感知不到食材什么时候开始被捏变形;换成视触觉,弹性体把接触面完整“看”下来,食材哪里开始凹陷、有没有要滑落的趋势,都能从形变图里读出来,机器人就能及时收力、调整。再比如插装柔性线束,线缆柔软、形态随机,硬邦邦的位置控制根本无从下手,靠视触觉的高分辨率滑动反馈,手指能感知到线芯有没有对准、插入时阻力有没有突变,这才谈得上把这类活儿自动化。这些过去只能靠老师傅手上经验的精细活,第一次有了被传感器量化、被模型学习的可能。
有意思的是,视触觉这条路线内部也有分歧,主要争在多色光还是单色光。这个争论看似细节,背后却是实打实的工程差异。学术界的主流是多色光,原因在于多色光可以把法向力和切向力分开计算,两种力解耦得特别清楚——法向力就是法向力,切向力就是切向力,各自的准确度和分辨率都能做高。而单色光相当于牺牲掉了颜色信息,最后只能得到一个笼统的合力。
合力这个东西,问题在于信息是含糊的。比如测出来合力是5,你没法反推这5到底是怎么组成的:可能法向5、切向0,也可能是垂直方向的3和某个切向的4按某种方式合成,理论上有无限多种组合,具体是哪一种,只能靠猜。一靠猜,测量的准确性就打了折扣。所以在需要精确区分力方向的精细操作里,多色光的解耦能力是有硬价值的。至于外界流传的一些说法,比如单色光在功耗、算力、耐久性上更有优势,其实这些指标跟用多色光还是单色光没有本质关系,更多取决于各家自己的工程能力做到什么程度,选型时不该被这种似是而非的引导带偏。
这套从实验室里走出来的技术,真正能不能用,还得过产品化这一关。学术界最早的视触觉传感器,比如GelSight Mini,性能在论文里很漂亮,但耐久性只有一千次按压量级,拿来做实验没问题,放到产线上一天按几万次,很快就废了。产业化要解决的,是把这个数字提上去。现在的标品已经把耐久性从千次级别做到了五百万次以上,提升了几千倍,这才让它从实验室走进工业和商业场景成为可能。这中间隔着的,是弹性体配方、封装结构、成像稳定性、量产一致性等一大堆论文里不会细讲的硬功夫。
从我们工业设计的视角看,视触觉最值得玩味的,其实是它"换个维度解决问题"的思路。当在一条技术路线上撞到物理天花板——阵列传感单元怎么都铺不密——常规反应是在原路线上死磕工艺、死磕材料,投入巨大、收效递减。视触觉的解法是跳出来,重新审视"感知触碰"这件事的本质,发现皮肤的形变才是触觉的源头,于是干脆不去直接测力,而是去"看"形变,顺手借用了另一个已经高度成熟的产业(摄像头和视觉算法)的全部红利。
这种思路在产品设计里屡见不鲜。很多时候,一个问题在它自己的维度里是死局,换个维度、换种物理量去表达,反而豁然开朗。我们做结构设计时也常遇到类似情况:某个配合精度怎么都保证不了,死磕加工公差成本天价,换个思路,用一个弹性结构去吸收公差、用到位反馈去替代绝对精度,问题立刻就化解了。视触觉把"触觉"转译成"图像",和这种"用感知换精度、用成熟模块解新问题"的工程智慧,一脉相承。
当然,说视触觉好,不等于它要一统江湖。不同场景对触觉的成本、精度、信息量要求差别很大,就像上海这样高端制造和电子产业密集的地方,既有需要亚毫米级精细感知的光学、半导体工位,也有只需要知道"夹住没有"的简单搬运工位。前者值得为视触觉的高分辨率买单,后者用便宜的压阻方案反而更划算。技术没有绝对的先进,只有对场景的适配。但无论如何,视触觉把触觉的分辨率天花板一下子捅到了"跟摄像头齐平"的高度,这件事本身,就为机器人精细操作打开了过去想都不敢想的空间。
当机器人的手指,能在一平方厘米上感知几万个触觉点、能分清法向力和切向力、能摸出材质、还不怕车间里的温湿度和电磁干扰,它那双"手"才算真正开始接近人手的感知水平。过去机器人的智能主要体现在"看"和"想"上,手是麻木的;视触觉这类技术要做的,是让手也聪明起来。触觉这最后一块拼图,一旦用这种"借力视觉"的巧妙方式高密度地补上,机器人从"看得见"到"摸得准、摸得细"的那道坎,就有了一条很现实的跨越路径。