机器人能在视频里翻跟头,为什么到了产线连零件都抓不稳
阅读:140
更新时间:2026-09-01 14:15:00
前段时间南京周边一家做汽车零部件的客户找我们聊产线改造,会议室里先放了一段机器人视频。一台人形机器人稳稳地起身、走路、弯腰搬起箱子,动作流畅得让人挑不出毛病,在场几个年轻工程师下意识地鼓掌。客户的技术负责人看完转过头问我:这东西,能不能放到我们三号车间去?我盯着屏幕看了一会儿,给他泼了点冷水。我说你注意看视频里这个箱子,是端端正正摆在画面正中央的,朝向统一、间距一致;可你们三号车间的料框我去过,零件是随便倒进去的,螺母、支架、连杆混在一起,来料方向全靠运气。机器人在视频里搬的是一个被安排好的道具,在你们车间要面对的是一筐乱糟糟的真实。这两者之间隔着的,恰恰是整个具身智能行业今年最难堪的一道缝。
这道缝到底有多宽,行业里有个被反复提起的例子。有家海外公司做人形机器人,对外宣传的战绩是参与生产了三万辆某品牌豪华汽车,标题打得震天响,圈内圈外一片叫好。但真有业内人去看过那条产线,带回的说法完全是另一回事:那台机器人在真实工位上的抓取放置成功率,低到不到一半,也就是说它每伸手两次,就有一次可能抓空、抓偏或者把工件碰掉。更值得玩味的是视频里的工作场景是专门为它布置的,工件整整齐齐挂在特制的料架上,高度、角度、间距全都提前调过,等于把真实料框里随机抓取那部分最难的活儿,事先替它抹掉了。这哪是机器人适应了产线,分明是产线迁就了机器人,搭了个舞台让它表演。
我做工业设计这些年,对这种"为演示而设计"的套路实在太熟悉了。我们给客户做产品,评审阶段最怕见到一类方案:效果图漂亮得能直接上杂志封面,曲面流光溢彩,配色高级克制。可一旦你追问下去,这个曲面开模要几套滑块、这个接缝在高速产线上怎么保证一致性、消费者用两年后换件要不要把整个壳体报废,设计师就开始顾左右而言他,翻回那张最美的效果图说这个质感多高级。舞台上的方案和能量产的方案,中间隔着的是几百个具体到螺丝的约束。机器人这个行业现在犯的是一模一样的毛病——为了融资和宣传,把最顶尖的人才、最多的预算投在拍demo上,技术当然不能说不先进,但真正用来啃产线硬骨头的精力,被这些漂亮的演示稀释掉了。视频里越完美,往往意味着离真实车间越远。
视频和产线为什么是两回事,根子在于demo的场景不够真实,而真实场景最大的特点就是碎片化。我后来特意花时间捋过不同行业对机器人的要求,捋完发现差异大到几乎是三种完全不同的产品。工业制造要的是精准操作、长时间稳定运行、能适应复杂多变的任务,容错率极低,一个动作失误可能就是一批废品;科研教育要的是训练速度快、方便反复做实验验证、接口开放好折腾;商业和文娱服务要的是会跟人交互、能适应不断变化的人流和场景、外形还得讨喜。就算把范围缩小到工业这一个领域,一个工厂里也有几十个工位、上百道工序,上料、装配、检测、码垛、搬运,每一道对力度、精度、节拍的要求都不一样。指望靠一套通用本体加一套通用能力把所有场景都盖掉,这件事本身就反常识,就像你不能要求一把瑞士军刀同时当好车床、铣床和焊接机器人。
行业似乎过早地把"通用"这两个字当成了必须追求的目标。大家都想做一套包打天下的方案卖给所有人,讲故事的时候"通用"两个字也确实性感,可产业的真实需求偏偏是高度分化、高度具体的。这方面连学界都在主动泼冷水,李飞飞就公开讲过,一拥而上全都去做人形机器人,未必是具身智能正确的落地路线。她的逻辑很朴素:人的身体结构是为适应人的环境、人的生活方式慢慢演化出来的,机器人又不是非要活在人的世界里,犯不着照着人的模样一比一刻。你真去工业现场看看就明白,很多车间是为重型设备设计的,地面平得像镜子、通道宽得能进卡车,这种环境里一个带轮子的底盘,往往比两条腿站得更稳、走得更快、结构更简单、价格还便宜一大截。为了看起来像人而硬做两条腿,在平坦的工厂里更像是一种审美选择,而不是工程选择。
这种对"通用本体"的执念,还带来一个特别现实的副作用:价格下不来。有长期泡在一线的场景落地集成商算过这么一笔账,现在很多本体从设计之初就没有针对具体场景做降本,追求的是参数全面、形态唬人,出厂价本来就高;再往后走,算法调试要花钱、现场部署要花钱、对接产线要花钱,一路加到产业端,一台机器人报到厂价已经冲到了八九十万。可工厂老板自己心里也有本账,他们拿这个机器人去干的那些活儿,能接受的价格顶了天三四十万,再高就不如继续用人或者上传统自动化。中间硬生生差着的这四五十万,说白了就是"通用"两个字的溢价,也是绝大多数项目谈着谈着就黄了的直接原因。客户从来不会为一个能跳舞但干不了活的机器人多掏一分钱,他们只为解决自己工位上那个具体而头疼的问题买单。
所以鹿明机器人的喻超有句话,我第一次读到就觉得说到了点子上:别用机器人的表演来定义产业进步,先找到真实的场景需求,再反过来定义机器人该具备什么能力。这句话翻译成我们做工业设计的语言,就是一定要从定义零件、定义工序开始,而不是从定义梦想、定义愿景开始。我们接一个新产品,从来不会先画一个酷炫的外壳再说,习惯是先跟着客户的产线走上好几天,看工人哪个动作最累、哪个工序废品率最高、哪个节拍是整条线的瓶颈、哪个位置夏天热得留不住人,然后让产品的形态和结构围着这些真实约束一点点长出来。机器人也一样,得先有工位,再有机器人;先有要解决的任务,再谈该配什么形态的本体、装什么样的技能。顺序一旦搞反,做出来的就是个贵价演员。
顺着这个思路往下推,你会发现机器人进工厂,光有一具合适的本体还远远不够,它还得有一套类似"职业技能"的东西。产线上的任务千变万化,今天锁这种螺丝,明天换个型号可能就变成贴标签、插线束,根本不存在一套固定技能能从头打到尾,这跟一个老师傅到了新岗位也得重新学手艺是一个道理。行业里这两年开始提"原子技能"这个概念,想把机器人的动作拆成一个个可复用的最小单元,像搭积木一样组合出新任务;鹿明的提法更大一层,叫"产业具身",意思是围绕真实的产业需求,把场景、数据、模型和执行系统深度拧到一起,做成一套能让机器人持续学本事、长本事的基础设施。落到具体产品上,就是他们发布的NexCore平台,把数据采集、数据治理、模型训练、技能生成、能力评测、机器人部署和运行反馈这一长串环节连成一个闭环,让工厂里产生的数据真正能沉淀成机器人的技能,而不是用完即弃。
这套东西到底管不管用,不能听厂商自己说,要看有没有人愿意用真金白银投票。鹿明跟三菱电机的合作是个挺有说服力的样本。两边最早的合作切口其实很小,就是做PLC质检这么一件单一的事,做好了、做稳了,信任建立起来,才慢慢往两头扩展,一直做到推料箱、打螺丝、搬运这些更复杂、更柔性的任务。最有意思的是身份的变化:三菱一开始纯粹是鹿明的客户,项目一个接一个做下来,到后来干脆成了鹿明的投资人。这个从甲方到股东的转变特别说明问题。你想,一次性的POC演示,客户看完客气地鼓个掌、发个新闻稿就完了,绝无可能真金白银从甲方变成你的股东;只有当你能持续交付、机器人在产线上是真的站住了脚、帮人家实打实解决了问题,信任才会累积到愿意把钱押在你未来身上的程度。这跟我们做设计是一个逻辑,客户第一次给你一个小单,是在试你靠不靠谱;第二次、第三次敢把整条产品线、整个品牌的设计都交给你,是因为你前面每一次都稳稳接住了。
我想强调的是,机器人进场景这件事,难的从来都不是做出一个能在台上演的机器人,而是做出一个能被真实场景留下来的机器人。现在整个行业最深的矛盾在于,具身智能公司还在用"做一个通用产品卖给所有人"的思路做产业,可产业端的真实需求是高度分化、高度具体、高度碎片化的。谁能把工厂里那些老师傅都说不太清、但身体记得住的场景需求,一句一句翻译成机器人能够稳定执行的技能,谁就能更快地跨过从demo到落地这道要命的坎。这中间没有任何捷径可走,就是老老实实地泡在产线上,把随机抓取、把节拍切换、把来料波动、把粉尘油污这些统统"不上镜"的难题,一个一个啃下来。啃下来一个,机器人才算真的多了一项能吃饭的手艺。
说回南京。这两年南京在智能制造上投入不小,开发区里机器人、自动化相关的企业一家挨着一家,我接触下来,本地工厂主对机器人的态度其实异常务实,甚至务实到有点"不好糊弄"。他们不关心你的机器人能不能翻跟头、能不能比心,只会盯着你问三个问题:在我那个粉尘弥漫、油污遍地、节拍卡到秒的车间里,它能不能连续干三个班不出幺蛾子?换产的时候我要不要花大价钱请你们工程师再来一趟?这东西摊到每个工件上的成本,比用人到底划不划算?这三个问题,没有一个是靠demo能回答的。但恰恰是这种务实,对整个行业是件大好事。它逼着所有做机器人的、做设计的、做系统集成的,把注意力从展台拉回产线,从宣传视频拉回真实工位。跳舞的姿态再好看,也解决不了三号车间料框里那个朝向随机的零件;而当一台机器人能在这样的料框前稳定地抓、稳当地放、换了型号还能快速学会新活儿的时候,它才算真正进了厂、站住了脚,从一个演员变成了一个能干活、能创造收益的工人。这或许不是一个更性感的故事,但它是一个能让工厂主心甘情愿掏钱、能让整个行业真正往前走的故事。