无锡制造业底盘,为什么能接住具身智能的量产落地需求
阅读:4
更新时间:2026-09-23 10:48:00
从上海闵行的烧烤摊回到长三角的制造车间,机器人要面对的问题才真正开始。
九月中旬那场近一小时的户外直播里,两台机器人在没有脚本、没有遥控、没有预设流程的状态下接单点餐、翻面烤串、端盘上菜,观众随时可以打乱场地布局、临时改单加菜、中途打断正在进行的任务。烤架上的火候随时在变,风一吹炭火忽大忽小,烤串放在炉子不同位置火力不一样,得挪来挪去。地面不平整,端着盘子走的时候会晃,顾客站在旁边随时改主意。机器人第一次翻面没翻好,食材掉落到炉架上,第二次调整了抓取和翻转的姿势,成功了。没有人远程操作,也没有预设的标准答案,整个过程是机器人在现场自己解出来的。更有意思的一个细节是,没有人要求的情况下,服务机器人想到吃烧烤的顾客会需要纸巾,主动把纸巾送了过去。这种主动感知的能力,不是写在任务清单里的,是模型在能量框架下自己判断出来的——顾客体验是一个能量项,等待时间过长、体验不充分都是拉高能量的因素,主动补充服务就是降低能量的自然解。
这场直播验证的不只是一台机器人能不能干活,而是一个新的技术路线能不能在开放世界里站得住脚。从预测到求解,能量驱动的框架让机器人在约束不断变化的环境里,靠自己在现场解出下一步做什么才是对的。这件事如果成立,具身智能的量产逻辑就会被改写——产品的能力不再依赖动作库有多厚、训练数据有多少,而取决于架构本身能不能在没见过的场景里自己找到路。过去行业积累的几乎全是能力上限的展示:选好场景、选好时机、反复调试,再拍出一条完美的Demo。上限可以被编辑出来展示,真实效果如何,却少有人敢公开测。机器人真正进入现实世界,考验的不只是最好时能做到什么,更是环境不断变化时,它还能不能把事情做下去。这个判断标准的变化,比某一个具体算法的突破,分量更重。
无锡的制造业底盘,恰好站在这个转折点上。国内做医疗器械和精密制造的企业,很多都把生产基地放在无锡,因为这里的供应链能支撑从手板到小批量再到量产的完整链路。具身智能产品要从实验室走向工厂、医院、家庭,绕不开的就是这条路——原型跑通了之后,结构能不能批量做,传感器能不能稳定供货,组装成本能不能打下来,维修和售后能不能跟上。这些问题,不是在研发中心里写几行代码就能解决的,得靠一整个产业生态去托底。创品在服务医疗类客户的时候始终有一个判断,专业力既体现在技术参数的高低上,也体现在量产落地的适配性设计中——设备的操作流程符不符合一线人员的使用习惯,维护的时候好不好拆,耗材更换方不方便,故障率压到什么水平可以接受,这些细节直接决定了产品能不能真正从样品变成商品。无锡本地的注塑厂、模具厂、钣金厂、电子组装线挨得近,改一轮结构当天就能拿到新样件,这种迭代速度对硬件产品来说,比什么都珍贵。
能量驱动这条路线,最关键的一个变化是约束写进目标函数,而不是塞进训练数据里。VLA预测动作分布,WAM预测未来世界状态,两条路的底层都是概率分布,分布归一化就意味着两个分布不能直接相加得到新的合法分布。每多一个约束,要么往训练集里加数据,要么加一个适配模块,约束进的是数据集,不是目标函数。能量是标量,标量天然支持复合——任务目标是一个能量项,物理约束是另一个能量项,加起来就是新的目标函数,不需要重新训练,不需要为每个任务单独微调。这一点放在量产场景里,价值就非常具体。一条产线今天做A产品明天做B产品,换型时间和成本直接决定了这条线赚不赚钱。如果机器人的适配方式从重新采集数据再训练,变成改几个约束项重新求解,产线换型的门槛会大幅下降,柔性制造的真实含义才真正站得住脚。控制力最终落到实处,就是把一件东西从能做出来,变成能稳定地、便宜地、大量地做出来。这不是靠某一项单点技术突破,而是靠整条供应链的协同效率、工艺积累和成本控制能力托起来的。
在无锡做过医疗器械量产的人都知道,一台设备从注册检验到批量出货,中间要过的坎远不止设计本身。注塑件的公差能不能稳定做到正负零点零五毫米,硅胶件的硬度批差能不能控制在邵氏五度以内,超声换能器的一致性能不能达到临床要求,BOM成本能不能压到渠道价的三分之一以内——这些都是量产维度的硬指标,不是样机阶段能绕过去的。具身智能产品走进真实场景之后,同样要过这些关。一台服务机器人要进医院配送药品,外壳的抗菌材料选型、边角的圆角半径、底部的轮组结构、上下坡的重心控制、噪音分贝、清洁方式,每一项都关乎量产能不能过。很多原型机在演示台上跑得很好,一到量产阶段就卡住,卡住的往往不是算法,而是结构、工艺、供应链、成本这些看起来不那么高科技的事情。从外观到专利到合规到成本到量产,五维里任何一维不达标,产品都不能真正落地。这就是为什么创品的项目交付前总要对五维各打一遍分,任何一维低于三分都要回头改,五维综合评分过了二十才能交给客户。这个评分体系的背后,其实就是对量产现实的尊重——实验室里再漂亮的方案,过不了量产这一关,对客户来说都等于零。
神经元分配这套架构,往工程层面再走一步,就是算力和成本的平衡问题。四百亿参数听起来不小,但放在具身智能这个赛道里,其实是当前通用VLA和WAM的十分之一到几十分之一量级。更重要的是,它不需要整个模型始终处于活跃状态——前额叶皮层管意图解析和长时序规划,角回和内嗅皮层管流式长时记忆,顶上小叶和上丘管主动感知,运动皮层和小脑管运动规划与动态补偿,脊髓层管力位控制和本能反射。高层推理处理擦不干净要不要换一面这种需要认知参与的问题,抓取打滑、姿态失衡这种应急响应下沉到脊髓层,不走完整的高层推理。信息是双向的,不是感知层到理解层到决策层到控制层的单向管道,思考的结果流向躯体,躯体的传感器反馈回传上层认知。时间尺度被解耦了,高层推理慢一点没关系,底层反应够快就行。主动感知也不是一个功能模块,而是能量项的一部分——信息不足意味着不确定性高,不确定性本身就是一项能量,所以去看一眼是降低能量的自然解,不需要额外写一条探索策略。这件事放到量产场景里,直接关系到一台机器人要用几块主控板、算力成本占BOM多少、续航能做到多长。无锡的制造生态恰好擅长把这类架构优势转化成成本优势——本地的结构件厂、传感器供应商、整机装配线,能在很短的周期里把一个新架构的成本曲线打下来。创新力最终体现在市场端,就是客户拿到的产品有没有差异化,能不能卖上价,而差异化的代价不能高到量产做不出来。
跨本体这件事,在能量框架下是水到渠成的结果,不是额外要攻克的技术模块。VLA学的是动作空间,动作空间跟本体相关——双臂、灵巧手、轮式底盘、人形,关节维度和构型都不一样,跨本体通常需要额外编码本体信息。WAM的视频预测同样绑在具体本体的相机视角上。能量函数定义在任务状态和物理约束这一层,跟本体无关。换一台机器人,不变的是目标项和物理项,变的只是这台身体的力矩上限、可达空间、重心稳定性这几个约束项。同一个大脑进不同的身体,只需要重新求解一次能量最小化。自我模型显式表征的不是自己是什么形状,而是哪些动作在我这个身体上不可行。在产业端,这意味着具身智能的大脑和身体可以解耦,价值链会重新排布——谁的模型能上更多的身体,比谁的身体更灵巧更关键。无锡在制造业端积累的本体制造能力,加上一条可以跨本体复用的模型路线,两边对上了之后,产业推进的速度会比预想的更快。保障力的含义也在这里——不是某一个环节做得好,而是从方案到量产的全链路,每一步都有人兜底,出了问题能找到负责的人。对客户来说,找一家能从概念一直做到量产的ODM服务商,比对接好几家公司、出了问题互相推诿,效率高得多。
两百小时人类视频,零小时真机数据,四十亿参数,在户外开放环境里跑通了长时序任务和跨本体协作。这组数字容易被读成挑战Scaling Law,其实重点不在参数多小,而在模型从什么东西里学。过去机器人学动作,需要有人告诉它看到这个场景手脚怎么动,标注越细成本越高。能量驱动的路线换了一种学法——不看人怎么动,看结果对不对。东西有没有烤好、盘子端稳了没有、调料撒匀了没有,这些事情的成败,结果本身就说明了一切。人类视频里充满了物理后果,重力让东西下落,接触让物体移动,工具使用后留下痕迹,污渍擦掉后表面变干净。任务有没有完成、动作有没有违反物理规律,可以从结果里反推出来。数据需求下降,是换了学法之后自然发生的事。监督信号的来源变了,从动作标签变成了物理后果本身,这个变化的分量,比参数少多少更重。学术界其实已经有了相应的验证,二零二三年谷歌DeepMind的一篇论文证伪了高维连续空间中能量模型不可训练的长期说法,EBT-Policy进一步验证用标量能量做机器人策略,部分任务上两步推理就收敛,相比扩散策略常见的一百步减少了五十倍,并且在没有任何专门训练的情况下,能从失败动作序列中零样本恢复。
这条路还在早期。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定、安全边界怎么界定,这些问题的答案,要在更多真实场景的迭代里才能解开。但有一点已经很清楚——具身智能的量产,拼的不只是模型有多聪明,更是产业生态能不能接住它落地的那一棒。无锡的制造业底盘,恰恰在这个位置上。