从单点性能到系统协同:AI Infra正在进入一场"全栈马拉松"
阅读:0
更新时间:2026-07-29 11:20:00
从单点性能到系统协同:AI Infra正在进入一场"全栈马拉松"
有一个很有意思的现象:每一个行业走向成熟的时候,竞争的焦点都会从"点"转向"面"。
早期比的是单点突破。谁的芯片性能更强、谁的算法更厉害、谁的功能更多,谁就能脱颖而出。这是一个英雄辈出的时代,一个亮点就能撑起一家公司。
但当行业发展到一定阶段,当单点技术逐渐趋同,竞争就会进入下一个层次——系统竞争。这时候比的不再是某一个零件有多强,而是整个系统运转起来有多顺畅、多高效、多可靠。
AI Infra行业,正在进入这个阶段。
WAIC 2026会场里传递出来的信息,反复指向同一个方向:单点性能的时代正在过去,系统协同的时代已经到来。
一、为什么是系统?
为什么竞争必然走向系统层面?这个问题值得先想清楚。
因为单点性能的提升,总有边际效益递减的时候。芯片性能翻一倍,成本也跟着翻一倍,但用户体验可能只提升了30%。再往下追,投入产出比就越来越不划算了。
但系统优化不一样。系统优化的本质,是让各个零件之间更好地配合,让整体大于部分之和。它不需要每个零件都做到最好,但整体效果可能比每个零件都最好的系统还要好。
博大数据董事长余武旺对这个趋势的判断很清晰。他说,今年让他印象最深刻的,并不是某一款产品,而是AI基础设施正在进入系统级竞争的新阶段。大家关注的不再只是单张芯片性能,而是如何通过高速互联、系统集成和软硬协同,让更多GPU高效协同工作。
"让更多GPU高效协同工作"——这句话就是系统竞争的核心。同样是一万张GPU,你的系统协同做得好,可能9000张都在有效计算;做得不好,可能只有5000张在干活,剩下的都在等待、通信、闲置。差距不是来自GPU本身,而是来自系统。
付智也有类似的判断。他说,AI Infra正从资源竞争走向系统效率竞争。注意,不是"计算效率",是"系统效率"。计算效率只是系统效率的一部分,除此之外还有资源调度效率、网络传输效率、能源使用效率、运营管理效率……
系统竞争,比的是综合实力。
从工业设计的角度看,这个规律再熟悉不过了。早期做产品,大家比的是用料——谁的材料好、谁的零件高级,谁的产品就贵、就好。但后来人们发现,材料最好的产品不一定是最好用的产品。零件再好,如果配合不好、结构不合理、人机交互不顺畅,用户体验照样上不去。
创品做设计的时候,一直强调系统思维。一个产品的价值,不等于它所有零件价值的总和。设计的作用,就是把这些零件以最优的方式组织起来,实现1加1大于2的效果。这就是系统设计的魅力。
AI Infra正在经历同样的认知升级。从"堆硬件"到"做系统",从"比零件"到"比协同"——这是行业走向成熟的必经之路。
二、第一层:硬件系统的协同
系统竞争的第一层,是硬件系统的协同。
什么是硬件系统的协同?就是各种硬件设备放在一起,能不能高效地一起工作。这不只是GPU的事,还涉及网络、存储、电力、散热、机房布局等方方面面。
余武旺提到了几个关键词:AI网络、高速互联、能源保障、资源调度。每一个都是硬件系统的重要组成部分。
先说AI网络。训练的时候,GPU之间需要频繁交换数据,如果网络带宽不够、延迟太高,GPU大部分时间都在等数据,计算能力再强也发挥不出来。推理虽然对内部网络的要求低一些,但对外网的稳定性要求很高——服务不能断、延迟不能抖。
高速互联是一个更前沿的方向。传统的数据中心,服务器之间用以太网连接,对于AI计算来说,带宽和延迟都不够理想。于是有了InfiniBand、有了光互联、有了各种超节点架构。目标只有一个:让GPU之间通信更快、更高效。
能源保障也很关键。一个大型算力集群,耗电量是惊人的。供电稳不稳、电价便不便宜、散热效率高不高,这些都直接影响运营成本和可靠性。PUE(电源使用效率)这个指标之所以越来越受重视,就是因为能源成本在算力总成本中的占比越来越高。
这些硬件层面的东西,单独看每一样都不难理解,但要把它们组合成一个高效、稳定、可扩展的系统,难度就大了。就像搭积木,每块积木都一样,但不同的搭法,结构强度和稳定性可能天差地别。
工业设计里也有类似的概念,叫"集成设计"或者"系统设计"。做一个复杂的产品,比如一台医疗设备,里面有机械结构、电子电路、软件系统、人机界面。每一部分都由不同的团队设计,但最终要组装在一起工作。能不能把这些部分很好地集成起来,决定了产品的最终质量和用户体验。
创品做整案项目的时候,这一点体会特别深。整案不是把几个单品的设计拼在一起,而是从整体出发,统一规划、统一设计、统一落地。接口是否匹配、风格是否统一、功能是否协同、体验是否连贯——这些都是系统设计要考虑的问题。
硬件系统的协同,说穿了也是同一个道理:不只是买最好的GPU、最好的网络设备,而是把它们以最优的方式组织起来,形成一个整体最优的计算系统。
三、第二层:软件系统的协同
如果说硬件系统是骨架,那软件系统就是神经和肌肉。硬件再好,如果软件跟不上,那就是"肌肉无力",有劲使不出来。
软件系统的协同,涉及的层面更多。从底层的驱动程序、操作系统,到中间层的调度系统、推理引擎,再到上层的服务网关、计费系统、管理平台——每一层都很重要,而且层与层之间的衔接同样重要。
我们挑几个关键点来说。
第一个是调度系统。调度系统的作用是什么?就是把任务分配到最合适的计算资源上。说起来简单,做起来难。任务的类型不一样,有的需要大模型、有的需要小模型;任务的优先级不一样,有的必须实时响应、有的可以延迟处理;算力资源也是异构的,不同型号、不同性能、不同位置的GPU,怎么分配才能最有效率?
一个好的调度系统,可以把算力利用率从30%提升到70%甚至更高。这是什么概念?相当于同样的硬件投入,产出翻了一倍多。这就是软件的价值——不靠增加硬件,靠优化算法,就能释放巨大的产能。
第二个是推理引擎。推理引擎的作用是让模型跑起来,而且跑得尽可能快、尽可能省。同样的模型、同样的硬件,用不同的推理引擎,性能可能相差好几倍。
推理优化是一个技术含量很高的领域。算子融合、显存管理、KV缓存、批处理、量化压缩……每一项技术都需要深厚的积累。而且不同的模型、不同的硬件、不同的场景,最优的优化策略都不一样。真正做好推理引擎,没有几年的深耕是不可能的。
第三个是服务编排和管理。当推理服务从一个简单的API接口变成复杂的Agent服务,服务的编排和管理就变得非常重要。任务怎么拆分、依赖怎么管理、状态怎么维护、错误怎么恢复、数据怎么监控——这些都需要专门的软件系统来支撑。
师天麾观察到的Agent调用管理、身份管理、故障恢复等工具,就属于这个层面。这些工具的出现,说明AI Infra正在从"提供算力"走向"支撑应用",软件栈在不断往上延伸。
这三层软件——调度、引擎、编排——每一层都有自己的技术壁垒,而层与层之间的协同效率,更是决定整体性能的关键。调度系统和推理引擎能不能深度配合?服务编排和调度系统能不能无缝衔接?这些接口和衔接,往往是系统优化的金矿所在。
这和产品设计中的"交互设计"很像。产品好不好用,不只是每个零件本身的质量问题,更重要的是零件之间、功能之间的交互是否顺畅。用户从一个功能切换到另一个功能,是不是自然?操作流程是不是符合人的习惯?信息展示是不是清晰?这些"连接处"的设计,往往决定了用户体验的上限。
创品的"专业力"里,很重要的一块就是系统集成能力。不只是把各个部分设计好,更要把它们之间的关系处理好。一个产品就像一个团队,每个成员都很强,但如果配合不好,整体战斗力可能还不如一个配合默契的普通团队。
四、第三层:生态系统的协同
比硬件系统和软件系统更高一层的,是生态系统的协同。
什么意思?就是AI Infra不是由一家公司从头做到尾的,而是由很多不同类型的公司,各自做自己擅长的部分,然后协同起来,为用户提供完整的服务。
师天麾说得很透彻:这个市场最终不会由单一层级包办。芯片、算力中心、推理引擎、模型服务商、评测调度平台和Agent开发框架,需要开放协同。
为什么需要开放协同?因为AI Infra的技术栈太长、太复杂了。从芯片到应用,中间有十几层,没有任何一家公司能在每一层都做到最好。硬要做的结果,就是每一层都做得一般,整体竞争力反而不行。
所以更合理的模式是专业化分工。芯片公司专心做芯片,算力运营商专心建算力中心,推理引擎公司专心做优化,调度平台专心做调度,应用开发商专心做应用。大家各展所长,通过开放的接口和标准协同起来,为用户提供最优的整体方案。
余武旺也表达了类似的观点。他说,未来AI产业一定不是单个企业完成的,而是生态协同。芯片企业推动算力性能不断提升,模型企业持续优化算法,应用企业探索商业场景,基础设施企业则更关注如何把这些能力连接起来,构建稳定、高效、可持续运行的底座。
生态协同说起来美好,但做起来不容易。这里面有技术标准的问题——不同厂商的产品能不能互通?有商业利益的问题——合作了之后,谁赚得多谁赚得少?还有竞争关系的问题——既是合作伙伴,又是竞争对手,边界在哪里?
但不管多难,生态化都是必然趋势。因为没有任何一家公司能包打天下,越是复杂的系统,越需要分工协作。
从工业设计的角度看,这和制造业的供应链生态是一个道理。一个成熟的制造体系,一定是高度分工的。有做芯片的,有做传感器的,有做结构件的,有做模具的,有做组装的,有做品牌的。每一个环节都有专业的玩家,每个环节都做到最好,最终才能做出最好的产品。
创品在这个生态中的角色,就是连接品牌和制造的桥梁。我们懂用户、懂设计、懂工艺、懂供应链,所以能把客户的需求转化为可落地的产品方案,并且协调各方资源把它做出来。我们不生产任何零件,但我们让所有零件以最优的方式组合在一起。
这就是生态协同的价值——让专业的人做专业的事,然后通过协同实现整体最优。
五、全栈马拉松的跑法
从硬件到软件再到生态,系统竞争一层比一层复杂。对于身处其中的企业来说,这场全栈马拉松到底该怎么跑?
答案取决于你是谁、你在什么位置。
对于芯片和硬件厂商来说,关键是把自己那层做深做透,同时保持开放。芯片性能是整个系统的基础,基础不牢,地动山摇。但光自己强不够,还要有好的生态支持,让上层软件和应用能充分发挥硬件的性能。所以开放标准、开发者工具、生态建设,这些和硬件本身同样重要。
对于算力运营商来说,关键是系统集成能力和运营能力。你不一定要自己做芯片、做推理引擎,但你要能把最好的硬件和软件整合起来,并且运营得高效、稳定、便宜。这有点像航空公司——飞机不是自己造的,机场不是自己建的,但航空公司负责把乘客安全、准时、舒适地送到目的地。运营能力,就是它们的核心竞争力。
对于软件层公司来说,关键是技术深度和生态适配。你的推理引擎、调度系统或者管理平台,必须在自己的领域做到顶尖。同时,你还要能和上下左右的各种系统良好适配。只有在生态中找到自己不可替代的位置,才能活得好。
对于应用层公司来说,关键是场景理解和价值创造。基础设施再先进,最终也要通过应用来创造价值。你对行业场景理解越深,就越能把算力转化为真实的商业价值。而价值越大,你在生态中的话语权就越大。
不管是哪一类公司,有一点是共同的:必须有系统思维。你不能只盯着自己的一亩三分地,你要知道自己在整个生态中的位置,知道上下游是谁,知道怎么和别人协同。只有理解了整个系统,才能把自己那部分做到最好。
创品一直强调的"四力"——创新力、专业力、控制力、保障力——就是系统思维在设计服务中的体现。创新力保证方向对,专业力保证深度够,控制力保证过程稳,保障力保证结果实。四力合在一起,才是一个设计团队的综合系统能力。
六、系统能力是终极护城河
聊到最后,有一个结论越来越清晰:在AI Infra行业,系统能力正在成为终极护城河。
为什么这么说?因为单点的技术优势很容易被追上。你做了一个推理优化,别人也可以做;你买了最新的GPU,别人也可以买。单点能力构不成长期壁垒。
但系统能力不一样。系统能力是一层一层叠出来的,是无数个细节积累出来的,是在长期运营中打磨出来的。它不是某一项技术,而是技术+流程+经验+组织能力的综合体。这样的护城河,别人想抄都抄不走。
陈健说头部玩家和中小玩家有10倍差距,这个差距主要就是系统能力的差距。不是因为头部玩家的GPU更好,而是因为它们的整个系统——从硬件布局到调度软件、从能源成本到运营效率——都更优。每一环都好一点,加起来就是数量级的差距。
这和设计行业的规律完全一致。为什么有些设计公司收费贵还有那么多客户找?不是因为它们的设计师更会画图,而是因为它们的系统能力更强——研究更深入、流程更规范、落地更稳妥、服务更周全。这些能力是长期积累的结果,不是随便招几个人就能复制的。
创品为什么在家电、医疗、装备这些领域能持续获得客户的信任?不是因为我们的效果图有多惊艳,而是因为我们有一套成熟的方法论和服务体系,能稳定地交付高质量的设计成果。客户找我们,不是买一张图纸,而是买一份放心、买一个确定的结果。
这就是系统能力的价值。它不耀眼,但它可靠;它不刺激,但它长久。
七、马拉松才刚开始
WAIC 2026的舞台上,AI Infra行业的系统竞争才刚刚拉开序幕。
硬件系统的协同还在深化,新的架构和技术不断涌现;软件系统的协同还在完善,从推理引擎到调度平台再到Agent工具链,每一层都在快速进化;生态系统的协同还在形成,不同类型的玩家还在找自己的位置,合作和竞争的边界还在动态调整。
这场全栈马拉松,才跑了前几公里。后面的路还很长,会有很多变化,会有很多意外,也会有很多惊喜。
但有一件事是确定的:那些只靠单点优势的玩家,会越来越吃力;那些早早建立系统能力的玩家,会越跑越稳、越跑越快。
百舸扬帆,向深海驶去。而系统能力最强的那艘船,大概率会最先抵达彼岸。