当GPU卡数不再是答案:AI Infra行业悄悄换了一把度量尺
阅读:0
更新时间:2026-07-29 11:20:00
当GPU卡数不再是答案:AI Infra行业悄悄换了一把度量尺
七月的上海,蝉鸣和热浪一起涌进WAIC 2026的每一个展厅。
如果往年走在会场里,你听得最多的词可能是千卡集群、万卡集群、GPU性能、参数规模——这些带有"大"和"多"属性的词,构成了行业对话的主旋律。谁的卡多,谁的集群大,谁就站在舞台中央。
但今年不一样了。
展台边的讨论、论坛上的分享、走廊里的寒暄——话题中心在悄悄转移。人们不再问"你有多少张卡",而是问"你每度电能产出多少有效Token";不再说"我们搭了多大的集群",而是说"我们的推理服务SLA几个九";不再比拼"训练性能有多强",而是琢磨"怎么把Token成本打下来"。
度量尺换了。
一、从"有多少"到"产出多少"
雷峰网采访了8位AI Infra公司的决策者,几乎每一个人都提到了同一个转变:行业关注的重心,正在从算力规模转向算力效率。
九章云极市场部负责人陈庶的观察很有代表性——去年大家还在讨论如何把模型训练出来,今年讨论已经变成了如何让模型规模化地跑起来。推理效率、调度能力、成本管控替代了算力规模,成为展台和论坛上最高频的词。
首都在线COO董直烨说得更直白:行业的关注点已经从算力资源的有无和规模大小,转向了算力的落地效率与价值确定性。
并行科技董事长、CCF中国计算机学会副理事长陈健给出了一个更具体的判断。他说前两年行业算力需求基本上训练和推理五五分,但今年开始,随着AI Coding、自主智能应用批量落地,推理需求直接冲到了绝对主导地位。他把这个概括为行业的一个共识——2026是AI大规模商业化元年,推理才是算力消耗的长期主体。
数据支撑了这个判断。2025年全市场Token调用量同比暴涨300倍,头部大模型企业的增长已完全由API和Token调用拉动。以智谱为例,其年化收入从预期的7亿美金突破至10亿美金,增长核心全部来自推理侧规模化调用。Gartner测算,推理目前已经占到企业AI计算支出的65%以上。
这不再是一场谁有更多卡谁就是赢家的规模竞赛。用产出衡量能力,是推理时代的必然。
从工业设计的角度看,这个转变一点都不意外。在江苏创品工业设计的评估体系里,判断一个产品的价值,从来不是看它用料有多足、零件有多少,而是从五个维度做综合考量:好看维、专利维、合规维、成本维、量产维。这里面最关键的一条逻辑是:投入的多寡不直接等于价值的高低,关键在于投入能不能转化为用户能感知到的实际价值。
算力行业也一样。GPU数量是投入,Token产出才是结果。过去行业处于建设扩张期,大家比的是谁家底厚、谁能先把基建搭起来;现在进入运营交付期,自然要反过来算一算投入产出比。同样一万张卡,你能比别人多产出30%的有效Token,你的竞争力就实实在在地强30%。
设计行业常说一句话:好的设计不是用最贵的材料,而是用最合适的材料做出最好的效果。算力行业正在进入同样的阶段。
二、Token为什么成了新标尺?
为什么偏偏是Token,而不是别的什么东西,成为了新的度量单位?
这个问题值得好好想一想。因为答案里藏着行业转型的本质。
Token是什么?表面上看,它是大模型处理文本的最小单位——一个字、几个字或者一个词,都可能对应一个Token。但从产业角度看,Token的意义远不止于此。它是AI时代的"电",是智能服务的基本计量单位。
在电力时代刚起步的时候,大家可能会讨论"你家发电机多大""你有多少台机组",但电力真正成为基础设施之后,人们只关心"你给我供多少度电""每度电多少钱""稳不稳定"。
Token正在扮演同样的角色。当AI从实验室走进商业场景,当推理成为算力消耗的主体,当企业用户开始为AI服务付费——这个行业就需要一个统一的、可度量的、可比较的产出单位。Token就是这个单位。
为什么不是"调用次数"?因为每次调用消耗的计算资源天差地别,一个简单问答和一个复杂Agent任务的成本可能差几百倍。为什么不是"模型效果"?因为效果太主观,不好量化,也不好计费。
Token就很合适。它天然和计算成本挂钩,又能跨模型、跨场景进行横向比较。你家模型推理一次消耗多少Token、成本多少、速度多快,这些都是硬指标,可以明明白白地摆出来比较。
所以当行业说"从GPU卡数转向Token产出"的时候,它说的不只是一个计量单位的变化,而是整个行业从"建设思维"转向"运营思维"、从"供给导向"转向"需求导向"的深层转变。
在创品的设计实践中,也有类似的规律。早期做产品的时候,客户最关心的是外观够不够炫、功能够不够多;但产品真正进入市场、面临成本和量产压力的时候,客户开始反过来问:这个功能用户真的用吗?增加这个结构件值不值?每一分钱的成本投入,能不能换来对应的市场价值?
这就是成熟行业的标志:从比谁做得多,转向比谁做得有效率。
三、新标尺下的三层效率竞争
既然Token成了新的标尺,那竞争的核心自然就是效率——同样的资源投入,谁能产出更多有效Token,谁的成本更低,谁就赢。
但效率不是一个单薄的词,它里面有很多层次。共绩科技创始人兼CEO付智把效率竞争划分为三个层面,这个框架很有启发性。
第一层是计算效率。通过芯片、网络、推理框架、模型优化和系统架构,让同样的硬件产生更多有效计算。这是最硬核的一层,拼的是技术实力。同样一张GPU,你的推理引擎优化得好,可能就能多产出30%甚至50%的Token。这就像工业设计里的结构优化——同样的材料,通过更合理的结构设计,可以实现更高的强度、更轻的重量、更低的成本。
第二层是资源效率。通过弹性调度、异构资源整合和跨区域协同,让更多原本闲置或利用率不足的算力进入生产体系。行业平均算力利用率不足30%,这意味着大量的投入被浪费了。谁能把利用率从30%提升到60%,谁就相当于不花一分钱把产能翻了一倍。这在设计行业对应的是供应链优化和生产流程再造——同样的工厂和工人,通过更合理的工艺流程和调度,可以产出更多更好的产品。
第三层是能源效率。算力任务如何与能源条件匹配,会越来越影响最终的Token成本。中国东西部电价相差近三倍,算力中心选址在哪里、能不能错峰用电、能不能和新能源电网联动——这些都会直接反映在Token的成本里。PPIO创始人兼CEO姚欣的拆解更细:从底层往上数,第一层就是能源成本,它决定了成本基线;第二层是调度效率,提升利用率又能释放20%到30%的空间;第三层才是推理加速的优化。
这三层效率,层层递进,每一层都有自己的优化空间。而真正的竞争力,来自于多层叠加之后的综合优势。你在每一层比别人好一点,叠加起来可能就是倍数级的差距。
陈健的判断印证了这一点。他说,具备万卡GPU集群和全栈调度优化能力的算力服务商,优化后集群TPS和单位算力Token吞吐能拉开中小玩家10倍差距。10倍——这个数字很震撼,但如果把计算效率、资源效率、能源效率三层优化叠加起来,10倍并不是不可能。
这就像创品做设计项目,好看的造型只是最表层的东西,更深入的是专利布局、合规把控、成本优化、量产保障。每一个维度做得好一点,叠加起来,最终产品的市场竞争力就会有质的差别。所以创品讲"五维评估",不是说某一维强就行,而是五维综合实力强才是真的强。
四、玩家分层与赛道新秩序
效率时代的到来,必然带来行业格局的重塑。
在拼规模的时代,玩家之间的差距主要是钱的差距——谁融资多、谁拿卡渠道强,谁就跑得快。但进入效率时代,差距就不是简单用钱能堆出来的了。它需要技术积累、需要工程能力、需要运营经验、需要客户资源——这些都是需要时间沉淀的东西。
陈健对Token工厂赛道的玩家做了三层分类,很值得参考。
第一类是具备大规模硬件储备和全栈调度优化能力的算力服务商。优势是手握万卡级多元GPU集群,深耕算力调度多年,单位算力Token吞吐能拉开中小玩家10倍差距;长期服务头部客户,有稳定大订单摊薄硬件折旧成本。劣势是重资产模式,硬件采购和机房建设资金投入大,扩张周期更长。
第二类是自研大模型厂商自建推理集群。优势是深度贴合自有模型架构,软硬件适配度高。劣势是硬件储备只为自有业务配套,不对外规模化开放,无法承接第三方海量Token需求,缺少业务灵活性和服务完备性。
第三类是中小型算力服务商和初创团队。优势是体量小、决策灵活,可承接定制化短期零散小单。但短板也很致命:没有长期稳定大客户订单、缺少大批量GPU锁货渠道、底层调度与性能优化能力薄弱。同样硬件规格下,Token产出效率和头部厂商存在10倍级差距,成本完全没有竞争力。
这个分层结构很清晰,但更值得注意的是陈健的判断——稳定大客户订单、强GPU供给、顶尖性能优化能力三者缺一不可。同时具备的头部玩家会持续收割份额,中小玩家的生存空间正在持续收窄。
换句话说,赛道正在从"百花齐放"走向"头部集中"。这是每个成熟行业都会经历的阶段。早期市场空间大、增长快,谁进来都能分一杯羹;但当行业进入精细化运营阶段,效率和成本成为核心竞争力,马太效应就会显现。
从工业设计行业看,同样的规律一直在上演。早期市场野蛮生长,大大小小的设计公司遍地开花;但随着客户越来越成熟、要求越来越高,那些只有绘图能力、没有系统解决方案能力的小团队,生存空间就会越来越窄。真正能站稳脚跟的,是那些具备全流程服务能力、能为客户创造持续价值的综合性设计公司。
创品这些年能在家电、医疗、装备等多个领域稳步发展,靠的就是"四力"——创新力、专业力、控制力、保障力的综合实力。不是靠某一个点出彩,而是靠全链路能力取胜。AI Infra赛道的头部化趋势,本质上也是同样的逻辑:单点优势已经不够用了,系统能力才是终极护城河。
五、设计视角下的行业启示
站在工业设计的角度回望AI Infra行业的这次转型,有几个启发值得记录下来。
第一个启发是:度量衡决定竞争方向。当行业用GPU卡数衡量实力,大家就去堆卡、堆集群、堆规模;当行业用Token产出衡量实力,大家就去优化效率、降低成本、提升服务质量。设计行业也是一样,如果客户只用"好不好看"评价设计,设计师就只会在造型上内卷;但如果客户建立了多维度的评估体系,设计的价值才能真正充分释放。
第二个启发是:从建设到运营是行业成熟的标志。建设阶段轰轰烈烈,运营阶段精耕细作。每一个走向成熟的行业,都会经历从"比谁铺得快"到"比谁做得好"的转变。这个转变过程中,淘汰的是只会粗放扩张的玩家,留下的是真正有系统能力的玩家。
第三个启发是:效率从来不是单点问题。Token效率的提升,涉及能源、硬件、网络、调度、推理引擎、模型优化等多个层面。任何单点的突破,带来的提升都是有限的;只有全链路的协同优化,才能实现量级的跃升。这和产品设计的系统思维异曲同工——好的产品从来不是某一个零件做得好,而是整个系统协同得好。
第四个启发是:基础设施的终极形态是"像水电一样"。Token正在成为AI时代的电力——可度量、可计费、稳定可靠、随取随用。当Token真正变成像电一样的基础设施,AI应用的大爆发才会真正到来。而在那之前,AI Infra行业还有很长的路要走。
六、向深海驶去
WAIC 2026的热度会随着夏天一起退去,但行业的转变不会停下。
Token产出取代GPU卡数成为新的标尺,效率接替规模成为新的命题。这不是某个企业的战略选择,而是整个产业发展到这个阶段的必然方向。
8位站在行业最前沿的决策者,用各自的观察和判断,拼凑出了一幅AI Infra行业转型的完整图景。图景里有共识也有分歧,有机遇也有挑战,但方向是清晰的——让AI真正成为可度量、可交付、可依赖的生产力。
AI Infra企业纷纷在地图上圈出了新的目的地。百舸扬帆,向深海驶去。
而对于站在行业边上的观察者来说,最有意思的事情莫过于见证:一个行业如何在喧嚣中找到自己的节奏,如何从粗放走向精细,如何从规模走向效率,如何在不断的自我迭代中变得更加成熟。
这是AI Infra行业的故事,也是每一个走向成熟的行业都会经历的故事。