NEWS CENTER
THE LATEST ADVICE ON THE INDUSTRIAL DESIGN INDUSTRY
算力的下半场,拼的不是更多卡,而是三张效率底牌
阅读:1   更新时间:2026-07-29 11:20:00

算力的下半场,拼的不是更多卡,而是三张效率底牌

很多人对算力行业的印象,还停留在"堆卡"这个词上。

好像谁的GPU多、谁的集群大,谁就是这个行业的赢家。早些年确实如此。训练大模型是头等大事,算力缺口巨大,有卡就是硬道理。你有一万张卡,我只有一千张,那咱们根本不在一个量级上对话。

但WAIC 2026传递出来的信号很明确:那个时代正在翻篇。

雷峰网采访了8位AI Infra公司的决策者,从算力运营商到云服务商,从推理引擎公司到调度平台创业者,背景各不相同,却不约而同地提到了同一个关键词:效率。

行业的下半场,拼的不再是谁的卡多,而是谁的效率高。

而效率这张牌,其实有三层。每一层都是一道门槛,跨过去了就是一片新天地,跨不过去就只能在红海里挣扎。

一、第一张底牌:计算效率

最容易理解的一层,是计算效率。

什么是计算效率?简单说就是,同样一张GPU,你能让它产出多少Token。这有点像汽车的发动机——同样排量的发动机,有的动力强、油耗低,有的就费油又没劲。差别在哪里?在技术。

PPIO创始人兼CEO姚欣有一个五层拆解,很有穿透力。从底层往上数:第一层是能源成本,第二层是调度效率,第三层是模型服务层的推理加速,优化潜力同样高达百分之七八十,第四层是Token的实际用途——用于长上下文Agent应用还是简单问答,两者价值能差出10倍。

推理加速这一层,就是计算效率的核心战场。

清程极智联合创始人师天麾说得很直接:硬件性能并不会自动转化为推理效率。跨芯片、跨模型的适配与优化,需要专业的系统软件来做。芯片再强,如果推理引擎优化跟不上,那就是高射炮打蚊子——有劲使不出来。

趋境科技创始人兼CEO艾智远也有类似的判断。他说,追求把模型列表做得更长并非目标,真正有价值的是对有生产需求的模型做深度优化。因为企业客户最终关心的不是接入了多少模型,而是这些模型能否在实际业务中稳定、低成本、高效率地运行。

计算效率的优化,不是一招鲜的事情,而是系统工程。从算子融合到显存管理,从KV缓存到批处理调度,从模型量化到分布式推理——每一个环节都有优化空间,每一个百分点的提升都来之不易。但积少成多,几十上百个优化点叠加起来,可能就是几倍的性能差距。

这让我想起工业设计中的结构优化。同样的材料、同样的工艺,不同的结构设计,产品的强度、重量、成本可能天差地别。一个优秀的结构工程师,能在保证性能的前提下,把重量减30%、成本降20%。靠的是什么?靠的是对材料力学的深刻理解,对每个受力点的精确计算,对工艺边界的精准把握。

计算效率的优化也是同样的道理。不是简单地"让代码跑快点",而是深入理解硬件架构、模型结构、计算模式,在每一个层面找到最优解。这是硬功夫,没有捷径可走。

创品的"专业力"说的就是这件事。专业不是喊口号喊出来的,是在一个领域深耕多年、把每一个细节都琢磨透了之后自然形成的能力。做设计如此,做算力基础设施也是如此。

二、第二张底牌:资源效率

如果说计算效率是"让每一张卡跑得更快",那资源效率就是"让每一张卡都跑起来"。

这个问题有多大?九章云极的陈庶给出了一个数字——行业平均利用率不足30%。

30%是什么概念?就是你买了100张卡,真正在干活的只有30张,剩下70张要么在闲置、要么在等待、要么在做无意义的空转。大量的算力投入没有被有效转化,真金白银就这么浪费了。

为什么会这样?原因很多。

有的是因为需求波动大。白天高峰期算力不够用,晚上低谷期又大量闲置。潮汐效应明显,峰谷差可能有好几倍。

有的是因为资源碎片化。不同的任务需要不同型号的GPU,有的任务占显存大、有的占显存小,分配不均匀,结果就是到处都是"边角料"算力,用不上也放不下。

有的是因为调度效率低。任务排队、资源抢占、数据搬运——这些非计算时间消耗了大量的算力资源,真正用于计算的时间反而不多。

所以资源效率的优化,核心就是解决这些问题。

共绩科技创始人兼CEO付智的思路很有代表性。他们做的是"电网式算力调度",一端连接不同的算力供给——IDC、企业园区闲置算力、网吧GPU、车载算力,另一端连接各种需求——模型训练、推理、Agent,进行跨区域、跨集群调度。

这个思路很有意思。电网的逻辑是什么?是把分散的、波动的电力供给,和分散的、波动的电力需求,通过一个智能调度网络匹配起来,让每一度电都去到它最该去的地方。算力调度也是一样的逻辑——把分散的、异构的算力资源,通过智能调度匹配到最合适的任务上,实现整体利用率的最大化。

陈庶说得更具体:算力治理能力是三层竞争的第一层。能不能让算力资源被充分调度、不被闲置,谁先把这部分效率释放出来,谁就有成本优势。

从工业设计的角度看,这和产品设计中的"空间利用率"问题异曲同工。做一台冰箱,内部空间就那么大,怎么布局搁架、怎么设计抽屉、怎么安排不同温区,才能让用户放得东西最多、拿取最方便?这就是空间利用率的问题。优秀的设计和普通的设计,相同容积下的实际可用空间可能差20%以上。

算力的资源效率也是这个道理。同样的100张卡,调度系统做得好,利用率能到70%、80%;做得不好,可能只有20%、30%。差出来的那几十张卡的产能,全都是纯利润。

创品讲"成本维",说的不只是采购成本,更是全生命周期的使用成本和运营成本。一个产品如果用起来效率低、浪费大,即使买的时候便宜,从长期看反而是贵的。算力基础设施也一样,初始投资只是一方面,运营效率才是决定长期成本的关键。

三、第三张底牌:能源效率

最底层、也最容易被忽略的一层,是能源效率。

为什么能源效率重要?因为电是算力最大的成本项之一。一个万卡级的算力集群,一年的电费可能是几亿甚至十几亿。电价差几分钱,算下来都是天文数字。

姚欣的拆解里,第一层就是能源成本。他说,中国东西部电价相差近三倍,算力中心的选址直接决定成本基线。三倍——这个数字很惊人,但想想也合理。东部经济发达、人口密集、电价高;西部新能源丰富、用电需求低、电价便宜。把算力中心建在西部,电费成本可能只是东部的三分之一。

但事情没有这么简单。西部电价便宜,可是离用户远,网络延迟高;东部离用户近,但是电价贵。这中间就有一个权衡——你的业务对延迟敏感吗?如果是训练任务,对延迟不敏感,放西部就很划算;如果是推理服务,特别是实时交互的推理服务,延迟很重要,那可能就需要在东部部署。

而且能源效率不只是电价问题,还有PUE(电源使用效率)的问题。PUE是数据中心总能耗与IT设备能耗的比值,越接近1越好。同样的计算负载,PUE 1.1的数据中心比PUE 1.5的数据中心,能省将近三分之一的电。

还有一个更前沿的方向:算力与电网的协同。付智提到,算力任务如何与能源条件进行匹配,会越来越影响最终的Token成本。什么意思?就是让算力任务跟着电价走——电价低的时候多算,电价高的时候少算;新能源出力多的时候多算,火电比例高的时候少算。

这和产品设计中的"能效设计"是一个道理。做家电设计的时候,能效等级是一个核心指标。一级能效和三级能效的产品,用户使用十年下来,电费差可能比产品本身的价格还高。所以优秀的设计,不只是让产品功能强、外观美,还要让它足够省电,为用户创造长期价值。

创品的五维评估里虽然没有单独列"能效维",但成本维和量产维里其实都包含了能源效率的考量。一个产品如果能耗高,不仅增加用户的使用成本,也增加生产制造的难度和成本。能效设计,是设计专业力的重要组成部分。

四、三张底牌的化学反应

计算效率、资源效率、能源效率——这三张牌,单独拿出来每张都有价值,但真正的威力在于三者叠加的化学反应。

我们可以算一笔账。假设你有100张GPU,初始状态下计算效率是行业平均水平,资源利用率是30%,能源成本是东部工业电价。

现在,你通过推理引擎优化,把计算效率提升了50%——同样的时间能产出1.5倍的Token。这是第一层增益。

然后,你通过智能调度,把资源利用率从30%提升到60%——相当于可用的卡从30张变成了60张。这是第二层增益。

再然后,你把算力中心从东部迁到西部,电价降到原来的三分之一——每度电的成本只剩三分之一。这是第三层增益。

三层叠加之后呢?产出变成了原来的1.5乘以2,也就是3倍;成本变成了原来的三分之一。两者一除,单位Token的成本就变成了原来的九分之一。

九倍的差距——这就是为什么陈健说,头部玩家和中小玩家的Token吞吐能拉开10倍差距。不是某一项技术强了10倍,而是多层优化叠加之后,整体效率差出了数量级。

这就是系统的力量。也是为什么行业的竞争正在从单点性能走向系统能力。

博大数据董事长余武旺的观察很到位。他说,AI基础设施正在进入系统级竞争的新阶段。大家关注的不再只是单张芯片性能,而是如何通过高速互联、系统集成和软硬协同,让更多GPU高效协同工作。

从工业设计的视角看,这完全符合产品系统设计的基本规律。一个产品的整体性能,从来不等于各个零件性能的简单相加。系统的协同方式、接口设计、资源分配,往往比单个零件的性能更能决定整体表现。

创品做整案设计的时候,始终强调系统思维。不是冰箱归冰箱、洗衣机归洗衣机各做各的,而是从用户的整体生活动线出发,把每个产品放到系统中去定位、去设计。只有这样,才能做出1加1大于2的效果。

AI Infra也是一样。GPU数量只是基础,真正决定竞争力的,是这些GPU能不能高效协同、能不能被充分利用、能不能以最低的能源成本稳定产出。系统能力,才是真正的护城河。

五、效率时代的生存法则

既然效率成了下半场的核心命题,那不同的玩家该如何应对?

答案取决于你在哪一层、有什么牌。

对于有重资产和大规模集群的头部算力服务商来说,关键是把三张效率底牌全部打好。计算效率要跟上,资源效率要拉满,能源效率要优化。只有三层都做到极致,才能把规模优势真正转化为成本优势,形成别人追不上的壁垒。这就像头部制造企业,规模大只是表面,真正的竞争力是大规模之下仍然能保持高效率和低成本。

对于专注于推理优化的软件层公司来说,关键是把计算效率做到极致。你不需要有自己的算力中心,但你的优化技术必须是行业顶尖的。你的优化效果越好,就越容易获得头部算力服务商的合作机会,也就越能在生态中占据不可替代的位置。这有点像设计公司——不需要有自己的工厂,但设计能力必须过硬,才能和最好的制造商合作。

对于做调度平台和算力整合的公司来说,关键是资源效率。你的价值在于把分散的算力聚沙成塔,让闲置资源活起来,让算力供需实现最优匹配。这个方向的核心是平台能力和网络效应——接入的供给越多、需求越多,调度效率就越高,平台价值就越大。

对于中小玩家来说,现实可能比较残酷。10倍的效率差距摆在那里,正面硬刚是没有胜算的。但也不是没有机会。陈健也说了,中小型玩家体量小、决策灵活,可以承接定制化零散小单。关键是找到细分赛道,做深做透,在特定场景里建立自己的优势。

不管是哪一类玩家,有一点是共同的:必须有自己的核心效率优势。没有优势,就没有生存空间。

这和设计行业的格局也很像。大型综合设计公司靠全流程能力取胜,精品设计工作室靠特定领域的深度取胜,独立设计师靠个人风格和创意取胜。每种路径都有成功的可能,但前提是你必须在你选的那条路上做到足够好。

创品选择的路径,是"四力五维"的综合路线——不只是做外观设计,而是从创新力、专业力、控制力、保障力四个维度构建能力,从好看、专利、合规、成本、量产五个维度评估设计。因为我们相信,在越来越成熟的市场里,综合实力才是最可靠的竞争力。

六、效率不是终点

最后想说的是,效率很重要,但效率不是终点。

效率解决的是"同样的投入能产出多少"的问题,这是行业从粗放走向精细的必经之路。但效率之上,还有价值的问题——这些产出的Token,是不是用户真正需要的?能不能转化为真实的商业价值?

师天麾有一句话说得很好:竞争的关键不是谁拥有最多算力,而是谁能让单位算力、单位能耗和单位成本产生更多真正有用的Token。

"真正有用"这四个字,分量很重。Token不是越多越好,而是越有价值越好。一个Agent任务,如果消耗了大量Token但完成得一塌糊涂,那效率再高也没有意义。最终的衡量标准,还是任务能不能完成、用户愿不愿意付费、商业价值能不能兑现。

所以效率是基础,价值才是方向。先把效率提上去,让Token的成本打下来,然后再往上去做价值——把Token转化为具体的场景、具体的应用、具体的商业成果。

这和设计行业的演进路径也很像。早期比谁画得好看,后来比谁成本控制得好、量产落地好,再后来比谁能帮客户创造更大的商业价值。效率是过程,价值才是目的。

WAIC 2026的会场里,效率是主题词。但再过几年,当效率的问题基本解决之后,行业的主题词又会变成什么呢?

可能是价值,可能是场景,也可能是某种我们今天还想象不到的东西。

但无论如何,先把眼前的效率这一关过了再说。三张底牌都打好了,才有资格谈下一个阶段的事情。
已累计预约 5360
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功