NEWS CENTER
THE LATEST ADVICE ON THE INDUSTRIAL DESIGN INDUSTRY
当99%的Token被Agent消耗,AI Infra准备好了吗
阅读:0   更新时间:2026-07-29 11:20:00

当99%的Token被Agent消耗,AI Infra准备好了吗

有一个判断,在今年WAIC的会场里被反复提及。

说出来可能有点夸张,但仔细想想又在情理之中:未来,绝大多数的Token不会是被人类消耗的,而是被Agent消耗的。

PPIO创始人兼CEO姚欣给出的数字是99%。他说,现在人类和Agent的Token消耗量还能打个平手,但未来Agent才会是Token的第一用户。

99%——这个比例如果真的实现,意味着什么?

意味着AI Infra行业服务的主要对象,将从人类变成程序。从"人用AI"变成"AI用AI"。这不是简单的需求增长,而是需求性质的根本变化。

基础设施准备好了吗?

一、Agent为什么是Token"黑洞"

先回答一个基础问题:Agent消耗的Token,为什么会比人类多这么多?

答案藏在Agent的工作方式里。

人和大模型的交互是什么样的?通常是一问一答。你问一个问题,模型给一个回答,对话就结束了。或者多轮对话,但也是人说一句、模型答一句,节奏由人控制。一个人一天能和大模型对话多少次?几十次、上百次,已经算重度用户了。

Agent就不一样了。Agent是什么?是一个能自主感知、自主决策、自主执行任务的智能体。它不需要人时刻盯着,它可以7乘24小时不停运行。一个复杂任务,它可能要调用模型几十次、上百次——思考用一次、查资料用一次、写代码用一次、调试用一次、验证结果再用一次……

而且Agent不是单线程的。一个Agent可以同时处理多个任务,可以拆分成多个子Agent并行工作。这意味着Token消耗不是线性增长,而是有可能呈指数级增长。

陈健的观察很直观。他说,今年随着AI Coding、小龙虾式自主智能应用批量落地,直接把算力推理需求推到了绝对主导地位。

"小龙虾式自主智能应用"——这个说法很形象。小龙虾是什么特点?繁殖快、适应力强、到处都是。自主智能应用也是一样,一旦技术成熟,就会像潮水一样涌来,渗透到各行各业的每一个角落。

趋境科技创始人兼CEO艾智远有一个更深入的判断。他说,未来AI基础设施的竞争不会只停留在单点性能,而是更看重复杂任务中的连续稳定服务能力。

注意这里的关键词:连续稳定。

人类和大模型对话,中间断一下没关系,大不了重新问。但Agent执行任务的时候,服务中断意味着什么?意味着任务失败。如果Agent在处理一个重要的业务流程,中途服务断了,损失可能就大了。

所以Agent时代的算力需求,不只是量的增长,更是质的升级。对稳定性、可靠性、低延迟、服务连续性的要求,都比传统的API调用高出了一个数量级。

这就像交通运输。拉人的时候,车偶尔抛锚、晚一点到,乘客可能还能接受。但如果是拉生产线的零部件,晚到一分钟可能整条线都停了。用途不一样,对基础设施的要求就完全不一样。

二、四道关卡必须过

Agent对基础设施的要求,具体体现在哪些方面?综合8位高管的观察,至少有四道关卡是必须过的。

第一道关:稳定性。

这是最基本的要求,也是最难做到的要求。

Agent是要持续运行的。它不像人,累了可以休息、出错了可以重来。Agent一旦启动,就要长时间连续工作。这中间,任何一次服务抖动、任何一次超时、任何一次错误响应,都可能导致整个任务链断裂。

九章云极的陈庶说得很直接:Agentic AI确实是Token消耗的放大器,但反过来看,这也意味着企业对Token交付的稳定性、成本、合规和可审计性的要求,比传统API调用高出一个数量级。

一个数量级的提升——这就是Agent带来的质量门槛。

怎么保证稳定性?不是靠某一个环节做得好,而是靠整个系统的冗余设计和容错能力。节点故障了能不能自动切换?网络波动了能不能自动重连?任务失败了能不能自动重试?这些都是基础设施层面需要解决的问题。

从工业设计的角度看,这就是可靠性设计的范畴。做一台医疗设备,你不能只考虑正常情况下怎么工作,还要考虑各种异常情况——断电了怎么办、传感器坏了怎么办、操作失误怎么办。可靠性设计的核心,就是在各种意外情况下,设备都能保持基本功能,不会出大问题。

创品做医疗设备设计的时候,这一点体会特别深。医疗设备的可靠性要求,比消费电子产品高太多了。因为消费电子产品坏了,最多就是不好用;医疗设备坏了,可能关乎人的健康和安全。所以我们的"合规维"和"保障力"里,可靠性都是非常重要的一块。

Agent时代的算力基础设施,其实也在面临类似的可靠性升级。当AI开始承担真正的生产任务,它的稳定性就不再是锦上添花,而是生命线。

第二道关:低延迟。

人和AI对话,等个几秒钟,问题不大。人本来就有耐心,而且思考也需要时间。

但Agent不一样。Agent是要完成任务的,任务有时间要求。而且Agent任务通常是链式的——第一步的输出是第二步的输入,第二步的输出是第三步的输入。如果每一步都有几秒的延迟,十步下来就是几十秒甚至上分钟,用户体验就完全不能接受了。

更关键的是,很多Agent场景是实时交互的。比如Agent辅助编程,你希望它给出建议的速度越快越好;比如Agent客服,用户等着它回答问题,等久了用户就走了。

董直烨把网络传输效率列为下半场竞争的三个核心之一。他说,Agent时代的低延迟与稳定性直接决定用户体验。

低延迟不只是网络的问题,也包括推理本身的速度。首Token延迟有多快、输出速度有多高、并发处理能力有多强——这些都直接影响Agent的运行效率。

艾智远的表述更具体。他说,具备企业级价值的高品质AI Token,需要同时满足低首Token时延、高输出速度、高并发等多个要求。难点不在单项指标,而在这些指标能否在真实生产负载下长期同时成立。

"长期同时成立"——这七个字,就是工程的精髓。单项指标做好不难,难的是所有指标同时达标,而且是在真实环境下、长期稳定地达标。

这和产品设计中的多目标优化是一个道理。做一个产品,你要同时满足外观好看、结构坚固、成本可控、容易量产、使用安全等多个目标。这些目标之间往往是矛盾的——要好看可能就要增加成本,要坚固可能就要增加重量。设计师的工作,就是在这些矛盾中找到平衡点,让所有目标同时达到可接受的水平。

创品的"五维评估",本质上就是一个多目标平衡的框架。好看、专利、合规、成本、量产——五个维度都要考虑,不能只顾一个不顾其他。这是专业设计师和业余爱好者的根本区别之一。

第三道关:弹性调度。

Agent的算力需求,和传统的推理需求还有一个很大的不同:波动更大、更不可预测。

人类用户的访问,虽然也有高峰低谷,但大体是有规律的——白天多、晚上少,工作日多、周末少。你可以根据历史数据做比较准确的预测。

但Agent不一样。Agent任务的特点是突发的、并发的、链式的。一个大任务下来,可能瞬间需要大量的算力;任务完成了,算力需求又迅速降下来。而且不同的Agent任务,对模型的需求也不一样——有的需要大模型,有的需要小模型,有的需要多模态模型。

这就对基础设施的弹性调度能力提出了很高的要求。付智总结得很到位:高峰流量来了能否快速扩容?不同任务能否调度到最合适的模型和算力?大规模并发下延迟和SLA能不能稳定?大量Token消耗之后,企业的综合成本能不能控制?

四个问题,每一个都是硬骨头。

要解决这些问题,需要什么?需要异构资源的整合能力,需要智能调度算法,需要跨区域的协同能力,需要快速伸缩的架构。这就是共绩科技他们做的事情——"电网式算力调度",把不同来源的算力整合起来,动态匹配不同的需求。

这和城市的供水供电系统很像。你不能只按最大需求来建电厂和水厂,那样大部分时间都是浪费的;也不能按平均需求来建,那样高峰期就不够用。你需要有主力机组、有调峰机组、有储能设施,还要有智能调度系统,才能在保证供应的同时做到经济高效。

设计大型系统的时候,同样需要这样的思维。比如做一个智慧厨房整体方案,你不能每个电器都按最大功率来配电,那样线路负载太大、成本太高。你需要考虑不同电器的使用模式、峰值重叠概率,做合理的配电设计和功率管理。

系统思维,不管是做算力基础设施还是做产品设计,都是最高阶的能力。

第四道关:可观测、可管理、可审计。

当Agent开始大规模运行,企业管理者会问一个很现实的问题:我的钱都花到哪去了?

传统的API调用,消耗多少Token、花了多少钱,是相对清晰的。但Agent不一样。一个任务跑下来,中间调用了多少次模型、用了哪些工具、消耗了多少Token、每一步花了多少钱——如果没有好的工具,这些都是一笔糊涂账。

所以Agent时代的基础设施,不只要提供算力,还要提供完整的管理和审计能力。Token消耗能不能实时监控?任务成本能不能精确核算?不同团队、不同项目的用量能不能分别统计?异常消耗能不能及时告警?

师天麾观察到,今年WAIC上有一类产品很值得关注——面向Agent的本地网关、身份管理、调用追踪和故障恢复工具。这说明AI Infra正在进入应用的真实运行链路。

"进入应用的真实运行链路"——这个判断很深刻。基础设施如果只停留在底层,不往上走、不深入应用场景,它的价值就有限。只有真正融入业务流程、解决实际运营中的问题,基础设施才能从"成本中心"变成"价值中心"。

这和工业设计的发展路径也很像。早期设计师只负责外观,后来逐渐深入到结构、交互、体验,再后来参与到品牌、战略、商业模式的讨论中。设计师的价值,正是在不断"往上走"的过程中被放大的。

创品这些年也在做同样的事情。我们不只是给客户出设计图纸,而是从前期的市场研究、用户洞察,到中期的概念设计、结构设计,再到后期的供应链对接、量产支持,全流程参与。因为我们知道,只有深度介入客户的业务,设计的价值才能最大化。

三、准备好了吗?

四道关卡列出来,答案其实已经很清楚了:还在准备中。

不是说现在的基础设施完全不能用,而是说它是为人类用户设计的,还没有完全进化到适应Agent时代的形态。就像早期的互联网是为网页浏览设计的,当视频、直播、云游戏这些新应用起来的时候,网络就需要不断升级。

但好消息是,行业已经意识到了这个转变,并且在快速行动。

从产品层面看,推理引擎在优化、调度平台在升级、Agent网关在出现、Token计量和管理工具在完善——每一个环节都有公司在做,每一个环节都在进步。

从架构层面看,行业正在从"算力供给"转向"服务交付"。不只是提供GPU,而是提供完整的推理服务、Token服务、Agent基础设施。交付的东西越完整,对客户的价值就越大。

从生态层面看,芯片厂商、算力运营商、云服务商、推理引擎公司、调度平台、应用开发商——大家都在找自己的位置,都在建立合作关系。生态越完善,整个行业的发展就越快。

师天麾有一句话说得很好:这个市场最终不会由单一层级包办。芯片、算力中心、推理引擎、模型服务商、评测调度平台和Agent开发框架,需要开放协同。

是的,Agent时代的AI Infra,一定是多层协同的生态,而不是某一层通吃的垄断。每一层都有自己的价值,每一层都有自己的技术壁垒,每一层都需要专业的玩家来做。

这很像制造业的供应链体系。做芯片的、做零部件的、做整机组装的、做品牌销售的——各有分工,各有专长,谁也替代不了谁。大家协同起来,才能把最好的产品以合理的价格送到消费者手里。

创品在产业链中的位置也是这样。我们不做芯片、不做工厂,但我们连接品牌和制造,把用户需求转化为可落地的产品设计,把创意想法变成可以量产的工程方案。我们的价值,就在于这个连接和转化的过程中。

四、一个时代的开启

最后,让我们回到最开始的那个问题:当99%的Token被Agent消耗,AI Infra准备好了吗?

答案是:正在准备,并且进展很快。

99%这个数字可能不会很快到来,可能需要三年、五年,甚至更长时间。但方向是确定的——Agent会越来越多,消耗的Token会越来越大,对基础设施的要求会越来越高。

这对AI Infra行业来说,既是巨大的机遇,也是严峻的挑战。

机遇在于,市场空间被彻底打开了。如果说之前的推理需求还是To C的对话、To B的API调用,那Agent时代的推理需求就是各行各业的生产力工具。每一个行业、每一个企业、每一个工作流程,都可能被Agent重塑。算力的需求天花板,会被抬到一个我们今天想象不到的高度。

挑战在于,基础设施必须跟着升级。从技术架构到服务模式,从成本结构到质量标准,几乎每一个层面都需要重新思考和定义。那些只能提供"裸算力"的玩家,会越来越难以为继;而能提供稳定、高效、可管理的Agent基础设施的玩家,会迎来爆发式的增长。

从工业设计的角度看,这就是一个典型的"产品升级换代"的时刻。老产品满足了基本需求,但新的应用场景提出了新的要求,于是新一代产品应运而生。这个过程中,有的企业跟不上就被淘汰了,有的企业抓住机会就实现了跨越。

WAIC 2026,或许就是这个升级换代的起点。

当99%的Token被Agent消耗的那一天真正到来,我们回头看今天,会发现所有的讨论、所有的探索、所有的试错,都是一个崭新时代的序曲。
已累计预约 5360
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功