当前,Token逐渐成为衡量AI计算资源乃至商业价值的新尺度。

作为Token背后的核心底层支撑,算力产业链也正面临一次深刻考验。如何在持续涨价的AI元器件背景下,提供高算效比的算力与持续稳定的Token,如何更好满足旺盛的Token需求,正成为当下的必答题。

在世界人工智能大会(WAIC)期间,厂商已经在试图做出解答:相比单纯比拼单芯片性能,越来越多国产算力产业链企业开始尝试通过架构创新、系统优化和产业协同,提高整体Token生产效率,在推理时代探索属于自己的竞争优势。

底层算力求转变

Token需求爆发来得快且急。

据IDC统计,2025年全球日均Token消耗量相比上一年增长近300倍,中国企业级Token年度消耗量增长近20倍,2025年中国生成式AI模型调用量占全球35%以上,且增长速度明显快于北美市场。

另一组更直观的数据来自模型即服务(MaaS)市场。IDC预计,中国MaaS市场正进入高速增长期,2025年大模型Token调用量较上一年增长16倍,2026年有望比2025年实现20倍增长,Token经济正从概念阶段进入规模化实践。

这些Token需求正需要算力底座提供支撑。算力产业链也意识到,决定用户最终体验的,已经不仅仅是芯片峰值性能,而是整个系统能够以多高效率、多少成本持续输出Token。

这种变化,正在重新定义国产AI芯片的发展方向。

“现在行业跑完整大模型业务,早已不是单卡独立运行,普遍采用多芯片分布式集群部署,行业主流技术方案是Prefill-Decode分离(PD分离)调度。传统GPU架构想要实现PD分离需要大量上层软件改造,而我们的TPU底层架构原生适配PD分离调度,落地门槛更低、调度效率更高。”中昊芯英创始人、CEO杨龚轶凡在接受21世纪经济报道等记者采访时表示,当下以“小龙虾”为代表的Agent智能体应用全面爆发,直接催生了全新的算力需求。这类业务输入Token规模远高于输出Token,两者差距最高可达一万倍,传统算力基础设施很难适配这种极端不均衡的输入输出特征,PD分离分布式调度成为行业刚需,倒逼算力基础设施全面升级。

据悉,公司接下来会采用差异化芯片硬件设计,分别侧重承载Prefill预计算任务,以及专攻Decode解码生成任务,通过软硬件协同进一步释放集群整体算力性能。“对比传统通用GPU,我们整套TPU技术路线能够给客户带来更高算力、更低综合使用成本、更少软件适配工作量。”他续称。

杨龚轶凡还提到,公司第二代芯片“须臾^®”TPU所有硬件结构的调整,全部来源于第一代芯片过去在多市场落地的真实反馈。团队过去在与各类合作伙伴、大模型企业持续合作对接过程中,收集到大量涵盖算力利用率、多卡通信、存储吞吐、大模型推理调度等方面的优化痛点,基于这些真实业务需求,完成了对新一代芯片底层硬件的重构。

如果说PD分离反映的是芯片架构在推理方面的优化,那么另一项变化则发生在软件生态层面。

长期以来,国产AI芯片普遍面临软件生态碎片化的问题。不同大模型、不同开发框架往往需要分别完成适配,每一次模型升级,芯片厂商都需要投入大量研发资源重新优化。随着国产模型和国产芯片数量不断增加,这种适配复杂度进一步提升。

杨龚轶凡坦言,中昊芯英的芯片正处于从“可用”到“好用”的阶段,在核心软件栈方面,有两个关键能力需重点关注:一是对于不同模型、算子,要实现更优化的软件适配;二是让使用者上手即用并能应用多样化工具。

“从芯片研发角度来说,目前行业至少还要两到三年才能真正让软件栈成熟,但其实这个时间并不算太长。”他进一步指出,这也是中昊芯英选择Token Factory(词元工厂)模式来推动产业发展的原因。

其核心逻辑在于,将底层复杂的软件框架封装起来,对外统一提供标准化API接口。这源于客户更关注“每百万Tokens需要多少成本和多长时间”,而不是底层运行着哪一种框架或芯片。这种思路,本质上也是希望推动产业发展重心从软件适配转向Token生产效率本身。

这并不是一家厂商的思路。今年WAIC期间,“超节点”几乎成为AI算力企业展示的共同方向。其关键也是通过创新架构设计、引入光互连等路径,以系统级创新的思路提升整体算力效率。

IDC也认为,未来Token经济的供给侧,本质上是算力、网络、存储等基础设施协同效率的竞争,而AI Factory(AI工厂)将成为批量生产Token的新型基础设施。

从产品竞争到体系竞争

对于今天的大模型而言,一次Agent任务已经不只是完成一次推理,而是涉及模型理解、知识检索、多轮推理、工具调用以及持续生成等多个阶段。整个过程中,芯片计算、网络互联、KV Cache存储、任务调度以及软件运行时都会影响最终Token生成效率。

但挑战在于,去年下半年以来,AI服务器、高带宽存储(HBM)、高速网络等核心基础设施持续涨价,间接给降低Token成本带来压力。

一名算力产业资深从业者对21世纪经济报道记者指出,目前算力产业链在推进AI算力项目过程中讨论最多的,就是如何通过系统优化,让有限的算力资源发挥出更大价值。

“性能提升是综合性的。”他分析道,影响Token成本的不仅是芯片本身,还包括软件调度、网络互联、资源编排以及具体业务场景适配能力。未来无论是千卡集群还是万卡集群,都不会是单一架构组成的大资源池,而将成为多种架构长期共存的基础设施,不同模型、不同业务负载需要调用不同类型的算力资源。

“在实际使用过程中,我们发现使用率会有波动。一旦能够把波谷的算力利用起来,成本自然就下降了。”他补充指出,因此算力设备厂商大多会从算力资源调度、网络能力优化等层面,推动与芯片能力的更好协同,最终推动Token更高效地创造价值。

业界正为此持续努力。

近日,由中昊芯英、杭州电信、中兴通讯联合打造的华东地区(杭州)首个国产TPU千卡智算集群项目正式落地。

杭州电信智算及IDC中心总经理王良在受访时提到,“我们在今年与中兴通讯、中昊芯英共同的调优工作中发现,调优效果对于Token输出效率影响非常大,从今年初到现在,TPU集群通过调优提升效率超过10倍。原来每百万Tokens的成本如果是100元,现在差不多能降到10元以下。所以我们认为调优工作是今后尤其是在Token经济开始以后非常重要的工作。”

这反映了一种新的产业思维。过去建设万卡集群,更多强调“规模”;而未来建设万卡集群,更重要的是“分而用之”。一个大型资源池可以根据模型类型、推理阶段以及业务特点动态划分资源,提高整体利用率,充分利用算力“波谷”,整个系统的单位Token成本自然随之下降。

前述算力从业者还对21世纪经济报道记者提到,今天行业讨论更多围绕“百万Tokens还能降到多少钱”展开,但真正决定AI商业模式的,是每一个Token最终能够创造多少价值。

如果一次复杂推理消耗了大量Token,却依然无法完成任务,那么即便单位Token继续降价,其商业价值依然有限;相反,如果借助智能体编排、工具调用以及技能沉淀,将大量重复劳动提前完成,让模型只负责真正需要推理的部分,即使单位Token价格更高,企业整体成本反而可能进一步下降。

从这个角度来看,Token经济不仅带来了推理需求的爆发,更推动了国产算力产业从“产品竞争”迈向“体系竞争”。未来真正决定竞争力的,或许不是谁能够生产最多的Token,而是谁能够以最低的系统成本,持续生产最有价值的Token。