打开AI聊天软件、代码助手、智能办公工具,每一次问答、每一段回答生成,背后都在消耗一种叫Token(词元)的“AI流量”。Token作为计量AI输出的最小单元,正逐渐成为AI产业的基础计价单位,其单位算力成本直接决定了AI服务商的盈利空间。
在刚刚结束的2026世界人工智能大会(WAIC)上,记者观察到,“降低Token成本”正在成为众多芯片与服务器厂商的共识。“性价比”正在“上桌”,成为继算力指标、适配模型规模之后的竞争新维度。
WAIC上,中昊芯英展示自研芯片与智算硬件方案
高昂算力成本待破局
随着AI智能体、大模型规模化落地,词元消耗量暴增,不少公司甚至陷入“用得越多亏得越多”的困境。中昊芯英创始人、CEO杨龚轶凡在接受采访时表示,智能体调用API时会携带全部历史对话上下文打包传输,即便用户提问量仅千词左右,请求包带来的Token量也可能达到二十万。
现阶段,算力支出已然成为AI公司总成本中最高的一项,多数AI软件服务商毛利率不足40%。“如果算力成本居高不下,很多AI业务会陷入亏损、商业模式无法闭环。”杨龚轶凡坦言,“但如果能把输出词元的算力成本减半,客户利润将成倍增长,毛利率将从40%提升至70%。”
从AI推理市场来看,算力负载可被划分为两类底层逻辑完全差异化的算力需求,对应两类市场服务:高实时交互的高速词元(Fast Token)、离线批量处理的慢速词元(Slow Token)。不同行业与不同应用场景对AI服务的需求和要求并不相同。
清微智能董秘、CFO张磊在接受《中国电子报》记者采访时也表示,若针对不同推理业务分别搭建独立算力集群,会出现硬件长期闲置、硬件与电力投入翻倍的问题,还会抬高多架构配套软件的运维成本。
为助力AI应用商降低算力成本,国产算力芯片厂商摸索出两条实现路径:
一是让单块芯片更能打。重新设计芯片内部计算结构,减少无效运算与耗电,在同等电力条件下产出更多词元;同时完成芯片与大模型软件深度适配,避免算力空转造成的资源消耗。
二是让整机机房少花钱。优化服务器之间的数据传输架构,减少交换机、高端网卡等高价配套设备投入。
此外,为控制芯片本身的生产成本,部分算力芯片企业也在通过远期锁单、提前备货等方式,平抑由晶圆、存储、封装原材料涨价带来的成本波动;采用Chiplet芯粒方案,将大芯片拆解为多颗小型芯粒分开流片,以应对大尺寸单片晶圆流片难度高、良品率偏低等问题。
革新芯片架构
现阶段,GPU仍然是数据中心数量最多、应用最广泛的芯片类型。而在AI时代,杨龚轶凡对GPU发挥的作用有着不同的看法:“通用GPU架构如同万能工具箱,虽然什么都能干,但处理基于Transformer架构的大语言模型任务的效率偏低。”在他看来,GPU技术经过30年迭代,底层核心架构很难再做颠覆性革新;同时完整CUDA软件生态已经成为GPU厂商最坚固的护城河,后来者很难实现弯道超车。
相比之下,TPU的创新空间更为广阔。“只要AI产业持续扩张,Transformer与Attention算子仍是大模型底层核心计算单元,TPU架构的行业价值就会持续放大,相比通用GPU拥有更大的性能和性价比提升空间。”杨龚轶凡表示。
未来推理算力会做专业化拆分,一类是读取全部历史对话的预填充(Prefill),另一类是输出内容的解码(Decode),二者运算逻辑割裂。杨龚轶凡表示,通用GPU依靠一套硬件兼顾两类运算,两端性能均无法做到最优。芯片存储层面,通用GPU内置高速缓存容量有限,需要频繁读写外部显存调取数据,既拖慢运算速度,又产生额外能耗。“中昊芯英推出的二代‘须臾’芯片通过Prefill、Decode硬件分离适配,可采用1颗预填充芯片搭配1~2颗解码芯片协同运算,高度适配智能体长对话场景,能够显著降低重复计算带来的电力消耗。”杨龚轶凡说道。
降低基建开支
大型AI算力集群中,服务器间数据传输依赖交换机、高速网卡设备等硬件。在一个数据中心中,数据交换相关硬件的成本约占到整个系统的40%。
在2026世界人工智能大会上,记者注意到,清微智能首次展出了自研的REX81 Supernode国产4K超节点方案。该方案采用独创的算力网格互联技术,通过光纤实现芯片间、服务器间无交换机直接连接。这样的调整使集群互联硬件的综合成本较传统交换机架构下降90%。
清微智能展示可重构超节点系统
“传统GPU内部线路架构固化,处理不同时延需求的推理任务时,需要分别部署不同算力设备,导致前期固定投入压力较大。”清微智能董秘、CFO张磊在接受《中国电子报》记者采访时介绍道,“清微智能自研可重构数据流架构,数据流经芯片即可同步完成运算,硬件资源利用率大幅提升;单套芯片可同时承载时延要求不同的推理任务,无需重复采购硬件。依托硬件灵活适配特性,统一调度平台可统筹各类业务,避免高端算力闲置浪费。”
- QQ:61149512
