星光澄海 | BLOG

数据中心拆8卡围墙 AI算力竞争逻辑转向

2026年3月,中国日均Token调用量突破140万亿——对比2024年初的1000亿,两年涨了超千倍。这个数字不是发布会的噱头,是AI产业正在付的真实账单。

Token成了算力的核心标尺

过去行业聊AI,总绕不开大模型参数、评测榜单这些显性指标。但2026年3月的一组数据,把算力的底层转向摆到了台面上:中国发展高层论坛透露当月数据,日均Token突破140万亿,OpenRouter(全球最大AI模型API聚合平台)同期统计,3月16日到22日,全球总Token调用量20.4万亿,中国占36%(7.359万亿),周调用量连续三周超美国。

机构预测更直白:摩根大通说中国AI推理Token,2025到2030年要从约10千万亿涨至3900千万亿,五年增370倍;IDC更猛,全球年度Token从2025年的0.0005 Peta Token,涨到2030年的15万Peta Token,年复合3418%。

这意味着算力的重心彻底转了:AI早期比拼训练峰值,要的是GPU显存、单卡算力,是“爆发力”;现在转成推理为主,要的是7×24小时稳输出Token的能力、单Token的成本,是“耐力”。客户不再只挑单卡参数,现在算的是:集群每小时能稳出多少Token?单Token的电费、折旧能不能扛住业务定价?大规模集群会不会经常宕机?

8卡服务器的围墙破了

过去几年,AI数据中心的标准单元是8卡服务器——把8张GPU塞一个机箱,批量攒成“万卡集群”。这套架构在千亿参数模型时代够用,但到万亿参数、百万并发推理阶段,卡间、服务器间的数据搬运成了死穴:就算芯片算力够强,数据送不及时,硬件也只能闲置。

中国信通院《AI计算节点发展研究报告(2026年)》点破了问题:传统8卡集群靠网线互联,延迟高、带宽不够。行业的解法是超节点:用NVLink等卡间直连,把数十上百张卡整成一个“超级单元”,内存统一寻址,算力无缝调用,通信延迟接近内存访问。

现在玩家已经落地:华为全联接大会2026发的昇腾960超节点,单节点4096卡,8E FP8算力,用5500个Hi-ONE替代4.8万颗800G光模块;联想WAIC2026展了万全异构智算平台V5.0超节点;超聚变则推了FusionPoD for AI整机柜方案。

当然,8卡服务器不会立刻消失——小规模研发测试、边缘推理这类场景,它灵活又便宜。但面向中大型数据中心,靠大量独立8卡组网,边际效益已经在降:跨服务器的通信开销会推高延迟,拉高综合成本。

超节点不是万能解药

超节点的价值有边界:它是给万亿参数训练、大规模推理这类高门槛场景量身订的,能解决传统架构的通信瓶颈,提Token吞吐、降算力成本。但中小规模业务,比如轻量化模型迭代、小批量API服务,硬上超节点只会冗余,系统复杂度升,TCO(总拥有成本)反而涨。

还有两个现实问题:一是互联路线没统一,NPO、CPO、传统光模块并行,昇腾选了Hi-ONE,其他玩家各有方案,客户现在砸钱锁某条路线,万一后来主流变了,升级成本会很高;二是核心的“跑满率”问题——arXiv2026-2030年AI基础设施的论文算过,Token年增1.5倍的话,2029年集群利用率会跌到45%,年增2.5倍以上才够产能。

超节点解决了“怎么高效出Token”,但没解决“出的Token能不能卖出去”的问题。算力竞争从堆芯片转向了:能不能把每一张卡、每一度电,变成市场愿意付费的AI服务?

下一个问题留给懂行的人:当Token的账单越垒越高,数据中心的围墙拆了,下一个要拆的是算力厂商的成本墙,还是AI应用的付费意愿墙?


素材来源:钛媒体 · AI情报、AI芯片与算力、AI应用落地、AI基础设施
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown