克雷西发自凹非寺
量子位 | 公众号 QbitAI
AI 算力的竞争,多年来就一个字——堆。
堆卡、堆机柜、堆发电机……似乎计算卡足够多、集群足够大,就能站在食物链顶端。
但算力「够不够用」这个问题,已经不再能单靠堆卡来解决,它开始分化出越来越多的层面。
第一个问题关于智能上限,也就是你的算力能撑起多强的智能。
前沿模型的参数规模、上下文长度、推理深度在同时变大,Agent 可能连续运行几个小时甚至几天。
模型在一台机器里装不装得下、跑得快不快、长时间跑起来稳不稳,都需要被重新考量。
另一个问题是智能规模,这个问题更直击灵魂——你的算力能以多低的成本生产多少智能?
Token 需求在爆发,但推理负载是多元的,Prefill 和 Decode 的计算特征不同,堆同一种算力已经覆盖不了这些差异。
智能上限和智能规模,两个问题各自独立,又相互关联,只解决其中一个,无法突破全部的算力瓶颈。
刚刚的 AICC(人工智能计算大会)2026 上,IDC 发布了《2026 年中国人工智能计算力发展评估报告》,把这两个方向拆开讲了一遍。
「一分为二」的算力缺口
Agent 大爆发以后,AI 对算力的需求正在发生质变。
过去,人们使用大模型时,算力调用更像是「脉冲式」的,用户问一个问题,系统返回一个答案,只调用一次算力。
但在 Agent 接管任务之后,情况变了。一个人类意图可能触发几十次、几百次连续推理;多个 Agent 组成协作网络之后,系统连续运转的时长,还能进一步增加到几个小时甚至好几天。
原本一次次短暂发生的算力请求,开始变成持续不断的计算负载,并进一步给基础设施带来新的压力
这种长流的压力,可以拆解出三个影响因子。
- 第一个是任务执行次数,IDC 报告显示,到 2030 年,全球每年的 AI 推理任务将增长 4000 万亿次;
- 第二个是单任务 Token 消耗量,过去一次简单问答只消耗几十个 Token,现在一次多轮任务决策要消耗几十万个;
- 第三个是多智能体协同的「放大系数」,一个用户操作会被拆解成多条 Agent 指令,Agent 之间传递上下文、汇总结果又拉长了整条任务链路,进一步放大了前两项的增长。
三个因子以乘法的形式叠加在一起,将算力需求的增长曲线拉到了前所未有的高位。

IDC 数据显示,从今年到 2030 年,全球 Token 消耗量的复合增长率将达到 4822.6%,Agent 吃掉的 Token 正在急剧膨胀。
算力的供给增长速度,却滞后于需求的变化
IDC 报告显示,全球 AI 算力需求满足率从 2024 年的 79% 一路下滑,2027 年预计跌至 71%,即便此后上游半导体供应链压力有所缓解,到 2030 年也只能恢复到 77% 左右。
百分比的波动看起来不大,但需求基数在急速膨胀,到 2030 年,算力缺口的绝对值将达到 3809 亿美元,扩大到 2024 年的将近十倍。

过去,弥补这种缺口的方式主要是靠「大力出奇迹」,也就是通过集群规模的扩展,堆叠更多的算力。
Agent 时代的推理负载种类繁多,对算力设施的要求也不尽相同
Prefill 阶段是高并行、高计算密度的任务,Decode 阶段要逐 Token 串行处理、更吃内存带宽,Attention 需要频繁访问不断增长的 KV Cache,MoE 包含稀疏计算和大规模路由调度,多模态模型还有独立的 Encoder 模块……
这些负载各有各的计算特征,还会随着上下文长度、输出长度和并发规模动态变化。
Agent 任务中,首轮对话的上下文可能只有一两万个 Token,经过上百轮对话后会扩展到三四十万个,系统瓶颈在计算、显存、带宽和通信之间不断转移。
所以,单纯堆料非但带不来线性的容量增长,反而会造成资源配比失衡,让一部分算力长期闲置,另一部分却持续过载。
实际上,这个缺口包含的是两个方向的问题。
一个是能力上限
前沿模型的参数规模、上下文长度、推理深度在同时变大;一台机器装不装得下、跑不跑得快、长时间能不能跑稳,三个问题同时压了过来。
另一个关乎产能
Token 需求在爆发,但负载类型各异,不同推理阶段需要不同特征的算力,靠一种算力一招鲜吃遍天的路数,已经走不通了。
浪潮信息首席 AI 战略官刘军,把这两个方向概括为CapabilityCapacity

Capability AI Compute 是能力型智算,支撑前沿模型去碰那些过去碰不了的问题。
如今,AI 已经能从靶点出发发现新的药物分子、完成筛选和设计并推进到临床试验,能求解困扰学术界几十年的 NS 方程和孪生素数猜想,能自主设计 AI 芯片并不断迭代性能……
这些任务的共同特征是推理链条长、模型规模大、对算力系统的承载能力和稳定性要求极高。
Capacity AI Compute 是容量型智算,让智能的供给更充足也更便宜,让更多人和企业用得起。
算力也是同一个道理,光有能力上限的突破不够,让足够多的人用得到,才能真正落到实处。
捅破「能力天花板」,瓦解「产能焦虑」
面对这两层问题,浪潮信息在 AICC2026 上发布了两款产品——超节点 AI 服务器「元脑 SD200 Ultra」和多元算力机组「元脑 HC2000」
突破单节点智能上限
SD200 Ultra 解决的是前沿模型装不下、跑不快、跑不稳的问题。

「装得下」是从 0 到 1 的一步,模型需要先能运行,才有讨论性能的空间,SD200 Ultra 通过「紧致扩展」解决这个问题。
它延续了去年 SD200 采用的 3D Hyper Mesh 架构,整机内的芯片数量从 64 颗增加到了 128 颗,显存和扩展存储也相应提升到了 8TB 和 64TB。
SD200 Ultra 将足够多的计算、存储和通信资源压缩进一个物理边界内。
目前全球最大的开源模型 Kimi K3 有 2.8 万亿个参数,SD200 Ultra 可以单机装下并高效运行。
不仅如此,SD200 Ultra支持在单机上部署 10 万亿参数的模型,提前为未来更先进的开源模型做好了基础设施准备。
跑起来之后,人们便开始追求速度。
128 颗芯片要协同工作,跨芯片的数据交换每秒高达数十万次,传统方式依赖软件调用和缓冲区中转来搬运数据,延迟开销很大。
SD200 Ultra 分两层解决这个问题。
第一层是「统一寻址」,通过全局统一编址、虚拟影子设备注册和跨域地址翻译,让 128 颗芯片的显存形成一个统一的地址空间,远端资源的访问从消息通信加数据搬移变成了地址空间内的直接访问。
第二层是「对称直连」,在统一寻址的基础上,通过对称内存技术实现 GPU 显存直连,GPU 可以像访问本地显存一样直接读写远端 GPU 的显存,由 GPU 发起通信,跳过地址转换和封包中转,通信路径大幅缩短。

最终,SD200 Ultra 的 All to All 通信时延缩短到 0.69 微秒,达到国际主流超节点产品相当的水平。
除了通信之外,计算也需要优化。
以 Kimi K3 为例,其单步推理涉及数千个算子调用,运行时大量时间消耗在算子启动、数据搬运和同步等待上,真正用于计算的时间反而有限。
SD200 Ultra 构建了「超级算子」技术,把推理过程中 Attention、FFN、MoE 等众多基础算子融合成计算与通信一体的大算子,算子数量降低到了十分之一,减少了内核启动次数和显存访问开销,隐藏了通信延迟。

通过超级算子优化,SD200 Ultra 运行 Kimi K3 的推理性能提升了 3 倍以上,Token 生成时延低至 5.85 毫秒。
有意思的是,超级算子的优化过程使用了 K3 来分析和重构推理流程,由模型自己改进自己的执行效率。
还有一个容易被忽略的问题是稳定性。
Agent 的复杂任务可能连续运行几小时甚至几天,期间经历大量模型调用、工具调用和数据读写,任何一次计算或通信故障都有可能中断整条任务链路,导致之前所有的推理和执行功亏一篑。
SD200 Ultra 采用铜互联方案,减少了光电转换环节,降低了长时间运行中因电路故障导致任务中断的风险。
让算力产生更多智能
HC2000 面向的是另一个方向,它解决的是 Token 产能不足的问题。
其核心思路,是让不同类型的算力各司其职

HC2000 的硬件基础是高密液冷 AI 整机柜
它采用全液冷设计加上高通流供电,突破了传统风冷机柜的散热和供电瓶颈,单柜供电能力超过 300 千瓦,最多承载 256 张 AI 加速卡,算力密度达到传统风冷机柜的 4 倍。
其通信架构也升级到 Directcom 2.0,计算与通信带宽 1 比 1 均衡配比,柜内聚合带宽达 200Tbps,能够跨柜多平面无损扩展,All to All 通信性能提升 50% 以上。
在这个硬件底座上,HC2000 实现了多元算力承载,让不同类型的芯片按推理阶段分工协作:
- Prefill 阶段选择大算力芯片配合成本更优的显存颗粒,匹配高并行、高计算密度的特征。
- Decode 阶段选择大容量 HBM 芯片,兼顾显存容量和带宽。
- FFN 计算环节选择 3D RAM 堆叠芯片,缩短数据搬运路径,缓存带宽可以达到数十 TB 每秒。
整机柜支持成熟的工业标准架构模组,适配多种算力芯片,不同芯片各自承担最适合的负载。

其中,负责把这些不同类型的算力协同起来的是「MCIS 多元算力协同推理软件栈」
MCIS 覆盖了从请求路由、PD 分离推理到算力动态调整的全链路。
在 PD 算力动态调整方面,MCIS 构建了测量、分配、监控、调整的完整流程,在模型部署前通过性能仿真评估不同芯片组合和 PD 配比,找到适合的配置方案。
上线后,MCIS 会对计算、缓存、传输各环节的实际表现进行全链路监控,识别瓶颈并与预测做对比。
业务负载变化时,MCIS 会重新评估 PD 配比和实例分配,持续优化资源分配方式。

在多元算力 KV Cache 管理方面,MCIS 打通了不同类型算力之间的点对点数据直传,避免 CPU 中转和重复拷贝,数据传输性能提升近 5 倍。
MCIS 还会根据 KV Cache 数据的冷热程度构建分级存储,结合多级流水并行聚合,使节点内磁盘I/O性能提升 32 倍,突破了 KV Cache 在大规模多元算力环境下的存储和传输瓶颈。
最终在典型的 Agent 任务场景中,HC2000 搭配 MCIS 在同等投资下实现了 10 倍的 Token 产能提升。
从「提供算力」到「生产智能」
Capability 和 Capacity,是解决 AI 算力瓶颈的两个方向,但它们并不是两条分道扬镳的路线。
它们互为因果,Capability 突破出来的新能力,经过算法优化和工程迭代,会以更低的成本向下渗透,变成 Capacity 需要规模化供给的东西;
而 Capacity 把智能送到更多人手中之后,产生新的应用和新的需求,这些需求又会反过来推动下一轮 Capability,从而去挑战更高的天花板。
两个方向殊途同归,汇成了一条螺旋,而且这条螺旋正在加速。
去年,全球规模最大的开源模型是 DeepSeek-R1,参数量 6710 亿;今年这把交椅的主人变成了 Kimi K3,参数量达到了 2.8 万亿。
训练和运行它们需要极大的算力投入,只有少数机构能负担得起。
但各个模型厂商,已经在用更小的参数量和更低的推理成本,把前沿模型验证过的能力向下传递。
顶部的突破不断制造新的能力,底部的工程不断把这些能力变便宜,中间的应用层则不断长出新的需求,把螺旋继续往上推。
这条螺旋在企业端已经转起来了。
同一家公司,面对需要探索和突破的任务,会调用前沿模型去寻找未知的答案;面对已经验证过的日常流程,则切换到更轻量的模型批量执行。
Capability 负责思考和规划,Capacity 负责执行和重复,两种算力在同一个业务里并行运转
刘军在 AICC 上的演讲中提到了一个历史类比。
世界上第一台通用电子计算机 ENIAC 非常重要,但真正改变几十亿人工作和生活的是个人电脑和智能手机。
最先进的发电技术非常重要,但真正改变工业社会的是稳定廉价的电力进入千家万户。
AI 正在经历同样的过程,前沿智能的首次突破决定了 AI 能做到什么,而智能的普及程度才决定它能改变什么。
知识、推理、判断、创造,这些能力过去高度依赖于人类个体,但一个科学家穷其一生能深入研究的问题是有限的,高水平的智能天生就是稀缺资源。
今天,AI 让智能有可能像计算和电力一样,成为一种可以被大规模生产和供给的资源。
这个变化,也在重新定义算力产业的价值尺度——从「提供算力」,到「生产智能」。
用刘军的话说,「生产智能」的今天,用户买算力设施,就应该像买电冰箱一样,插上电就能产 Token。
