2.8万亿参数的大模型,究竟要怎么跑快?
近日,海内外团队盯上了全球最大参数量的开源模型——Kimi K3。K3凭借2.8万亿总参数、104B激活参数,刷新了开源模型的性能上限。但普通的AI服务器难以承载这么大参数量的模型,一般未经优化的超节点跑Kimi K3,初始性能可能仅在10 tokens/s左右。
面对如何让2.8万亿参数的Kimi K3跑得更快这一难题,国内外团队几乎同时交出了答卷。
9月21日,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,通过紧耦合128芯本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首破5.85毫秒。
9月23日,海外TPU推理优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到709 tokens/s。
一个用本土芯片做商业化超节点,一个用Google TPU做开源推理项目,指向了同一个技术思路:打破算子边界,把大模型推理的计算过程融合到极致。大模型推理的竞争,正从模型算法层,深入到系统软件、芯片互联和内存管理层。
一、万亿MoE太难跑,海内外团队同时盯上算子融合
万亿参数大模型推理为什么慢?实际瓶颈更在于数据搬运和内存带宽。
对于Decode(解码)阶段而言,每生成一个Token,模型都需要持续读取大量权重。传统推理框架往往需要启动大量Kernel,计算之间出现了大量细小的“空泡”。
Inferact的思路是整个模型就是“一个kernel”。其megakernel方案使用Google Pallas,把K3的92个MoE层放进一个Pallas调用,在一个Kernel内部完成整个解码过程。这套打法成立的关键是TPU v7的架构特性,数据进入VMEM后,其生命周期可以由程序显式控制。
浪潮信息则把众多基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。第一步是把小算子“焊成”大算子,减少中间停靠;第二步,把通信和计算融合,让数据传输和计算同步进行。算子数量降低10倍,模型推理性能提升3倍以上。
二、用K3优化K3:让AI参与超级算子优化
超级算子的设计和优化本身是一项复杂的工程。为此,浪潮信息在元脑SD200 Ultra适配Kimi K3的过程中引入“超级算子智能体”,让Kimi K3参与自身的推理优化。
浪潮信息采用“用K3优化K3”的思路,依托超节点系统架构,由AI智能体自动生成超级算子,再经由模型校验迭代,性能较此前再度提升50%,形成循环加速。模型已经不只是被优化的对象,也开始成为优化基础设施的工具。
三、芯片一张牌,系统一张牌:超节点打的是系统战
Agent时代,Token消耗增长数百万倍。算力供给面临两个典型困境:一是模型越来越大,算力系统需要不断突破模型能力上限;二是低成本模型Token需求迅速扩张,算力供给需要跟上。
浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算)两条线齐头并进。向上,SD200 Ultra让前沿模型跑得起、跑得快;向广,HC2000多元算力机组同等投资Token产能提升10倍。
原始来源: 智东西 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。