AI

硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响

针对2.8万亿参数开源模型Kimi K3的推理效率瓶颈,海内外团队提出算子融合方案。海外团队Inferact开源tpu-megakernels,利用谷歌TPU v7将模型装入单一内核,大幅提升解码吞吐。浪潮信息则发布元脑SD200 Ultra超节点AI服务器,通过“超级算子”技术将基础算子融合,使Token生成时延降至5.85毫秒,并引入AI智能体参与算子优化,推动大模型推理效率提升。

来源:智东西 ↗

2.8万亿参数的大模型,究竟要怎么跑快?

近日,海内外团队盯上了全球最大参数量的开源模型——Kimi K3。K3凭借2.8万亿总参数、104B激活参数,刷新了开源模型的性能上限。但普通的AI服务器难以承载这么大参数量的模型,一般未经优化的超节点跑Kimi K3,初始性能可能仅在10 tokens/s左右。

面对如何让2.8万亿参数的Kimi K3跑得更快这一难题,国内外团队几乎同时交出了答卷。

9月21日,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,通过紧耦合128芯本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首破5.85毫秒。

9月23日,海外TPU推理优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到709 tokens/s。

一个用本土芯片做商业化超节点,一个用Google TPU做开源推理项目,指向了同一个技术思路:打破算子边界,把大模型推理的计算过程融合到极致。大模型推理的竞争,正从模型算法层,深入到系统软件、芯片互联和内存管理层。

一、万亿MoE太难跑,海内外团队同时盯上算子融合

万亿参数大模型推理为什么慢?实际瓶颈更在于数据搬运和内存带宽。

对于Decode(解码)阶段而言,每生成一个Token,模型都需要持续读取大量权重。传统推理框架往往需要启动大量Kernel,计算之间出现了大量细小的“空泡”。

Inferact的思路是整个模型就是“一个kernel”。其megakernel方案使用Google Pallas,把K3的92个MoE层放进一个Pallas调用,在一个Kernel内部完成整个解码过程。这套打法成立的关键是TPU v7的架构特性,数据进入VMEM后,其生命周期可以由程序显式控制。

浪潮信息则把众多基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。第一步是把小算子“焊成”大算子,减少中间停靠;第二步,把通信和计算融合,让数据传输和计算同步进行。算子数量降低10倍,模型推理性能提升3倍以上。

二、用K3优化K3:让AI参与超级算子优化

超级算子的设计和优化本身是一项复杂的工程。为此,浪潮信息在元脑SD200 Ultra适配Kimi K3的过程中引入“超级算子智能体”,让Kimi K3参与自身的推理优化。

浪潮信息采用“用K3优化K3”的思路,依托超节点系统架构,由AI智能体自动生成超级算子,再经由模型校验迭代,性能较此前再度提升50%,形成循环加速。模型已经不只是被优化的对象,也开始成为优化基础设施的工具。

三、芯片一张牌,系统一张牌:超节点打的是系统战

Agent时代,Token消耗增长数百万倍。算力供给面临两个典型困境:一是模型越来越大,算力系统需要不断突破模型能力上限;二是低成本模型Token需求迅速扩张,算力供给需要跟上。

浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算)两条线齐头并进。向上,SD200 Ultra让前沿模型跑得起、跑得快;向广,HC2000多元算力机组同等投资Token产能提升10倍。

原始来源: 智东西 ↗

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度