亿百万实盘
淘股吧原创
2026-07-19 23:26
【Kimi K3缺算力,超节点为最优解,国产算力崛起】月之暗面在K3技术白皮书明确:规模化商用、完整性能推理,算力上必须使用≥64卡超节点
一、
Kimi K3:月之暗面2.8万亿参数稀疏MoE模型,896个专家,单次推理仅激活16个;支持100万Token超长上下文,采用WideEP大规模专家并行方案,天生重度依赖卡间高速通信。
超节点(Supernode):一整个机柜内64/72张加速卡(GB200、昇腾950等),通过NVLink/高速背板互联,所有GPU属于同一个高带宽通信域,卡间带宽700GB/s级别;跨普通服务器以太网带宽仅90GB/s,差距8倍以上。
官方硬性绑定:月之暗面在K3技术白皮书明确:规模化商用、完整性能推理,必须使用≥64卡超节点,超节点是K3最优部署标准,直接写进模型部署规范。
二、为什么K3架构离不开超节点(核心因果关系)
MoE专家并行产生海量All-to-All通信(最核心原因)
K3把896个专家均匀分散在多张显卡,推理流程:
token路由分发→分发至不同GPU专家计算→收集所有专家结果合并输出。
全程需要显卡之间互相传输数据(All-to-All通信),并发越高、上下文越长,流量爆炸式增长。
超节点内NVLink高速互联:通信延迟极低,算力利用率可达90%以上;
拆分到多台普通服务器(无超节点):跨机以太网严重堵瓶颈,GPU大量空闲等待数据,算力利用率不足40%,延迟翻倍、吞吐腰斩。
WideEP宽域专家并行设计,要求超大单机柜显存域
K3原生优化WideEP,把全部专家放在同一个scale-up紧耦合域(超节点机柜),完整权重常驻HBM显存,不需要频繁把权重交换到CPU内存。
如果没有64卡以上超节点,只能开启CPU内存卸载、权重分页加载,百万长文本推理直接卡顿,100万Token文档解析能力大幅阉割。
百万Token KV缓存压力集中
KDA注意力大幅降低KV缓存总量,但超长上下文下缓存仍需要多卡共享;超节点统一高速显存池可以共享KV Cache,大幅提升缓存命中率;跨机部署缓存分发成本极高,长文本场景基本无法稳定运行。
三、64卡及以上超节点(官方标准商用方案,强绑定关系)
适配场景:官方API服务、企业私有化商用、百万卷宗/大型代码库/复杂Agent递归推理;
性能表现:完整释放K3全部能力,100万上下文稳定、高并发低延迟、算力拉满;
二者关系:强依赖、最优匹配,K3架构设计就是以超节点为硬件基准;
硬件代表:昇腾950DT 64卡超节点。

打赏
点赞(1)
回复
2026-07-19 23:48