智谱发GLM-5.3-Flash,官方技术文档里:线上推理流量全部由10万张国产芯片集群扛下来。匿名测试期(Ox-Alpha)峰值跑过62T token,正式服务期日均真实负载约100万亿(1e14)token级。不是实验室跑demo,是实打实的全球开发者访问,全跑在国产卡上。

效率这事,智谱自己说得挺克制:硬件效率和单token成本跟主流英伟达GPU“相当”。

“相当”这词搁国产芯片身上,分量不轻。单卡算力和显存带宽都不占优,智谱在SGLang上搭专用推理引擎,W8A8量化、INT8/FP8/BF16混合缓存全用上,集群层把Encode-Prefill-Decode拆成三个独立调度池,多模态编码、prompt预填充、逐token解码各按各的算力曲线扩缩容。用系统架构去填物理器件的坑。

结果端到端比初始基线提升3倍,从“能跑”到“能规模化计价”。

价格这事,看数据就行

输入0.8元/百万token,输出2.8元,缓存命中0.23元。限时折扣期再半价。

Claude Opus 4.8是35进175出。GLM-5.3-Flash约是其四十分之一。DeepSeek V4 Flash谷时价1.5进4.5出,比这个还高一截。高并发Agent、长上下文批量召回,以前都得掐着token跑生怕超支,现在成本账不一样了。

公开信息里,哪些公司在链路里被提到过?

把10万卡集群拆开,据公开报道和智谱适配公告:

芯片层面,据《晚点 LatePost》援引知情人士称,本次供应商“或来自”华为、摩尔线程海光信息;《科创板日报》同样用了“或来自”表述。智谱官方未确认型号,技术文档只写“国产芯片集群”。据此前GLM-5系列适配公告,寒武纪天数智芯壁仞科技、沐曦、昆仑芯完成推理适配,但那是历史适配方,不等于本次10万卡确认供应方。

超节点服务器方向,据公开研报,浪潮信息联想集团中科曙光紫光股份华勤技术曾被归入相关范畴。

连接器与高速互连方向,据昇腾服务器供应链公开分析,华丰科技中航光电航天电器曾被提及;立讯精密有服务器连接器业务布局;航天电器CPU SOCKET连接器处于验证与小批阶段,据公开报道。

以上均来自已披露公开信息,仅作技术链路陈列。

泼盆冷水

这次跑通的是推理侧。训练侧对互联带宽、显存容量、分布式框架的要求更高,国产卡和海外旗舰的差异客观存在。推理消耗AI落地大部分日常算力,这块能规模化跑通,为推理侧国产化提供了第一个规模样本。训练侧能不能跟上,那是另一个问题。

【风险提示】 作者无证券投资咨询资格,全文基于智谱官方文档及公开报道做产业技术梳理,不构成投资建议,不推荐个股。文中公司名仅作技术链路说明,不代表对其价值判断。据此决策需自行承担风险。