智谱“牛来”模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40
匿名六天之后,“牛来”终于揭开了最后一层面纱。
8月26日晚,智谱正式发布并开源GLM-5.3-Flash。这款此前以Ox-Alpha身份在OpenRouter、OpenCode匿名测试的模型,总参数量320B、激活18B,是GLM-5系列首个原生多模态模型。
与GLM-5.3相比,这个模型的价格低到有些出乎意料,它的价格仅为GLM-5.3的1/10,限时折扣期进一步降至1/20;与Anthropic旗舰模型Claude Opus 4.8相比,约为1/40。
Artificial Analysis目前给Claude Opus 4.8的Intelligence Index评分为57分,它的官方API标准价格为每百万Token输入5美元、输出25美元。 智谱披露,GLM-5.3-Flash在同一指数中同样获得57分;在智谱自研的Z.ai Code Bench中,两者的Coding实际使用体验也处于相近水平。
虽然这并不意味着GLM-5.3-Flash已经在所有任务上“等于”Opus 4.8,单项Benchmark、长任务稳定性和真实Agent任务仍可能存在差异,但至少从第三方综合测试来看,一款开源模型已经进入此前主要由高价闭源旗舰占据的能力区间。
更重要的是,这次低价并不是建立在海外GPU推理集群之上。
01
“牛来”背后,全部跑在国产芯片上
GLM-5.3-Flash的发布,也回应了此前围绕Ox-Alpha最大的一个疑问:如此大规模的海外免费测试,背后的算力从哪里来?
智谱确认,正式发布前,GLM-5.3-Flash以Ox-Alpha为名,在OpenCode和OpenRouter进行匿名测试。模型很快成为当周最受欢迎的模型,并创下两个平台调用量新高。
这些请求流量全部由国产芯片提供算力。
据悉,智谱共调用了超过10万张国产芯片集群用于该模型服务,但未公布具体的芯片型号。这也是智谱首次尝试使用一个大规模国产芯片集群,直接承载来自全球开发者的真实线上负载。
匿名测试期间,用户并不知道模型背后是谁,也不知道使用什么芯片,只会根据速度、稳定性和效果决定是否继续调用。国产算力因此接受了一次持续的真实流量测试,并不是实验室环境下的峰值性能展示。
根据官方信息,为了让前沿模型真正跑在国产芯片上,智谱对推理系统做了大量针对性改造。
单张国产芯片当前面对的主要瓶颈包括内存容量和带宽,而GLM-5.3-Flash又原生支持最长1M上下文,对显存和通信提出了更高要求。
智谱基于SGLang构建了专用推理引擎,并加入节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化以及Layer Split等技术,通过“以算力换带宽、以通信换显存”的方式降低硬件限制。
在集群层面,采用Encode-Prefill-Decode,也就是EPD分离架构。多模态编码、Prompt预填充和逐Token解码被拆分为三个可以独立调度和扩缩容的工作池,让不同阶段按照各自的算力特征运行。
按照智谱公布的数据,与同一批硬件上的初始基线相比,这套方案将端到端服务性能提高了3倍。智谱称,最终硬件效率和单Token成本已经达到与主流英伟达GPU相当的水平。
这里需要区分两个概念。
所谓“1/40”,并不是说国产芯片的硬件推理成本只有海外GPU的1/40。目前公开数据并不足以支持这样的比较。
更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了Claude Opus 4.8的大约1/40。
02
320B,为什么比上一代旗舰还强
价格下降的另一半原因来自模型结构。
GLM-5.3-Flash总参数量320B,每个Token激活18B参数。作为参照,GLM-4.5总参数量355B、激活32B,共92层;GLM-5.3-Flash则为320B总参数、18B激活参数和45层。相比GLM早期旗舰架构,每Token实际参与计算的参数量和网络深度都明显下降。
但按照智谱公布的Benchmark和实际使用结果,GLM-5.3-Flash整体能力反而超过了参数规模更大的GLM-5.2。
这意味着“Flash”这次不再只是把旗舰模型简单缩小,它从架构层面重新设计了推理成本。
GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。
其中,线性注意力通过递归机制处理局部依赖;稀疏注意力则使用轻量级索引器,在长上下文中召回真正需要计算的全局信息。
针对1M上下文下索引器自身的内存和延迟问题,智谱又引入IndexPool,通过加权池化,把索引器原本的4个缓存向量压缩成1个。
按照智谱的测算,与GLM-5.3相比,GLM-5.3-Flash的注意力计算量降低3.01倍,KV缓存大小降低4.44倍。
在智谱列出的GLM-5.3、DeepSeek-V4-Flash和Kimi-K3等基线模型中,GLM-5.3-Flash的注意力计算量最低。不过,其平均每层KV缓存大小仍略高于Kimi-K3和DeepSeek-V4-Flash。
这组数据一定程度上解释了为什么价格可以“打下来”。
尤其对于Coding和Agent任务,一个任务可能连续运行数十分钟甚至数小时,模型不断读入代码、历史对话和工具返回结果,上下文持续增长。注意力计算量和KV缓存直接决定了长任务需要消耗多少显存、算力和推理成本。
GLM-5.3-Flash还引入流形约束超连接mHC,并使用30T Token多模态预训练语料,在降低参数量和计算量的同时,继续提升模型扩展能力。最终形成的不是一款单纯“更小”的模型,更准确的说,是一套围绕低成本推理重新设计的模型架构。
03
Flash开始进入前沿模型区间
另一个变化,是“Flash模型”的定位正在改变。
过去,Flash、Mini、Air通常意味着更快、更便宜,同时接受明显的能力折损。
GLM-5.3-Flash320B总参数、18B激活参数,在Artificial Analysis综合智能指数上拿到57分,与Claude Opus 4.8持平,同时价格只有后者的约1/40。
它还是GLM-5系列第一款原生多模态模型。
这次加入视觉,并不是只是简单增加一个“看图”能力,目的为了直接服务于Coding和Agent。对于网页、游戏、3D建模等任务,模型最终生成的并不仅是代码,还有真正呈现在屏幕上的页面、交互和虚拟场景。
只有模型能重新“看见”自己生成的结果,才能知道按钮是不是错位、页面是否真的渲染成功、3D场景是否符合预期,再继续修改。
智谱因此专门训练了模型的自我视觉判断和测试时改进能力,让模型在生成之后继续观察结果,并根据环境反馈迭代。
例如,官方展示的一个案例中,GLM-5.3-Flash在没有外部素材的情况下,自主运行16小时,在Blender中搭建了一套约400平方米的专业主厨住宅与测试厨房。
类似机制也被延伸到PPTX、PDF、DOCX、XLSX,以及金融和法律等专业任务:模型不仅生成内容,还能通过视觉结果继续检查和修改自己的输出。
对于Agent来说,这种变化比“多模态”本身更重要。过去的Coding模型主要判断代码是否正确;但它更需要去判断一项工作最终有没有真正完成。
如果单独看GLM-5.3-Flash,这是一款参数更少、推理成本更低,同时进入前沿能力区间的新模型。
但Ox-Alpha匿名六天以来,测试了国产芯片能不能稳定、经济地承载一个前沿模型,并直接服务全球真实开发者。
与此同时,GLM-5.3-Flash采用MIT协议开源,并同步开放API。
前沿模型能力、开放权重、国产芯片大规模在线承载,以及极低API价格,同时出现。
本文来自“腾讯科技”,作者:晓静,编辑:徐青阳,36氪经授权发布。