首页文章详情

“牛到家”的智谱,第一刀就砍向DeepSeek

蓝字计划2026-08-28 18:15
GLM-5.3-Flash,成了新的大模型斩杀线。

当了这么久的“价格屠夫”,DeepSeek终于也等来了砍向自己的一刀。

动刀的,是智谱。

智谱AI刚刚发布的GLM-5.3-Flash,即是风靡海外社区的神秘大模型OX Alpha,也是GLM-5系列里的第一个原生多模态模型。

虽它的名字带着Flash,但性能可一点都不Flash,特别是在Artificial Analysis Intelligence Index上,它拿下57分,高于DeepSeek V4 Pro正式版的53分;连官方也毫不谦虚,说在某些口径上,性能甚至可以对标之前Claude 的旗舰Opus 4.8。

但GLM-5.3-Flash最震撼的莫过于:模型一上线,就把“便宜”两个字写在了脸上

每百万Token输入0.8元、输出2.8元,甚至还有两周限时半价优惠。能力可以对标Opus 4.8,价格却只有它的1/40,甚至比“价格屠夫”DeepSeek的闲时价格还要低。

这价格,谁看了不迷糊?

而这,恰恰是DeepSeek最熟悉的打法。

前脚,主打超绝性价比的DeepSeek开始执行峰谷定价,涨幅最高可达1100%;后脚,GLM-5.3-Flash就价格压到了“日常消耗品”的区间。

难道,AI大模型性价比之王要“改朝换代”了?

花小钱,办大事

要了解GLM-5.3-Flash,还是得从一头神秘的“牛”说起。

8月20日,AI聚合平台OpenRouter突然上线了一个名为 Ox Alpha 的匿名模型。没官宣、没预热,没有公布开发者,没有披露参数规模,更没有给出技术报告,堪称“野模”。

适逢动画电影《牛来》走红,而“Ox”本身就是“牛”的意思,于是中文开发者顺手借梗,把Ox Alpha叫成了“牛来”模型

“野模”虽“野”,却相当大方:Ox Alpha 可以接收文本、图片和视频输入,输出文本,匿名测试版本还提供104万Token上下文,然而开发者调用它,却不用花一分钱,全部由模型公司买单。

这种几乎“白嫖”的方式,让Ox Alpha迅速走红。

上线不到一天,Ox Alpha同时登顶了OpenRouter和OpenCode两个调用量榜,创下了OpenRouter的模型发布纪录,终结了DeepSeek连续56天霸榜的纪录。

就连Hermes Agent创始人也震惊发文:这个模型正在屠杀我们所有的内部基准,究竟发生了什么?!

一时间,猜测 Ox Alpha 背后的“爹妈”成为了开发者社区的新乐子。毕竟,能拿出这种性能模型的还出手如此阔绰的,背后大概率不会是个“无名之辈”。

事实上,果真如此。

背后是智谱这样的头部大模型公司,当然解释了它为什么有底气替全球开发者买单。

但再家大业大,也经不起海量Token一直免费烧下去。Ox Alpha敢于如此阔绰,还因为这头“牛”看着块头很大,饭量却比想象中小得多。

GLM-5.3-Flash拥有3200亿总参数,但每处理一个Token,只会激活约180亿参数,占比只有5.6%。面对104万Token的超长上下文,它又把线性注意力和稀疏注意力结合起来,尽量减少处理海量历史信息所需的计算量。

两套设计,服务的其实是同一个目标:模型看起来是个3200亿参数的大块头,实际账单却尽量不按3200亿参数来开。

这才是智谱出手阔绰的另一层底气:公司负责兜底,模型自己也得学会省钱。

现在回头看,Ox Alpha匿名期间的免费大放送,本身也像是一场“低成本宣言”。

海量Token全部由智谱买单,除了测试模型、制造热度,也是在向开发者证明:智谱敢把调用量彻底放开,是因为这款模型本身就没有想象中那么烧钱。

总价下来就是一句话:这头“牛”确实吃得不多。

到了Agent场景,这一点就更加重要了。一次任务可能连续调用模型几十次甚至上百次,单次调用省下的一点成本,最终都会被高频调用不断放大。

所以,GLM-5.3-Flash的架构真正瞄准的是让Agent把大模型当成一种可以高频消耗的基础设施。

而在开发者心中,“性能强、价格低、可以放心调用”这些标签,过去几乎都属于DeepSeek。

智谱真正想冲击的,恐怕正是DeepSeek最值钱的性价比招牌

赢了“梁文峰”,输了“梁文谷”

GLM-5.3-Flash发布的时间点,相当巧妙。

7月31日,DeepSeek V4 Flash正式版上线后,OpenCode上的使用量单日增长了30%,OpenCode Go的新订阅用户也增长了30%。仅8月1日一天,DeepSeek V4 Flash的单日处理量就高达8万亿Token。

但8月17日,DeepSeek的新版定价正式生效。DeepSeek V4 Pro高峰时间段涨幅最高达1100%;DeepSeek V4 Flash峰时输出价格也从0.28美元提高到1.32美元,涨了4.71倍。

大幅涨价,最直接的影响就是开发者开始用脚投票。

此前流出的梁文锋录音中,他曾提到,智能需求没有弹性。但现实似乎没那么简单,尤其对于轻量级模型。

涨价后,DeepSeek的日Token用量很快跌到了此前峰值的一半以下。OpenCode CEO甚至估算,平台因此空出了接近10万亿Token的日需求

偏偏就在这个时候,披着“牛来”外套的GLM-5.3-Flash来了。

GLM-5.3-Flash堪称“便宜大碗”:每百万Token缓存未命中输入0.8元、输出2.8元,相当于GLM-5.3的十分之一。

上线后还有两周限时半价优惠,缓存未命中输入0.4元、输出1.4元,缓存命中输入0.115元,优惠一直持续到2026年9月9日24时。

按这组最显眼的价格来看,GLM-5.3-Flash确实杀气腾腾。

但要判断GLM-5.3-Flash究竟有没有砍到DeepSeek,只看缓存未命中输入和输出,还不够。

因为到了真实的Agent场景,缓存命中价格反而可能成为账单的大头。

所谓缓存命中,可以简单理解成:Agent反复调用模型时,经常会带着相同的系统提示词、工具定义、历史对话和代码。这些内容平台此前已经计算过,下一次可以直接复用

既然是用过的东西再拿出来用,那价格当然也比“缓存未命中”的便宜。

这在普通聊天里可能没那么重要,但Agent完成一次任务,往往要连续调用模型几十次甚至上百次,同一套任务背景和历史记录会被反复塞进上下文。特别是写代码这类输入很长、输出相对较短的任务,缓存命中价格会更多地影响账单。

这也是智谱定价里藏着的一点小心思。

它在宣传中重点突出每百万Token输入0.8元、输出2.8元,以及限时半价后的0.4元和1.4元。按照缓存未命中输入和输出比较,GLM确实比DeepSeek便宜。

但GLM-5.3-Flash的标准缓存命中价格是0.23元,半价期间也要0.115元。DeepSeek V4 Flash峰时只要0.1元,谷时更低至0.05元。

只看缓存这一项,即便在半价期间,GLM也比DeepSeek峰时更贵;恢复原价后,更是DeepSeek峰时的2.3倍、谷时的4.6倍。

假设一个Agent任务累计输入50万Token,其中99%命中缓存,最终只输出1万Token。也就是49.5万Token按照缓存命中计费,剩下5000 Token按照缓存未命中计费。

优惠结束后,这个任务使用GLM-5.3-Flash大约需要0.146元;使用DeepSeek V4 Flash,谷时只需要约0.077元,峰时则需要约0.155元。

按照这个假设,同一个任务,GLM比“梁文谷”贵了接近90%,只比“梁文峰”便宜了不到6%。

这也解释了为什么有开发者实际使用后发现,GLM综合用下来比DeepSeek谷时更贵,只是比峰时便宜:对于高缓存命中的Agent任务,GLM在输入和输出上省下的钱,很容易被更贵的缓存吃掉。

更关键的是,智谱的半价优惠只有两周,9月10日就会恢复原价。

所以,GLM-5.3-Flash只能砍过“梁文峰”,却未必砍得过“梁文谷”。

但除了缓存命中,GLM-5.3-Flash其他方面的定价,确实全面低于DeepSeek。

DeepSeek已经够便宜了,智谱究竟是怎么在保持不错性能的同时,还把价格地板继续打穿的?

而答案,就藏在支撑这头“牛”的算力里。

还是“国产牛”

不光模型出自国内,撑住这波全球海量真实流量的算力,用的也是国产方案

匿名上线期间,Ox Alpha单日处理量一度达到约62万亿Token,线上流量全部由10万张国产芯片扛下。有媒体报道,这些芯片可能来自华为、摩尔线程和海光。

当然,把10万张卡堆在一起,并不会自动变成一套高效的推理系统。

按照智谱的说法,这批国产芯片面临的主要瓶颈是内存容量和带宽。

为了支撑最长104万Token的上下文,智谱在SGLang基础上搭建了一套专用推理引擎,把多模态编码、提示词预填充和逐Token解码拆开,分别进行调度和扩缩容,再通过量化、并行和内存优化,尽可能把国产芯片的性能榨出来。

更有意思的是,这套系统的优化也有GLM-5.3自己参与。智谱用Infra Agent协助工程师开发和优化算子、诊断性能瓶颈、改进部署服务栈,形成了一个“模型优化系统,系统承载模型”的循环。

智谱称,与同一批硬件上的初始基线相比,这套系统的端到端服务性能提升了3倍,硬件效率和单Token成本已经达到主流英伟达GPU的水平。

国外半导体研究机构SemiAnalysis也评价称,英伟达的护城河再次受到了考验。

模型架构负责少算,推理系统负责把国产芯片的性能尽量榨出来,两者合在一起,才构成了智谱继续压低价格的工程底座。

这当然不是说国产芯片已经全面追上英伟达。

10万张国产卡承载全球开发者的真实流量,能够证明的是这套系统已经具备大规模服务能力;至于硬件效率和单Token成本是否真正达到主流英伟达GPU的水平,目前仍主要来自智谱自己的测算。

但这头“牛”真正难缠的地方,是它背后站着的,除了一个国产模型,还有一整套被真实流量压过的国产算力方案。

对于DeepSeek来说,这恐怕比单纯的低价更棘手。

参考资料:

[1]量子位:神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡

[2]科技狐:霸榜多日的“牛来”模型,果然是智谱GLM-5.3-Flash!

[3]硅基深蓝:智谱的牛来了!股价暴涨12.62%,吃透DeepSeek开源技术

[4]智能纪元AGI:“唐圣”重置了!智谱开源“牛来”多模态模型,1亿token花3元

[5]APPSO:DeepSeek的斩杀线一夜被斩杀,便宜大碗才是真旗舰

[6]数字生命卡兹克:这一次,智谱用GLM-5.3-Flash实现了真正的智能平权

本文来自微信公众号“蓝字计划”,作者:周末,36氪经授权发布。