千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷
智东西8月27日报道,昨晚,阿里千问大模型团队开源多模态MoE模型Qwen3.8-Flash-Next,该模型是基于下一代Qwen4架构构建的先导预览版。
Qwen3.8-Flash-Next主模型参数量为125B,额外配备51B的N-gram Embedding,每token激活6B参数,原生支持262144 token上下文,并可通过YaRN扩展至1百万token。
相比于Qwen3.7-Plus,Qwen3.8-Flash-Next降低了训练与推理成本,训练开销仅约为前者的1/9,但在编程和办公任务上性能更强,且该模型在千问团队放出的基准测试中绝大多数都超过DeepSeek-V4-Flash正式版。
在价格方面,Qwen3.8-Flash即将上线千问AI平台,对外提供API服务,每百万Tokens输入1元,输出3元,相比空闲时段的DeepSeek-V4-Flash输入价格低33.33%,输出价格低33.33%。
昨晚,智谱也开源了GLM-5系列首个原生多模态模型GLM-5.3-Flash(320B-A18B),这也是此前在网上爆火的匿名模型Ox-Alpha(“牛来”模型),同样将价格打了下来。其新模型总参数320B,在智谱自研Z.ai Code Bench体感评估中编程表现与Claude Opus 4.8相当,价格更是降到了GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40。
▲Qwen3.8-Flash-Next与DeepSeek-V4系列模型价格对比(智东西制图)
Qwen3.8-Flash将首发上线“千问办公”,API即将上线。
在千问AI平台上,该模型以qwen3.8-flash的名称提供服务,千问AI平台支持行业标准协议,包括兼容OpenAI的Chat Completions和Responses API,以及兼容Anthropic的接口,同时Qwen API支持Anthropic API、OpenAI Responses协议,可直接配合Claude Code、Codex使用。
其博客提到,千问提前释出结构上的改动,是为了在发布Qwen4完整模型家族之前,先让社区对其进行检验。
在千问的推特评论区下方,不少海外开发者已经迫不及待想要体验下千问的新模型了,还有网友只是一味夸赞称“这太强了”、“我们不需要OpenAI”、“Qwen未来有可能超越Opus”。
目前,Qwen3.8-Flash-Next的模型权重在Hugging Face与ModelScope发布,默认1百万上下文并内置官方工具的生产版本。
技术报告:
https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
Hugging Face开源地址:
https://huggingface.co/Qwen/Qwen3.8-Flash-Next
魔搭社区开源地址:
https://www.modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
01.
十余项测试超过
DeepSeek‑V4‑Flash、Claude‑Opus‑4.6
Qwen3.8-Flash-Next围绕Attention、Residual、Embedding 和 Optimization四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化了计算效率、模型容量和训练稳定性。
▲Qwen3.8-Flash-Next模型架构
千问大模型团队放出的基准测试结果显示,Qwen3.8-Flash-Next在智能体、编程、通用能力以及多模态等方面绝大多数都超越了Qwen3.8‑27B、Qwen3.7‑Plus、DeepSeek‑V4‑Flash‑0731、Claude‑Opus‑4.6(Max),拿下第一。
具体来看在纯文本能力方面,Qwen3.8-Flash-Next在10项任务拿下第一,超过Qwen3.8‑27B、Qwen3.7‑Plus、DeepSeek‑V4‑Flash‑0731、Claude‑Opus‑4.6(Max)。
其中编程能力上,Qwen3.8-Flash-Next在智能体编程DeepSWE1.1、SWE‑bench Pro多语言软件工程上拿下第一,仅在仓库级代码生成Repo‑level code generation测试中略逊于DeepSeek。
智能体上,千问新模型在长周期办公任务、专业工作任务、前沿智能体任务的加权部分得分、真实工具调用测试机中均拿下第一,在前沿智能体任务的一次性完全通关率上得分低于DeepSeek‑V4‑Flash。
通用能力上,Qwen3.8-Flash-Next在指令遵循、科学推理、竞赛代码上拿下第一,仅在多学科综合推理能力上略弱于Claude‑Opus‑4.6。
多模态能力方面,该模型13项任务均超过其他三个模型拿下第一。
多模态智能体能力中,主要考验模型是否能看懂截图,操作手机、电脑,复现APP、网页开发、多模态工具调用。Qwen3.8-Flash-Next在这一部分中均拿下第一。
通用多模态能力主要考察模型的看图理解、长视频、图表、数学能力,Qwen3.8-Flash-Next在绝大多数测试中均超过其他三个模型,仅在不给特殊推理提示的科研图标分析测试中,分数低于DeepSeek。
千问还放出了Qwen3.8-Flash-Next-Base在6B激活参数的情况下,与Qwen3.8-27B及Qwen3.7-Plus的base模型比较结果,其在14个benchmark中的8个上取得最优结果,其中51B的N-gram embedding参数是确定性寻址的,不进入每token的矩阵乘预算。
当前基础模型所需的参数量不断增加,上下文窗口长度不断增加,核心问题已不再是究竟能把规模做到多大,而是实现规模化的效率有多高。基于此阿里千问大模型团队进行了架构上的创新,其开源的Qwen3.8-Flash-Next,正是阿里朝这一目标迈进的阶段性关键成果。
该模型是其基于Qwen4架构打造的实验预览版模型,核心是重新深度思考现代大语言模型的核心组件在大规模运行场景下如何协同工作。
02.
四大架构创新
让新模型更强更稳更划算
Qwen3.8-Flash-Next主要包含四大创新点:
1、GDN与QSA(通义稀疏注意力)结合,实现高效记忆和精准检索
传统全局注意力可以直接访问所有历史token,但上下文越长,计算和KV Cache访存成本越高。
其延续Qwen3.5的架构设计采用GDN+Attention的Hybrid架构:每四层中三层使用Gated DeltaNet(GDN),将历史信息持续压缩到固定大小的状态中;另一层保留全局Attention,负责精确检索全局信息。
研究人员对全局Attention进一步引入Qwen Sparse Attention(QSA),通过只关注重要上下文来减少长序列下的计算。QSA通过压缩式轻量Indexer在micro-block(微块)粒度上筛选重要上下文,降低长序列 Attention 开销。这样不仅减少了实际Attention的计算量,也降低了“寻找重要上下文”本身的上下文索引成本。
可以理解为GDN负责高效“记住”,QSA负责精准“查找”。
在1M token上,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache命中率为90%),Qwen3.8-Flash-Next在1M上下文下的Prefill吞吐达到Qwen3.7-Plus的8.6倍。
2、引入Gated Residual(GR,门控残差),给信息更多传递路径
传统Transformer架构中,各层持续在同一条Residual Stream上读写信息,随着网络加深,早期特征不断与后续信息混合,重要信息更容易被逐渐稀释。
GR可以看作两种思路的结合:一方面延续Hyper-Connection(超连接)将residual stream(残差流)扩展为多分支的设计,另一方面将GatedNorm的逐元素动态门控融入residual read(残差读)。最终原本单一的residual stream被扩展成4条并行分支,模型可以根据当前内容动态决定从不同分支读取多少信息,以及向不同分支写入多少信息。
这可以把它理解为把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。研究人员实际分析中也观察到,其中一条branch(残差分支)会自然形成连接第一层Attention和大部分中后层的长距离通道。
GR 还进一步简化了Hyper-Connection:当read/write足够灵活后,额外的branch mixing(分支混合)已经没有明显收益,因此可以直接去掉,减少访存开销和不稳定因素。归一化后的Gate同时能够有效抑制activation outlier(激活异常值)、提升训练稳定性;Residual State(残差状态)支持使用FP8存储,进一步降低访存开销。
3、引入N-gram Embedding,低成本扩展模型容量
研究人员受到Gemma 3n中Per-Layer Embedding(逐层嵌入)和DeepSeek Engram等工作的启发,进一步引入N-gram Embedding,从Transformer参数之外的维度扩展模型容量。
普通Embedding根据单个token查表;N-gram Embedding则结合当前token与前几个token组成的局部上下文进行查表,为常见短语和局部模式提供额外表示。其核心优势是可以增加大量参数,同时几乎不增加每个token的计算量。
Qwen3.8-Flash-Next额外引入了51B N-gram Embedding参数。由于查询位置可以提前确定,这些参数可以存放在Host Memory中,通过异步Prefetch与模型计算重叠,无需长期占用GPU显存。最终,模型只在前部使用一层N-gram Embedding,以较低的额外成本增加了一个大规模的“局部模式记忆库”。
4、Optimization:优化Muon在大模型训练中的使用方式
Qwen3.8-Flash-Next使用Muon Optimizer训练,并围绕三个关键问题进一步优化Muon在大模型训练中的使用方式:正交化精度、Muon与AdamW的参数分工,以及融合参数矩阵的拆分。
对于真正作为二维线性映射的参数,例如Attention、GDN和MoE Expert中的主要权重,研究人员使用Muon;Embedding、MoE Router、GR低秩参数等则继续使用AdamW。
对于工程实现中融合存储的QKV、SwiGLU和GDN Projection,先按照实际对应的独立线性变换进行拆分,再分别执行正交化。
针对新的模型结构和Optimizer,研究人员重新拟合了Scaling Law,结果显示模型可以稳定使用更大的Learning Rate(学习率)和Batch Size(批次大小),进一步提升收敛效率和大规模并行训练吞吐。
其实验还发现,过去大模型训练中常见的Batch Size Warmup(批次大小预热)已经不再必要,从小Batch逐渐增加到目标Batch并没有改善最终效果,反而需要额外执行18.8%的优化器步数。因此,在最终训练配置中,研究人员直接从目标Batch Size开始训练。
03.
其余架构优化
继承自Qwen3‑Next的成熟架构组件
其余的架构优化沿用Qwen3-Next所确立、并在Qwen3.5–Qwen3.8系列中不断打磨的设计:
极致稀疏MoE:在全局负载均衡下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练loss,因此Qwen3.8-Flash-Next采用较大的专家池,每token只路由少量专家,并配合一个共享专家。
Multi-Token Prediction:MTP模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下speculative decoding(推测解码)的接受率,同时也提升主干本身的性能,其中的全注意力层同样被替换为QSA。
训练稳定性:保留Zero-Centered RMSNorm并对norm weight施加weight decay、注意力输出门控机制,以及MoE路由参数初始化的归一化,这些设计使小规模消融结果更可靠,也有助于大规模训练平稳进行。
04.
结语:率先放出新架构预览模型
千问要依托社区能力完成版本打磨
随着企业侧长文档处理、私有化部署、Agent智能体等高价值场景规模化落地,行业对大模型的评价标准,更看重其冷输入成本、推理带宽开销、硬件适配能力、训练可复现性等工程化指标。
Qwen3.8‑Flash‑Next这套综合架构改进,也证明总参数量已经不再是衡量模型能力的第一指标,激活参数量、冷prefill开销、硬件适配能力的权重持续提升。
此外,千问率先放出下一代架构的预览版本,真实社区的复现、二次预训练、FP8部署、长上下文压测,可以暴露出内部实验难以覆盖的问题,以便在正式版本发布时进行进一步调优。
本文来自微信公众号“智东西”(ID:zhidxcom),作者:程茜,编辑:云鹏,36氪经授权发布。