
分析师/会磊
就在八月中旬,DeepSeek实施了"峰谷分时计费"新规,工作日高峰时段API调用价格大幅上调,经第三方核算显示,输出价格最高涨至旧版的4.7倍。与此同时,OpenAI、谷歌、Anthropic也相继上调价格或收紧免费额度。
过去两年持续走低的模型调用价格曲线,在2026年夏天开始集体掉头。靠补贴维持的低价策略,在持续攀升的算力账单面前终是难以为继。
就在市场普遍认定“涨价已成定局”时,8月26日晚,阿里千问团队交出了一份完全相反的答卷。

新发布的Qwen3.8-Flash在多模态、编程、智能体等多项基准测试中超越了Claude Opus 4.6和DeepSeek-V4-Flash,API定价却压到了每百万Token输入1元、输出3元,最低仅为DeepSeek-V4-Flash高峰时段价格的三分之一。训练成本也比前代大幅压缩,仅需原先九分之一的资源即可完成。
这不是一次常规版本迭代。在整个行业试图用提价来消化算力压力的节点上,阿里给出了另一种解法——用架构效率的重构重新定义成本结构,把大模型商业化的竞赛拉入了一条全新的轨道。
过去半年,大模型圈流行一个词叫“斩杀线”。它不是指单纯的低价,而是一道分水岭:当一款模型以远低于同行的成本提供相近甚至更强的能力时,竞品就会迅速失去商业存在感——因为切换底层模型的成本几乎为零。
DeepSeek之前被公认为这条线的划定者,原因不在于它绝对便宜,而在于它迫使所有人重新回答同一个问题:为同等水平的智能,你愿意付多少钱?
Qwen3.8-Flash把这个问题又往前推了一大步,直接给出了一个近乎不讲道理的答案。
先看价格。每百万Tokens输入1元、输出3元,这是什么概念?这是Claude Opus 4.6价格的3%,是DeepSeek-V4-Flash闲时价格的三分之二、忙时价格的三分之一。训练成本更是夸张,仅用了Qwen3.7-Plus九分之一的资源就完成了训练。
再看性能。这是一个多模态MoE模型,总参数125B,额外配备51B的N-gram Embedding,但每个Token只激活6B参数——也就是60亿参数干活,却要打出千亿级的效果。事实是,它确实做到了。
仅完成预训练的基座模型,在通用能力SuperGPQA、数学推理、编程SWEBench-Pretrain等基础评测上,就已经超过了3倍其大小的Qwen3.7-Plus基座。
经过后训练,性能跃迁更猛:智能体编程SWE-bench Pro领先Opus 4.6多达9.1分;长程专业任务CoWorkBench、真实工具调用Toolathlon Verified均超越DeepSeek-V4-Flash;多模态方面,AndroidWorld、ERQA、MathVision 等基准同样大幅领先。
旗舰级的能力,打到了“日常价”区间。这直接动摇了一个行业默认假设:那些昂贵的企业级模型,是否还天然拥有企业的“默认调用权”?答案正在变得清晰。默认调用权不会永远属于最贵的那个,而会属于“够用且足够便宜”的那个。
Qwen3.8-Flash真正让行业倒吸凉气的,不只是把Token单价打下来了,还迫使所有人重新思考:衡量大模型性价比的那把尺子,是不是该换了?
过去很简单,就看每百万Tokens多少钱。输入多少、输出多少,拉个表一比,谁便宜谁是王。但这个标准正在失效。因为一次真实任务的成本,远不止API调用费。过程中的等待时间、失败后的重复调用、多个Agent之间来回协同的轮次、最后人工接管、逐条修正结果都是成本。一个模型如果单价便宜但经常出错、需要反复重试,跑下来的真实成本可能反而更高。

大模型的斩杀线,正在从“每百万Token值多少钱”,转向“每块钱最终能完成多少工作”。
Qwen3.8-Flash的价值在于同时压低了这些隐性成本。而它能做到这一点的关键,藏在一系列架构层面的改动里。
首先,在注意力机制方面,GDN与QSA形成配合。长上下文的麻烦在于标准注意力的计算量随序列长度呈平方级增长。行业解法大致分两派:线性注意力用常数级内存换掉平方增长,但精确回溯能力会打折扣;稀疏注意力只对关键区域精细计算,但找重点本身也要算力。Qwen把两者结合起来,更关键的是引入了自研的QSA,用一个轻量级indexer把序列聚合成块,在块级别判断重要性,把“找重点”的成本也一并削掉。在1M Token的超长上下文场景下,Prefill阶段加速最高达到7.6倍。

图源:千问大模型官方公众号
其次,将信息传递通道从一条扩成四条。传统Transformer各层共用一条残差流,网络越深早期特征越容易被稀释。新方案把单一通道扩展成4条并行分支,模型根据内容动态决定信息怎么传。实际训练中观察到,其中一条分支自然形成了连接第一层和大部分中后层的长距离通道——模型确实用出了不同的分工。
再者,将51B参数挪出了显存。模型额外引入了51B的N-gram Embedding参数,结合当前Token与前几个Token的局部上下文查表,为常见模式提供额外表示。由于查询位置可以提前确定,这51B参数直接存放在主机内存中,通过异步预取与计算重叠,不长期占用昂贵的GPU显存。相当于以极低成本外挂了一个大规模的“局部模式记忆库”。
最后,训练方式也做出相应调整。针对新结构重新拟合了Scaling Law,模型可以稳定使用更大的学习率和批量大小。一个有意思的发现是,过去常见的批量大小预热已经没有实际收益,反而要多跑近19%的优化步骤,干脆直接从目标批量开始训练。
这几处改动叠加的效果很直观:激活参数只有前代三分之一、训练开销仅九分之一的模型,在多数预训练评测上追平甚至超过了一个大三倍的前代。
这套费了这么大功夫做出来的新架构,为什么没有首发在旗舰版Qwen3.8-Max上,而是先给了主打性价比的Flash?

把8月份发布的几款模型放在一起看,脉络就很清晰了。月初亮相的Qwen3.8-Max是家族的旗舰担当,总参数2.4T、激活95B,主打能力上限,是向外界展示技术高度的门面。月中开源的Qwen3.8-27B面向的是本地部署和开发者生态,体量适中,方便企业拿去做私有化微调。而刚刚落地的Qwen3.8-Flash,补上的是第三个位置——高频调用、大规模量产、对成本和响应速度最敏感的真实生产场景。
这其实是一个完整的产品矩阵:旗舰秀肌肉,中型打生态,Flash拼效率。三者各司其职,覆盖了从能力标杆到规模化落地的全链路。
但最值得琢磨的一点是,前两款模型沿用的都是前代Qwen3.5架构迭代而来,只有Flash吃上了这套名为"Next"的全新架构。新架构没有先喂给旗舰,反而先给了最讲究性价比的那一款。

这个反常规的安排,细想之下其实很合理。
一方面,新架构要验证的不是"能不能更聪明",而是"能不能更省"。这套架构的核心目标是提升单位算力的产出效率,也就是在同等算力消耗下完成更多有效工作。而Flash这个产品线,面对的就是每天数以亿计的高频调用,对成本和速度的变化极其敏感。新架构到底能不能扛住真实场景的规模化考验,放在Flash上检验,得到的反馈最直接、也最有说服力。
另一方面,这不是阿里第一次用这种"先预览后铺开"的节奏来推新技术。2025年9月,Qwen3-Next就扮演过同样的角色——它提前释出了Gated DeltaNet混合架构,经过社区检验和打磨后,这套设计被一路沿用到了Qwen3.5和Qwen3.8系列。这次开源版本的名字里也带着"Next"这个后缀——它明确告诉社区,你看到的还不是最终形态,而是下一代架构的骨架预览。如果把这个逻辑再往深推一层,还能看到另一个信号:阿里对开源的态度正在从"开放成果"走向"开放过程"。
把尚在演进中的架构设计提前交给社区,意味着它愿意在技术路线尚未完全定型时就接受外部检验和反馈。这种做法的风险更高,但如果跑通了,社区积累的信任和对新架构的熟悉度,会在Qwen4正式发布时转化为生态上的先发优势。
把这一切串起来,阿里这步棋的意图就清晰了:先用效率优先的Flash承接规模化调用、验证新架构的可靠性,同时用开源的方式把检验工作交给社区,跑通之后,再把成熟的技术方案反哺给整个Qwen4家族。最终指向的,是一个覆盖从能力标杆到性价比之选的全链条、全尺寸的开源模型矩阵。
Qwen3.8-Flash发布的真正价值,不在于阿里又打了一轮价格战,而在于它证明了另一条路走得通——用架构效率的重构来消化算力成本,而不是把压力转嫁给用户。当整个行业都在用“涨价”来回应算力焦虑时,阿里选择把“降本”的工作留给自己,把“降价”的成果交给市场。
此外,Qwen3.8-Flash-Next的开源版本已经释放,全球开发者可以提前在下一代架构上搭建应用。当30万个衍生模型已经在Qwen生态上生长,当全球下载量突破30亿次,阿里真正在做的,已经不只是卖一个模型,而是在卖一张通往AI生态的门票。
大模型的第一阶段竞争,看谁更聪明;第二阶段的竞争,看谁更便宜;而第三阶段的竞争,看谁能用最低的成本,让最多的人用起来。
阿里正在押注的,是第三阶段。

