阿里 Qwen 团队在魔搭 ModelScope 社区官宣:正式开放 Qwen3.8-2.4T-A95B 模型权重。
短短一行字,信息量极大。这是阿里历史上,第一次将 Qwen-Max 级别的旗舰模型开源。
注意,这不是"小杯",不是"减配版",而是旗舰,是阿里最强的"镇店之宝"。
消息传出后,开发者们连夜下载,Hugging Face 和 ModelScope 两个平台同步开放。
为什么这次开源分量这么重?我们先读懂那串编号。
一、读懂这串数字,就读懂了它的分量
Qwen3.8-2.4T-A95B,这串编号不是随便起的,每一个字符都是关键信息:
2.4T:总参数 2.4 万亿; A95B:每个 Token 激活 95B(950 亿)参数; 原生支持 262,144 Token 上下文(256K),可扩展至 1,010,000 Token(101 万)。
翻译成人话,就是三件事。
第一,这是"稀疏"的巨型模型。 它采用 MoE(混合专家)架构,每个 MoE 层有 512 个专家,每个 Token 只激活 10 个路由专家,外加 1 个共享专家。
打个比方:一家公司有 2.4 万名员工(总参数),但处理任何一件事,只需要 950 人上岗(激活参数),其余人待命。人还是那些人,但成本算的,是 950 人的工资。
这就是 MoE 的威力——模型很大,但用起来不贵。这也是为什么 DeepSeek、Kimi、Qwen 全部押注 MoE。它是大模型从"能用"到"用得起"的必经之路。

第二,这是"超长记忆"的模型。 256K 原生上下文意味着什么?一整本《三体》三部曲,约 90 万字,可以一次读完;几百页年报、一整个大型项目的代码仓库,可以整个丢进去。
以前做长文档处理,要切片、要摘要、要"断章取义",现在不用了。而长上下文,正是 Agent 时代的入场券——一个能自主工作的 AI,必须"记得住"足够长的任务上下文。

第三,这是"思考型"的模型。 Qwen3.8 默认以思考模式运行,模型会先生成推理过程,再给出答案。注意,开源版是纯文本、强制思考模式——这意味着,官方把最纯粹的推理能力开放了。
二、开源"旗舰",是阿里第一次"自断护城河"
先讲一个背景事实。
过去几年,全球大模型的格局很清晰:OpenAI 不开源,Anthropic 不开源,谷歌的 Gemini 不开源。最强的模型,都留在云端卖 API。
中国厂商的打法不一样。DeepSeek 用开源证明了,开源模型可以和闭源模型正面硬刚。此后,开源成为中国 AI 的一张名片。
但注意一个细节:即便阿里此前开源过大量模型,Qwen-Max 级别的"旗舰底座",始终留在云端。
这次不一样了。
8月3日发布的 Qwen3.8-Max,是阿里的旗舰产品,支持视觉输入、默认 1M 上下文、内置官方工具。而它的底座,正是这次开放的 Qwen3.8-2.4T-A95B。
等于说,阿里把自己最强模型的"发动机",直接拆下来送人了。
为什么?三个理由。
第一,生态比模型值钱。 模型会迭代,会过时,但开发者生态不会。开源吸引开发者,开发者贡献生态,生态最终反哺阿里云。卖 API 是一锤子买卖,绑定生态才是长生意。
第二,标准比参数值钱。 谁的开源权重成为事实标准,谁就掌握下一轮技术演进的话语权。Meta 的 Llama 为什么重要?不是因为它最强,而是因为它定义了生态的标准。
第三,开源是最好的广告。 没有比"开放旗舰权重"更响亮的实力宣言。这比投一百个广告位都管用。
三、这份"图纸"的含金量,远超想象
这次开源的不只是权重,而是一整套技术方案。拆开看,三个亮点。
第一,混合注意力架构。 92 层中,69 层用线性注意力,23 层用全注意力。为什么混着用?因为长上下文推理最大的成本是 KV Cache 内存,线性注意力能大幅削减这块开销。这是工程上的精打细算。
第二,MTP 多 Token 预测。 模型经过多步 MTP 训练,一次推理可以预测多个后续 Token。配合支持 MTP 的推理引擎(SGLang、vLLM、TokenSpeed),解码速度显著提升。简单说,就是"想一步,看三步"。
第三,部署方案成熟。 官方给出了针对 Qwen3.8 的部署 Recipe 和并行策略,开发者拿到权重,不需要从头摸索。
再讲一个有趣的数字。
模型全精度(BF16)权重约 4.9TB。4.9TB 是什么概念?一块 8TB 的硬盘,装完就剩三分之一了,普通开发者根本跑不动。
但开源社区的速度更快。Unsloth AI 团队用动态 1-bit 分层选择性量化技术,把模型体积从 4.9TB 压缩到 397GB,存储缩减 91%。设备内存+显存达到 410GB 以上,就能本地跑起来。
旗舰模型,开始往个人工作站下放了。这件事本身就是开源生态最好的注脚。
四、评测数据:旗舰对旗舰,没人能碾压
官方公布的评测覆盖编程 Agent、通用 Agent、专业工作、长上下文四个方向,对比对象是 Claude Opus 4.8、Fable 5、GPT 5.6 Sol——都是当下闭源阵营的天花板。
结果如何?两个信息。
第一,PaperBench(论文复现基准)上,Qwen3.8-Max 拿下 93.0 分,高于 GPT-5.6 Sol、Fable 5 和 Claude Opus 4.8。 在 IFBench 等多项基准中,也取得所列模型中的较高成绩。
第二,各项结果与对手"互有胜负"。 这句话的分量很重——旗舰对旗舰,已经没有人能全面碾压谁了。这在两年前,是不可想象的。
而 Qwen 团队预告时说了句话:这可能是"除了 Fable 5 之外最强大的模型"。请注意这个表述——它承认了 Fable 5 的地位,但也意味着,在开源阵营里,它认为自己已经登顶。
五、这盘棋,动了谁的蛋糕
开源旗舰模型,至少影响三方。
对开发者,这是历史性的机会。 曾经只有大厂能用的前沿能力,现在任何人可以下载、微调、私有化部署。金融、医疗、政务这些对数据安全极度敏感的行业,是最大受益者——他们可以不依赖云端 API,把最强的模型部署在自己的机房。
对竞争对手,这是新一轮军备竞赛的信号。 2.4T 开源权重,直接对标 Kimi K3(2.8T 总参、104B 激活)和 DeepSeek V4。开源阵营的竞争,正式进入"万亿参数"时代。
对阿里自己,这是取舍。 开源会分流一部分 API 收入,但换来的是生态话语权和云计算增量。而 Qwen3.8-27B 这个"更小杯"已经在路上——开源产品线,正在形成完整矩阵。
最后
阿里这一夜,把"镇店之宝"摆上了货架,标签写着:免费。
这不是慈善,是一盘大棋。用最强的开源,换最大的生态,最终守住云计算这条真正的护城河。
留给我们的启示很简单:当最强的模型开始免费,靠"模型强"赚差价的时代,结束了。下一个时代的门票,是生态、是场景、是用模型创造真实价值的能力。
开源的门,正越开越大。
