先看证据
把机制串起来
稠密模型每一步都会使用大部分参数;MoE 则由路由器为当前输入挑选少数专家,因此总参数可以很大,但每个 token 实际参与计算的参数较少。参数总量影响权重存储,激活参数量更接近推理计算量,不过显存、通信和服务成本还取决于模型结构与部署方式。所谓“思考模式”通常让模型为复杂任务生成更多中间推理 token,能换取更充分的推理,也会增加延迟和 token 开销。
Qwen3 同时提供稠密和 MoE 型号:稠密版结构直观、部署相对简单,MoE 版则通过路由激活部分专家,以较低的单 token 计算承载更大的参数总量;代价是专家分布、负载均衡和设备间通信更难处理。其思考与非思考模式共用模型系列,按任务选择快速回答或更长推理,并允许设置 thinking budget,在回答质量、延迟和生成成本之间调节。Qwen2.5 的能力提升不只靠扩大预训练数据,报告还强调超过 100 万条监督微调样本及多阶段强化学习,用于改善指令遵循、偏好和长文本表
['先按显存与吞吐选型,别只看总参数量', '复杂推理可开思考模式;延迟敏感任务用快答', '长上下文先测实际任务效果与KV缓存占用', '商用前核对具体版本许可证及收入门槛']
起点不是巨型模型,而是开放的节奏
阿里巴巴云在2023年4月推出通义千问,最初面向企业客户提供邀请制体验,随后计划将模型接入钉钉和天猫精灵等业务。对技术团队来说,这一阶段更像是云厂商推出生成式 AI 服务的常规起步。真正改变其发展轨迹的,是同年8月发布 Qwen-7B 和 Qwen-7B-Chat 权重:从封闭体验到可下载模型,中间只隔了几个月。
这一步也不是单纯把一个聊天模型放出来。材料称,Qwen-7B 预训练使用超过2.2万亿个 token;同年8月出现视觉语言分支,9月通义千问向公众开放。它形成了一种此后反复出现的节奏:先以服务或演示进入市场,再把模型权重、不同尺寸和新能力逐步扩展出去。对开发者而言,可取得模型并进行本地实验,开始成为这条产品线的重要组成部分。
模型家族开始按任务分叉
到2024年,Qwen的变化已经不能用单一型号的升级来描述。Qwen1.5覆盖0.5B到72B,并提供稳定的32K上下文;Qwen2扩展到五种尺寸,其中包括57B-A14B的混合专家模型。随后,Qwen2.5把重点继续推向代码和推理:材料记载该代训练数据达到18万亿个 token,2024年末又出现 Qwen2.5-Coder、QwQ-32B-Preview 和实验性的视觉推理模型 QVQ-72B-Preview。
这组发布透露出一个重要转向:模型家族不再只是“同一个模型做大做小”,而是在通用对话之外分出代码、推理、视觉和多模态路线。2025年的 Qwen2.5-VL 被描述为能够操作电脑和手机,Qwen2.5-Omni-7B 则支持文本、图像、音频、视频输入,并以文本或语音输出。对实际选型来说,版本号不再足以说明模型适不适合任务,团队得先确认自己需要的是代码能力、视觉理解,还是跨模态输入输出。
总参数不等于部署时要运行的规模
Qwen的后续路线把效率问题摆到了参数规模旁边。材料列出的型号中,Qwen2的57B-A14B、Qwen3-Next-80B-A3B,以及2026年的Qwen3.5-397B-A17B,都用总参数和后缀中的较小数字共同描述模型。按型号标记所示,这类设计的关键区别在于总规模与每次计算实际激活的参数规模并不相同;因此,不能把2.4T总参数直接理解成每个请求都要以2.4T参数参与计算。
这一差别会影响部署判断,但不会自动让大型模型变得便宜或轻量。Qwen3.8-2.4T-A95B被材料列为开放权重版本,型号标出的活跃规模是95B;权重总量、显存与存储需求仍然是工程团队必须核算的成本。另一条路线是更小的专用模型:Qwen3.6-35B-A3B面向 agentic coding,27B稠密模型则被阿里巴巴称在编码上优于Qwen3.5-397B。后者是厂商对特定能力的说法,不能替代针对自身任务的评测,但它提醒团队:规模更大不必然意味着任务表现更好。
开放权重不代表许可条件一致
Qwen的发展故事很容易被概括成“越来越开放”,但材料里的许可记录并不支持把开放看成一个简单开关。早期Qwen-7B的商业使用条件与月活用户规模挂钩;到Qwen1.5,Apache 2.0成为常见选择,Qwen2则被记为除72B版本外均采用Apache 2.0。与此同时,Qwen2.5-Max、Qwen3-Max等旗舰型号走的是封闭或仅 API 提供的路线,开放权重并非整条产品线的统一策略。
2026年的版本进一步说明,必须逐个检查具体型号。材料称,Qwen3.8-2.4T-A95B在年收入超过5000万美元时需要额外许可,而同一时期的Qwen3.8-27B采用Apache 2.0;Qwen-Image-2.1则使用仅限研究的许可。换句话说,“开放权重”只说明权重以某种方式可获得,不等于所有用途、商业规模和再分发方式都获得同样授权。产品团队如果只看下载入口或模型名称,可能会把技术可用性误当成商业可用性。
选型要同时看能力、成本与边界
对技术负责人而言,Qwen这条路线带来的实际变化,是选型从“挑一个最强模型”变成了组合决策。团队要先按任务比较通用、代码、视觉或多模态型号,再区分稠密模型与带有活跃参数标记的型号,最后把本地部署资源、API依赖和许可条款放在同一张决策表里。材料中的例子已经显示,这些选择并不总是同向:旗舰推理可以走封闭服务,小模型可以开放权重,而超大模型又可能附带收入门槛。
参数数字也需要与证据强度分开看。材料将Qwen3.8-2.4T-A95B列为2026年8月的开放权重发布,同时把Qwen 4.5和Qwen 5的5至10T参数规模写作预测,并称Qwen 4仍在训练;预测不是已发布模型的规格。可执行的判断是,先为候选型号核实权重、许可证和部署要求,再用自有任务测能力与成本,不要把路线图、参数总量或厂商的单项对比直接当成采购结论。Qwen的演进说明,开放扩大了可选择范围,却没有消除工程成本与使用边界。