


先看证据
把机制串起来
MoE(混合专家)把网络分成多个专家模块,每个 token 只调用其中一部分,因此总参数规模不等于每次推理都要计算的参数规模。上下文窗口则是模型一次能接收的 token 上限,不代表它能无损记住并准确使用窗口里的每个细节。
官方给出的总参数是1.05T、每 token 活跃参数约49B,约占总量4.7%;这解释了计算量为何不必随总参数同比增长,但不意味着硬件只需容纳49B参数,完整专家权重仍须存放或以其他方式调度。1M上下文可容纳大量资料,却会增加长文本预填充、注意力计算与KV缓存负担;窗口长度本身不保证模型能可靠检索所有内容。官方还列出1.6B参数视觉编码器,确认原生图像输入,但暂未公开它与语言网络的连接细节。API支持缓存输入,缓存价格较低,能改善重复上下文的账单;它不会消除首次输入的处理成
['适合API文档问答、图像理解与工具调用试用', '重复长提示可评估缓存输入对账单的改善', '需要本地部署或数据不出域:等权重并核验许可', '超长文档任务应实测召回、延迟与上下文成本']
先发布的是服务,不是可下载的模型
Mistral AI 于2026年10月6日发布 Mistral Large 4(ML4)的公开预览版。这是一款面向编码、智能体工作流、图像理解和企业任务的多模态混合专家模型:API 已开放,模型权重则计划在10月底提供。换句话说,发布消息里的“开放”,目前首先指可以通过 Mistral 的服务调用,而不是团队已经能够把模型下载到自己的基础设施上。
这个时间差值得技术负责人认真看待,因为它把两种常被混为一谈的能力拆开了:先用托管 API 测模型表现,再决定是否要接管部署。预览版能让团队试函数调用、长上下文和图像输入,却还不能回答模型在自有算力上怎么装载、路由如何配置、实际推理成本如何变化。ML4 的看点因此不只是参数规模,而是它把“可调用”和“可自托管”放在了不同的时间点。
稀疏计算省下计算,不会抹掉模型体积
ML4 的规格最容易让人误读的地方,是“1.05万亿参数”和“每个 token 激活49B参数”同时成立。Mistral 将它描述为细粒度混合专家模型:整体参数构成模型容量,而每次处理 token 时只调用其中一部分。因此,活跃参数更接近计算量的线索,不能拿来当作整个模型的存储需求;全模型仍要驻留在内存中,才能按需调用不同专家。
把几项数字放在一起看更清楚:模型总参数约1.05T,文档列出的每 token 活跃参数为49B,若把 embeddings 与输出层计入则为52B;上下文窗口为1M tokens,视觉编码器为1.6B参数。Mistral 称模型从零开始训练,使用其欧洲自有数据中心的3,800张 NVIDIA Grace Blackwell GPU。这里的3,800张 GPU 说明训练基础设施的规模,不等于客户部署时所需的卡数,也不能单凭活跃参数推导出本地运行的成本。
百万上下文是工作流选项,不是质量保证
1M token 上下文让 ML4 有机会承接长文档问答、多阶段智能体任务,或需要在同一请求中处理大量材料的工作流。模型原生接收图像,官方演示覆盖图表、文档、自然图像和视觉定位。公开信息足以说明它支持这些输入方向,但没有披露视觉编码器与其余网络的具体连接方式,也不能据此判断模型在每种任务上的可靠性。
预览 API 已支持函数调用、结构化输出、文档问答、批处理,以及 Agents 和 Conversations 接口。公开价格为每百万输入 token 1.36美元、每百万输出 token 4.18美元,缓存输入为每百万 token 0.14美元。缓存价可能改变长上下文智能体反复使用既有材料时的账单结构,但团队仍需用自身请求模式测算:上下文窗口能装下多少内容,与模型能否有效利用这些内容,是两个不同问题。
网络安全成绩亮眼,评测口径仍要拆开看
Mistral 报告的突出结果集中在网络安全:Cybench 为93%,CyberGym-E2E 为82%。公司还称,若干闭源前沿模型在 CyberGym-E2E 上接近零分,原因是它们拒绝执行任务。这个对比提出了一个重要问题:当基准要求复现漏洞以验证其真实性时,拒绝策略会影响得分;因此低分未必等于模型没有相关能力,但这也不意味着放宽拒绝就自动构成更好的安全表现。
编码方面,Mistral 报告 DeepSWE v1.1 得分61.7%、SWE-Atlas-QnA 得分59.4%、Terminal-Bench 4.0 得分28.3%。其中部分评测是在测试工具公开前由 Mistral 私下完成,现阶段还不能由外部按同一套流程复现。另一项盲测人工评估由 Surge AI 执行,ML4 Preview 得分3.74/5,在五个模型中排名第二,低于 Claude Opus 5 的4.22;这是不同于单一基准分数的一条证据,但仍不能替代针对具体生产任务的验证。
开放权重之后,才轮到部署判断
Mistral 把 ML4 与欧洲自有数据中心、3,800张训练 GPU,以及覆盖160多种语言(包括全部欧盟官方语言)的训练数据联系起来。这些信息支撑了它的欧洲基础设施与多语言定位,却不应被直接等同于客户已经获得了完整的部署控制权。预览阶段,调用仍经过 Mistral API;对需要数据驻留、审计或离线运行的团队来说,具体部署选项要等权重和区域服务细节进一步明确。
权重计划在10月底开放时,值得检查的不只是能否下载,还包括此前尚未公布的专家数量、top-k 路由、层布局,以及后训练方法。它们决定了 49B 活跃参数在推理中如何落实,也影响自部署时的工程取舍。现阶段更务实的判断是用 API 验证任务质量、上下文利用率和缓存后的调用成本,同时把自托管能力视为待验证项;不要因为模型总参数很大就预设它更强,也不要因为每 token 激活参数较少就预设它更便宜、更容易部署。