先看证据

2026年10月6日发布预览版关键事实
新闻稿称总参数1T、激活参数49B关键事实
模型卡称总参数1.05T、激活参数52B关键事实
模型卡列出1.6B参数视觉编码器关键事实
训练使用3,800张Grace Blackwell GPU关键事实
API仅支持none和high两档推理关键事实

预览发布,开放部署仍在将来

Mistral AI 于 2026 年 10 月 6 日发布 Mistral Large 4 的公开预览版。它是一款面向文本与图像输入、推理及智能体任务的模型,目前可通过 Mistral API 使用;官方称其权重计划在 10 月底发布。换句话说,今天能接入服务,不代表今天就能下载模型、自己部署。

这一区别决定了技术负责人此刻该怎样读这次发布。Large 4 不只是一次模型能力展示,也是在说明 Mistral 想靠自有算力和稀疏模型路线重新追赶;但要评估托管成本、私有化部署或可复现性,预览 API 提供的证据还不够。权重、许可证和更多训练细节都尚待公布。

总参数很大,不等于每次都算得更多

Mistral 将 Large 4 描述为 MoE 模型:总参数规模很大,但每次计算只激活其中一部分。这解释了为什么“1T 参数”不能直接当作单次推理成本或能力的代称。新闻稿给出 1T 总参数、49B 激活参数,模型卡则列为 1.05T 和 52B;官方材料没有解释两组数字为何不同,因此不宜替它们强行找一个统一口径。

训练规模也需要同样克制地解读。Mistral 称模型从头训练于自有欧洲数据中心的 3,800 张 NVIDIA Grace Blackwell GPU 集群,模型卡还列出 1M token 上下文和 1.6B 参数的视觉编码器。官方把文本、图像理解、指令执行、推理和智能体能力放在同一模型中,但没有公布专家数量、路由方式等关键架构细节。GPU 数量能说明投入规模,却不能单独说明训练成本、效率或服务端的实际延迟。

一张鹈鹕图,能说明什么,不能说明什么

Simon Willison 用同一类鹈鹕绘图任务对照 API 的两档推理设置:none 和 high。按他的观察,high 生成的图更好看,但输出用了 2,717 个 token,少于 none 的 3,275 个。这是一个有用的小样本:更高推理档位不必然意味着更多输出 token,也提示工程团队不能只凭 token 数推测一次任务的工作量。

不过,单张图既不是系统评测,也不能证明 high 在一般任务上更有效。更有分量的参照来自 Artificial Analysis:Large 4 得分为 38,略低于总参数 552B 的 DeepSeek 4.1 Flash;同一来源对上一代 Mistral Large 3 给出的分数是 9。这个跃升说明预览模型相较前代有明显进步,但一个综合分数既不能覆盖团队自己的任务分布,也不能代替对延迟、稳定性和调用成本的测量。

评测数字有用,但还不是可复现的结论

Mistral 公布的编码评测结果包括 DeepSWE v1.1 的 61.7%、SWE-Atlas-QnA 的 59.4%、Terminal-Bench 4 的 28.3%,以及 Coding Agent Index 的 49.8%。在 Dense 200 视觉定位测试中,官方报告 Large 4 为 42%,GPT-6 Astra 为 41%。这些数字为选择测试集提供了线索,但公告没有给出足以独立复现所有结果的完整配置,因此应视为发布方披露的结果,而不是团队已经验证过的性能承诺。

后训练也仍是动态中的部分。Mistral 描述的强化学习流程会组合多个任务环境,并将奖励模型、单元测试、LLM 评审和静态检查用于验证;并行演员生成训练轨迹,模型则异步训练。官方同时表示,支撑预览版的强化学习仍在继续。这意味着当前成绩是一个时间点的快照,后续权重或 API 表现可能变化,不能把预览状态直接当成最终模型规格。

先把它放进候选栈,不要急着迁移

对正在选模型的团队,Large 4 现在最适合进入候选栈,而不是直接成为迁移目标。可以先通过 API 用自有任务集比较多模态理解、编码、长上下文和智能体执行,并记录两档推理设置下的质量、延迟与 token 消耗。API 只有 none 和 high 两档,也意味着目前无法像更细粒度的推理控制那样,为不同任务精细调节质量与资源之间的平衡。

如果决策依赖自托管、许可证审查或稳定复现,就等权重和完整配置发布后再判断。届时需要核对最终许可证,确认 49B 与 52B 激活参数口径的差异,并按自身硬件测吞吐和成本。Large 4 展示了 Mistral 的追赶速度,也留下了一个务实的判断标准:先验证它是否在你的工作负载上胜过现有方案,再把参数规模和发布方基准当作背景,而不是结论。