Mellum2.1 benchmarks
Mellum2.1 benchmarks 查看原始材料 ↗

先看证据

12B总参数,2.5B每token激活关键事实
64个专家,每token激活8个关键事实
2.0升至47.0SWE-bench Verified
0.0升至28.0SWE-bench Pro
上下文长度131,072 token关键事实
28层;词表98,304关键事实

把机制串起来

输入先把素材压到可处理的规模

MoE(混合专家)模型并非每个 token 都调用全部参数:路由器只挑一部分专家计算,因此总参数量主要关系到模型容量,激活参数量更直接影响每步计算量;但显存仍需容纳专家权重。代码代理也不只是补全代码,而是要读仓库、调用工具、改文件并验证结果,最终表现很依赖模型与执行环境、工具和测试的配合。

机制再把计算集中到关键步骤

Mellum2.1 保留 64 个专家、每 token 激活 8 个的 MoE 结构,因此这次性能跃升不能简单归因于增加模型规模或改变架构;按 JetBrains 的说法,主要增量来自后训练中的 RL。训练任务覆盖数学、竞赛编程、科学、工具使用和软件工程;公开 RL 数据经过筛选,剔除测试损坏、答案无法验证以及过易或不可能完成的任务。软件工程训练把模型放进真实代码仓库,提供 shell 和文件编辑工具,并以测试结果作为奖励依据,让模型从“写出看似合理的补丁”转向尝试完成可执行

结果最后落到可验证的工作结果

['适合做代码代理子任务、快速推理或私有化部署;Apache 2.0开放。', '可用vLLM或SGLang部署;量化GGUF可用于llama.cpp、Ollama和LM Studio。', '部署需区分2.5B激活计算与12B总权重的显存需求。', '高风险仓库修改应独立运行测试与审查;不宜只凭模型自述判断正确性。']

架构没变,任务定义变了

JetBrains于2026年10月8日发布Mellum2.1,这是一个面向编码代理和快速子代理的开放模型,采用Apache 2.0许可证。它总计有120亿参数,但每个token只激活约25亿参数;JetBrains称它可以在代码仓库中探索文件、编辑代码并检查改动,而不只是回答单个编程问题。

这次更新的关键不在于换了更大的模型或新架构。Mellum2.1沿用Mellum2的结构,主要变化集中在后训练:JetBrains把强化学习从训练末尾的短阶段变成主要环节,并报告称SWE-bench Verified成绩从2.0升至47.0。对技术负责人来说,这提出了一个更实际的问题:模型能否从“生成看起来合理的代码”,转向在工具和测试约束下完成一项仓库任务?

测试通过,成为训练信号

JetBrains描述的训练方式,是让模型在真实软件仓库环境中使用shell和文件编辑工具,再依据任务结果给予奖励;软件工程任务的一个关键判断是测试是否通过。训练任务还覆盖数学、竞赛编程、科学和工具使用,公开强化学习数据也经过筛选,以剔除测试损坏、答案无法验证,以及过易或不可能完成的任务。

这改变了模型“学会做什么”的路径。单靠代码示例,模型可以学会模仿局部写法,却未必能定位跨文件问题、执行修改并处理失败结果;在可运行的环境里,测试结果至少为这些动作提供了可检查的反馈。JetBrains称训练期间在数千个环境中启动了数百万个沙盒任务,但没有公布任务类别分布、各数据集占比或训练计算量,因此外界还无法判断哪些任务贡献最大。

大幅跃升不等于全面领先

JetBrains报告的变化集中在代理式软件任务:SWE-bench Verified从2.0到47.0,SWE-bench Pro从0.0到28.0,Terminal-Bench 2.1从0.6到17.4。与此同时,Mellum2.1在LiveCodeBench v6得82.0,在HumanEval+得91.5,在MBPP+得79.4,显示它在若干代码生成与编程评测上也有竞争力。

但横向比较并非全面胜出。JetBrains同一评测管线下,Qwen3.5-9B在SWE-bench Verified得50.0、SWE-bench Pro得38.0,Terminal-Bench 2.1也以21.7高于Mellum2.1;它在AIME 25/26和GPQA Diamond上同样领先。LiveCodeBench的对照则是Mellum2.1得82.0、Qwen3.5-9B得75.4。成绩应按任务类型拆开看,而不能压缩成一个“谁更强”的结论。

小激活量有部署价值,速度仍需复核

Mellum2.1采用混合专家结构:64个专家中,每个token由路由器激活8个;模型有28层,支持131,072-token上下文,权重以BF16提供。这里的“25亿激活参数”描述的是每个token参与计算的规模,不代表部署时只需存放这部分权重。对自托管团队而言,总参数规模、推理框架和量化版本仍会影响硬件与服务成本。

JetBrains称,单张NVIDIA H200在高负载下,Mellum2.1的吞吐量接近Qwen3.5-9B的两倍;单请求场景借助多token预测(MTP)则约快1.6倍。后一个数字尤其需要谨慎:JetBrains同时表示供vLLM推测解码使用的MTP head即将推出,公开材料尚未给出可独立复现的完整条件。模型也提供面向llama.cpp、Ollama和LM Studio的GGUF构建,起始文件大小为7.0GB,但文件大小本身不能代替目标硬件上的延迟、吞吐和质量测试。

把它当作专用工人,而不是总分冠军

对正在搭建编码代理的团队,Mellum2.1值得进入候选名单,尤其是希望自托管、需要控制推理成本,或要把模型放在主代理旁边承担代码搜索和局部修改等工作时。它的核心吸引力,是小激活规模与面向仓库任务的后训练组合,而不是在所有知识、推理和复杂代理任务上都胜过更大的对手。

评测结论仍有边界:模型卡标明分数由JetBrains使用同一管线自报,代理任务采用Pi v0.73.1和114K上下文;不同管线会影响横向成绩,JetBrains测得的Qwen部分分数也与Qwen自家模型卡不同。公开材料没有提供逐题日志、统计不确定性或独立复跑结果。实际选型时,应在自己的仓库、工具链和测试集上评估任务完成率、失败恢复能力与运行成本,再决定让它承担哪些工作,而不是把47.0分直接当作生产可靠性的证明。