星光澄海 | BLOG

JetBrains推Mellum2.1:12B MoE开源模型瞄准编码智能体

JetBrains刚更的Mellum2.1,把SWE-bench Verified的分数从2.0拉到了47.0——这个提升幅度够让做代码大模型的人眼前一亮。

升级的门道:几乎全靠真实代码环境的RL

Mellum2.1是12B参数的混合专家(MoE)推理模型,激活参数只有2.5B,架构和去年6月开源的Mellum2没差太多。JetBrains这次的升级几乎全靠强化学习(RL),而且是在真实软件环境里练出来的:用了几百万个沙箱,跑在几千个环境里,模型探索仓库、编辑文件、检查改动,只要测试通过就给奖励。

对应的,它在agentic coding类的基准测试里涨得最猛:除了SWE-bench Verified,SWE-bench Pro从0跳到28.0,Terminal-Bench 2.1从0.6涨到17.4。其他测试里,LiveCodeBench v6拿了82.0,比Qwen3.5-9B的75.4还高;HumanEval+、MBPP+这些基础代码任务也压过对手。

本地跑起来的门槛:最小7GB,一张H200就能扛

想本地部署这个模型,门槛比想象低。JetBrains放了GGUF量化版本,最小的MXFP4_MOE只有7GB,能在llama.cpp、Ollama、LM Studio这些工具里跑。速度方面,和上一代Mellum2保持一样:1张NVIDIA H200重负载下,吞吐量是Qwen3.5-9B的近2倍;单请求用MTP优化,快1.6倍。

JetBrains还给出了推荐参数:temperature设0.6,top_p0.95,top_k20,跑的时候要开工具调用,用对应的parser就行。

还没补上的短板,和同行的机会

Mellum2.1不是全赢,还是有没追上的地方:Terminal-Bench 2.1的17.4比Qwen3.5-9B的21.7低,SWE-bench Pro的28.0也比Qwen的38.0差;专业知识类的GPQA Diamond,Qwen拿77.8,它只有64.6;数学推理的AIME,Qwen也高过它。

另外要注意,JetBrains测的Qwen分数,和Qwen自己报告的不一样——比如Qwen自己说LiveCodeBench v6拿65.6,JetBrains测的是75.4,说明基准测试的管道会影响结果,不能光看数字。

对行业来说,Mellum2.1的核心优势是轻量(2.5B激活)、开源、本地可跑,给想搭私有编码助手的开发者省了不少硬件成本,但在硬核的agent任务和深度推理上,还有空间留给其他模型。

这个模型的定位很明确,就是为编码智能体和轻量子智能体做的,不是通用大模型。你会考虑用这个7GB级的开源模型搭本地编码助手吗?


素材来源:MarkTechPost · AI情报、大模型、AI智能体、AI应用落地
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown