JetBrains lança o Mellum2.1, modelo aberto para rodar agentes de código na própria infraestrutura
O Mellum2.1 tem 12 bilhões de parâmetros, só 2,5 bilhões ativos, licença Apache 2.0 e foco em explorar, editar e testar código em repositórios.
A JetBrains lançou em 8 de outubro de 2026 o Mellum2.1, nova versão do seu modelo aberto voltado a agentes de programação. Segundo o blog da empresa, a arquitetura é a mesma do Mellum2, aberto em junho: um modelo de mistura de especialistas (MoE) com 12 bilhões de parâmetros, dos quais 2,5 bilhões ficam ativos a cada token, sob licença Apache 2.0. O que mudou foi o pós-treinamento, agora centrado em aprendizado por reforço em ambientes reais, para que o modelo consiga explorar um repositório, editar arquivos e conferir as próprias alterações.
O que muda para quem desenvolve
O público-alvo são equipes que querem rodar agentes e subagentes de código em hardware próprio, sem enviar código para serviços externos. Os pesos estão no Hugging Face em bfloat16, com contexto de 131.072 tokens, e o cartão do modelo traz os comandos para servi-lo com o vLLM, incluindo a opção de chamada de ferramentas pelo parser Hermes e uma API compatível com a da OpenAI. Os parâmetros recomendados são temperatura 0,6, top_p 0,95 e top_k 20. Por ser um modelo de raciocínio, ele produz a cadeia de pensamento antes da resposta, o que aumenta a quantidade de tokens gerados.
O blog e o cartão dizem que versões GGUF para llama.cpp, Ollama e LM Studio e a cabeça de predição de múltiplos tokens (MTP) para decodificação especulativa no vLLM estão “a caminho”. Na prática, um repositório GGUF oficial já aparece no Hugging Face com cinco quantizações, como Q4_K_M, Q6_K e Q8_0, e a MarkTechPost registra arquivos a partir de 7,0 GB. Para quem pretende usar o modelo localmente, vale conferir o estado desses arquivos antes de adotar.
Benchmarks, com ressalvas
Todos os números são da própria JetBrains, que avaliou o Mellum2.1, o Mellum2, o Qwen3.5-9B e o Gemma 4 E4B com o mesmo pipeline. O maior salto está em tarefas agênticas: no SWE-bench Verified, o modelo passou de 2,0% para 47,0%; no SWE-bench Pro, de 0,0% para 28,0%; e no Terminal-Bench 2.1, de 0,6% para 17,4%, com o harness aberto Pi v0.73.1. Ele lidera o grupo no LiveCodeBench v6 (82,0) e no BFCL v4 (62,3), mas fica atrás do Qwen3.5-9B no SWE-bench Verified (50,0), no SWE-bench Pro (38,0) e no GPQA Diamond (77,8). A MarkTechPost observa que os números medidos pela JetBrains para o Qwen diferem dos publicados pelo próprio Qwen, o que mostra o peso da metodologia.
Em velocidade, a JetBrains afirma que, sob carga pesada numa GPU H200, o Mellum2.1 serve quase o dobro de tokens do Qwen3.5-9B, e que o MTP o torna cerca de 1,6 vez mais rápido numa requisição isolada. Não há, por ora, avaliações independentes desses resultados.
Pontos de atenção
- A licença Apache 2.0 permite uso comercial, mas a responsabilidade pelas salvaguardas do agente continua com quem o integra.
- Resultados agênticos variam com o harness, a amostragem e o tamanho de contexto usados; reproduza no seu próprio repositório antes de comparar.
- A cabeça MTP para o vLLM ainda não foi publicada, segundo o cartão do modelo.
Fontes
- JetBrains Blog — Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents (08/10/2026)
- Hugging Face (JetBrains) — Mellum2.1-12B-A2.5B-Thinking — cartão do modelo (07/10/2026)
- Hugging Face (JetBrains) — Mellum2.1-12B-A2.5B-Thinking-GGUF (07/10/2026)
- MarkTechPost — JetBrains Releases Mellum2.1: A 12B MoE Open Model for Coding Agents (08/10/2026)
Imagem destacada: ilustração gerada por computador, sem valor documental.


