A OpenBMB, um projeto de código aberto associado à ModelBest, apresentou o MiniCPM5-2B, um modelo de linguagem denso projetado para rodar diretamente em dispositivos. Este modelo possui aproximadamente 2,52 bilhões de parâmetros e suporta um comprimento de contexto nativo de 131.072 tokens, sendo distribuído sob a licença Apache-2.0.
O MiniCPM5-2B é o segundo lançamento da série MiniCPM5, sucedendo o MiniCPM5-1B. Ele utiliza a arquitetura padrão LlamaForCausalLM, que inclui 42 camadas com atenção agrupada (grouped-query attention), empregando 16 cabeças de consulta e 2 cabeças de chave/valor. Isso permite que os motores principais carreguem o modelo sem a necessidade de kernels personalizados ou forks do código do modelo.
Os parâmetros que não são embeddings somam cerca de 1,98 bilhões, permitindo que o modelo se enquadre na classe de menos de 4 bilhões de parâmetros, adequada para hospedagem em telefones, notebooks e dispositivos periféricos.
Em comparação com o conjunto de dados 34-benchmark da OpenBMB, o MiniCPM5-2B demonstra uma pontuação média de 53,9, superando várias modelos base abertas maiores. Entre elas, o Qwen3.5-4B obteve 51,1, e o granite-4.2-3B alcançou 42,7. Modelos de tamanho semelhante, como LFM2.5-2.6B e Qwen3.5-2B, ficaram atrás.
Os pontos fortes do modelo estão concentrados nas áreas de agentes codificadores, uso de ferramentas e extração de informações de contexto longo. Por exemplo, no LiveCodeBench v6, o MiniCPM5-2B obteve 69,1 contra 56,4 do Qwen3.5-4B, e no SWE-bench Verified, 46,4 contra 33,6. Resultados elevados também foram alcançados no τ²-Bench Telecom (97,1), BFCL v4 (66,6) e NoLiMa (68,1 contra 43,5).
Em tarefas que exigem conhecimento profundo, os resultados permanecem mais próximos do limite superior de tamanho; por exemplo, no MMLU-Pro, o modelo atingiu 70,8, enquanto o modelo de referência Qwen de 4B obteve 78,0. A OpenBMB destaca separadamente as linhas obtidas de fontes da Artificial Analysis para que os usuários possam distinguir dados de fornecedores de resultados de terceiros.
O processo pós-treinamento seguiu o gerenciamento de nível UltraData: inicialmente, foi realizado um ajuste fino supervisionado (supervised fine-tuning) baseado em raciocínio profundo usando cerca de 400 bilhões de tokens. Em seguida, foram aplicados professores especializados de aprendizado por reforço (reinforcement-learning teachers) para matemática, código, agentes e escrita usando o algoritmo JustRL II, baseado em crítica. A etapa final foi a destilação on-policy (on-policy distillation), que uniu 16 especialistas em RL — cinco deles agentes — em um único modelo aluno final.
A OpenBMB atribui o ganho médio de cerca de 10,96 pontos em tarefas de raciocínio e conjuntos gerais, bem como 6,96 pontos em conjuntos de agentes, à fase de RL e destilação. Para permitir a medição direta da contribuição de cada parte, a empresa lança checkpoints intermediários: Base, Midtrain e SFT-only.
Juntamente com os pesos, a UltraData publica os corpora de dados, abrangendo web, código, matemática, amostras SFT e RL para agentes, permitindo a reprodução dos resultados. O suporte de tempo de execução inclui vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT e compilações multi-chip FlagOS. Pacotes GGUF, MLX e GPTQ são fornecidos para assistentes locais que precisam executar chamadas de ferramentas e trabalhar com contexto longo sem usar uma GPU de data center.
Para desenvolvedores focados em execução em dispositivo, o MiniCPM5-2B é posicionado não tanto como um gigante de conhecimento geral, mas sim como um agente compacto com licença Apache e companheiro de codificação que já supera algumas modelos base abertas de classe 4B na pontuação média publicada.


