OpenBMB lança MiniCPM5-2B como modelo SOTA aberto para execução em dispositivo com menos de 4 bilhões de parâmetros
Leia mais
Pandaily
pandaily.com

OpenBMB lança MiniCPM5-2B como modelo SOTA aberto para execução em dispositivo com menos de 4 bilhões de parâmetros

A OpenBMB, um projeto de código aberto associado à ModelBest, apresentou o MiniCPM5-2B, um modelo de linguagem denso projetado para rodar diretamente em dispositivos. Este modelo possui aproximadamente 2,52 bilhões de parâmetros e suporta um comprimento de contexto nativo de 131.072 tokens, sendo distribuído sob a licença Apache-2.0.

O MiniCPM5-2B é o segundo lançamento da série MiniCPM5, sucedendo o MiniCPM5-1B. Ele utiliza a arquitetura padrão LlamaForCausalLM, que inclui 42 camadas com atenção agrupada (grouped-query attention), empregando 16 cabeças de consulta e 2 cabeças de chave/valor. Isso permite que os motores principais carreguem o modelo sem a necessidade de kernels personalizados ou forks do código do modelo.

Os parâmetros que não são embeddings somam cerca de 1,98 bilhões, permitindo que o modelo se enquadre na classe de menos de 4 bilhões de parâmetros, adequada para hospedagem em telefones, notebooks e dispositivos periféricos.

Em comparação com o conjunto de dados 34-benchmark da OpenBMB, o MiniCPM5-2B demonstra uma pontuação média de 53,9, superando várias modelos base abertas maiores. Entre elas, o Qwen3.5-4B obteve 51,1, e o granite-4.2-3B alcançou 42,7. Modelos de tamanho semelhante, como LFM2.5-2.6B e Qwen3.5-2B, ficaram atrás.

Os pontos fortes do modelo estão concentrados nas áreas de agentes codificadores, uso de ferramentas e extração de informações de contexto longo. Por exemplo, no LiveCodeBench v6, o MiniCPM5-2B obteve 69,1 contra 56,4 do Qwen3.5-4B, e no SWE-bench Verified, 46,4 contra 33,6. Resultados elevados também foram alcançados no τ²-Bench Telecom (97,1), BFCL v4 (66,6) e NoLiMa (68,1 contra 43,5).

Em tarefas que exigem conhecimento profundo, os resultados permanecem mais próximos do limite superior de tamanho; por exemplo, no MMLU-Pro, o modelo atingiu 70,8, enquanto o modelo de referência Qwen de 4B obteve 78,0. A OpenBMB destaca separadamente as linhas obtidas de fontes da Artificial Analysis para que os usuários possam distinguir dados de fornecedores de resultados de terceiros.

O processo pós-treinamento seguiu o gerenciamento de nível UltraData: inicialmente, foi realizado um ajuste fino supervisionado (supervised fine-tuning) baseado em raciocínio profundo usando cerca de 400 bilhões de tokens. Em seguida, foram aplicados professores especializados de aprendizado por reforço (reinforcement-learning teachers) para matemática, código, agentes e escrita usando o algoritmo JustRL II, baseado em crítica. A etapa final foi a destilação on-policy (on-policy distillation), que uniu 16 especialistas em RL — cinco deles agentes — em um único modelo aluno final.

A OpenBMB atribui o ganho médio de cerca de 10,96 pontos em tarefas de raciocínio e conjuntos gerais, bem como 6,96 pontos em conjuntos de agentes, à fase de RL e destilação. Para permitir a medição direta da contribuição de cada parte, a empresa lança checkpoints intermediários: Base, Midtrain e SFT-only.

Juntamente com os pesos, a UltraData publica os corpora de dados, abrangendo web, código, matemática, amostras SFT e RL para agentes, permitindo a reprodução dos resultados. O suporte de tempo de execução inclui vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT e compilações multi-chip FlagOS. Pacotes GGUF, MLX e GPTQ são fornecidos para assistentes locais que precisam executar chamadas de ferramentas e trabalhar com contexto longo sem usar uma GPU de data center.

Para desenvolvedores focados em execução em dispositivo, o MiniCPM5-2B é posicionado não tanto como um gigante de conhecimento geral, mas sim como um agente compacto com licença Apache e companheiro de codificação que já supera algumas modelos base abertas de classe 4B na pontuação média publicada.

Histórias semelhantes

Cambricon adaptou o modelo DeepSeek-V4.1-Flash na pilha vLLM
Leia mais
pandaily.com

Cambricon adaptou o modelo DeepSeek-V4.1-Flash na pilha vLLM

A Cambricon anunciou a conclusão bem-sucedida da adaptação do modelo DeepSeek-V4.1-Flash no âmbito do programa Day-0, utilizando a pilha de inferência open-source vLLM. Isso significa que o modelo recém-lançado pode operar de forma estável nos aceleradores Cambricon no mesmo dia em que o DeepSeek publicou o checkpoint.

Este anúncio destaca a sinergia entre chip e software: disponibilidade simultânea do modelo e do chip, bem como a maturidade da abordagem da Cambricon, que combina NeuWare e vLLM. Não se trata de repetir informações sobre a disponibilidade geral do próprio modelo.

O DeepSeek-V4.1-Flash representa a versão mais leve da nova linha arquitetônica DeepSeek. É um modelo do tipo mixture-of-experts com 552 bilhões de parâmetros, que ativa cerca de 8 bilhões de parâmetros no lado de entrada e 16 bilhões no lado de saída, além de possuir compreensão integrada de visão multimodal. O DeepSeek destaca o uso da estrutura Causal-Encoder-Decoder e a compressão agressiva do cache KV, o que reduz a necessidade de HBM em aproximadamente um quarto e de SSD em um oitavo em comparação com a geração anterior, enquanto o tamanho do cache é centenas de vezes menor do que na primeira versão.

Essas economias de memória são criticamente importantes para os fabricantes de aceleradores que buscam controlar a latência de inferência, o volume de DRAM e os níveis de armazenamento em servidores densos que já estão sob pressão orçamentária de HBM.

Por sua vez, os engenheiros da Cambricon utilizaram a biblioteca de operadores unificados Torch-MLU-Ops para acelerar estruturas como Engram e Compressor, e escreveram kernels otimizados em BangC para pontos quentes de atenção esparsa e comprimida. Dentro do vLLM, a Cambricon declara suporte a paralelismo misto de cinco dimensões, abrangendo paralelismo tensorial, pipeline, sequencial, batch e especialista, com sobreposição de comunicação e computação, quantização de baixa precisão e separação de prefixo e decodificação para aumentar o throughput de ponta a ponta. Esta pilha opera na NeuWare, plataforma de software de longo prazo da empresa.

Alguns dias antes, a Cambricon juntou-se à PyTorch Foundation como membro platina, ocupando um assento no conselho de administração ao lado de outros grandes desenvolvedores de hardware e serviços em nuvem, sinalizando investimentos mais profundos no ecossistema de aprendizado e inferência abertos.

Agora, a Cambricon suporta inferência Day-0 para cinco principais linhas de modelos chineses: GLM, DeepSeek, Qwen, Kimi e MiniMax, representando Zhipu AI, DeepSeek, Alibaba, Moonshot AI e MiniMax, respectivamente. A publicação Caixin Global destacou especificamente a capacidade de incluir a Cambricon no mesmo dia como um sinal de redução dos ciclos internos de desenvolvimento de modelos e chips na China — uma transição de portos fechados de vários meses para prontidão em frameworks públicos que já são padronizados pelos operadores.

Para os operadores de cluster, a implicação prática é a disponibilidade conjunta: quando um modelo aberto avançado é lançado, os clientes da Cambricon podem usar a receita documentada do vLLM em vez de esperar por um fork fechado. O próximo teste para o ecossistema de software será a questão de saber se este esquema Day-0 se aplica às versões maiores do DeepSeek e às misturas de serviços multimodais.

iFLYTEK lança modelos abertos com janela de contexto de um milhão de tokens para IA local
Leia mais
pandaily.com

iFLYTEK lança modelos abertos com janela de contexto de um milhão de tokens para IA local

A empresa chinesa iFLYTEK expandiu as capacidades dos grandes modelos locais ao apresentar modelos com uma janela de memória significativamente aumentada. Em 1º de setembro, sua subsidiária lançou e disponibilizou publicamente os modelos Spark X2.5-4B e Spark X2.5-1.7B. Estes modelos periféricos são, segundo a iFLYTEK, os primeiros na categoria de dispositivos locais a suportar nativamente até um milhão de tokens de contexto.

Ambos os modelos utilizam uma arquitetura de atenção híbrida e foram ajustados para tarefas de agente, trabalho com código, matemática e seguimento de instruções. A empresa afirma que o desempenho supera modelos abertos de tamanho semelhante.

Este feito visa preencher uma lacuna significativa na inteligência artificial local. Anteriormente, os modelos periféricos frequentemente eram forçados a dividir documentos longos em partes para consulta sequencial, o que resultava na perda de contexto inicial e no risco de respostas incorretas. Graças à janela de um milhão de tokens, treinada em dados de alta qualidade que abrangem extensos documentos e literatura técnica, os modelos são capazes de processar um manual completo de pós-venda de uma só vez.

Durante a demonstração da empresa, após carregar o manual completo, o modelo conseguiu combinar regras de devolução, solução de problemas e exceções de diferentes capítulos para responder se um dispositivo comprado dez dias antes com peças de reposição de terceiros tinha direito à substituição.

Os modelos possuem a capacidade não apenas de ler, mas também de agir. Em cenários de escritório, o Spark X2.5-4B pode criar scripts para agregar dados de vendas, extrair indicadores chave, gerar um relatório bilíngue do departamento de cerca de 3000 caracteres e verificar sua estrutura e layout. Assim, o modelo transforma dados brutos em um relatório pronto sem a necessidade de sair da máquina local.

Na área de programação, o modelo de quatro bilhões de parâmetros demonstra um desempenho comparável a modelos em nuvem duas a três vezes maiores, ao mesmo tempo que garante baixa latência, uso autônomo e gerenciamento local de ativos de código. Os desenvolvedores podem integrá-lo em frameworks abertos existentes, como DeepSeek Harness, OpenCode, Codex e Pi.

O conceito de implantação local também é aplicável a cenários de casa inteligente e robótica. No conjunto de teste Domux para casa inteligente, o modelo de 1,7 bilhões de parâmetros atingiu uma taxa de precisão de comandos de controle de 90,3%, com um tempo médio de resposta de 0,85 segundos. Esses modelos podem ser implantados em corpos de robôs ou dispositivos periféricos para tarefas de manipulação, rastreamento e navegação, reduzindo assim a dependência de conexões em nuvem.

Ambos os modelos foram treinados em uma plataforma computacional totalmente doméstica, utilizando aproximadamente 20 trilhões de tokens. Eles são compatíveis com hardware Nvidia, Huawei, Hygon e outros, suportando vLLM, SGLang e llama.cpp. Os pesos e o código estão disponíveis no Hugging Face e GitHub, e as APIs dos modelos funcionam na plataforma iFLYTEK Spark MaaS, onde são fornecidas gratuitamente por um tempo limitado.

Popular