A Academia Zhongguancun e o Instituto de Inteligência Artificial Zhongguancun lançaram o modelo ZGCM-1-7B. Este modelo denso totalmente aberto com 7,39 bilhões de parâmetros é destinado a tarefas de raciocínio matemático e busca de agentes utilizando ferramentas.
Os pesos, os dados de treinamento e o código de treinamento estão disponíveis sob a licença MIT nas plataformas Hugging Face e GitHub, e um relatório técnico detalhado foi publicado no arXiv.
O modelo utiliza uma arquitetura de atenção híbrida, composta por 27 camadas com janela deslizante limitada e cinco camadas globais. Ele suporta uma janela de contexto de 256 mil tokens e possui modos de resposta direta e raciocínio em um único checkpoint.
Na fase de pré-treinamento, foram utilizados cerca de 4,19 trilhões de tokens com precisão híbrida FP8 e otimização Muon. Durante o treinamento intermediário, o contexto foi expandido de 16 mil para 64 mil e depois para 256 mil, usando aproximadamente 600 bilhões de tokens. Nesse processo, as trajetórias de interação foram convertidas em transições de estado-ação MDP.
O ajuste fino supervisionado combinou trajetórias gerais e de agente, incluindo o uso de ferramentas testado empiricamente e uma perda focada apenas no assistente.
No modo de raciocínio, o modelo demonstrou resultados de cerca de 97,13% no MATH-500, 75,00% no AIME 2026 e 70,42% no HMMT 2025. Esses indicadores garantiram o melhor ranking médio entre sete modelos comparáveis de 7 a 8 bilhões de parâmetros em catorze benchmarks de raciocínio, de acordo com o relatório.
Em tarefas de busca de agentes, o ZGCM-1 alcançou cerca de 63,09% no WebWalkerQA ao usar pesquisa web e leitura de páginas, 19,43% no BrowseComp e 62,00% no Binary Function Search usando ferramentas Ghidra.
Experimentos com a arquitetura mostram que com um contexto de 256K, a taxa de transferência de treinamento é aproximadamente 3,94 vezes maior do que com atenção completa. Além disso, graças à combinação de arquitetura, precisão, otimizador e escolha de normalização, o tempo desde o início do pré-treinamento até a obtenção das perdas em 16K foi reduzido em cerca de 4,2 vezes.
Para um início rápido, é necessário o arquivo trust_remote_code para arquivos de modelagem personalizados. A equipe também publica configurações para diferentes estágios: processamento de dados, pré-treinamento, treinamento intermediário, SFT e RL. Relata-se que agentes de IA gerenciados por pesquisadores participaram da curadoria de dados e avaliação. Para laboratórios que trabalham com pesos abertos, o ZGCM-1 representa não tanto uma novidade de chat, mas sim um modelo base compacto para matemática e busca com um pipeline ponta a ponta transparente sob a marca ZGCM.
