Shanghai AI Lab e SJTU Apresentam Modelo Aberto NCP-ArchPreview com Espaço Latente
Leia mais
Pandaily
pandaily.com

Shanghai AI Lab e SJTU Apresentam Modelo Aberto NCP-ArchPreview com Espaço Latente

A equipe NCP do Laboratório de Inteligência Artificial de Xangai (Shanghai Artificial Intelligence Laboratory), em colaboração com a LUMIA Lab da Universidade de Jiaotong de Xangai (Shanghai Jiao Tong University), lançou o NCP-ArchPreview, um modelo de linguagem aberto com espaço latente contendo cerca de 8,9 bilhões de parâmetros.

Este modelo é treinado simultaneamente para previsão padrão do próximo token e previsão de conceitos subsequentes (Next Concept Prediction). O relatório técnico está disponível no arXiv sob o número 2609.10715, e os checkpoints para o Hugging Face estão na coleção ArchSpace-Collection. Os caminhos do código para avaliação e inferência também foram publicados, incluindo links através das ferramentas InternLM e do repositório de avaliação da LUMIA.

O projeto representa a maior demonstração até hoje de um modelo de linguagem com espaço latente treinado em uma escala superior a trilhões de tokens.

Em vez de prever apenas o próximo token, o NCP-ArchPreview é capaz de prever conceitos discretos que abrangem vários tokens. Para isso, foi criada uma base de vocabulário de conceitos produtivamente quantizada, baseada nos estados ocultos do próprio modelo. Um Módulo de Conceitos especializado prevê conceitos futuros, e essas previsões são usadas para direcionar a geração no nível do token.

O codificador, o Módulo de Conceitos e o decodificador utilizam uma arquitetura Transformer causal com tamanho de camada oculta de 4096 e proporção de 16/8/16. Os conceitos comprimem o estado de quatro tokens cada, e a quantização produtiva é aplicada a 32 vocabulários com 128 palavras de código. A geração mantém a interface familiar de previsão do próximo token em uma arquitetura tipo NCPOlmo3ForCausalLM, permitindo avaliar e usar o modelo como um checkpoint autossregressivo comum, enquanto o objetivo latente é executado durante o pré-treinamento.

Para o treinamento, foram utilizados cerca de 5,73 trilhões de tokens da família Dolma-3 dentro dos planos de estudo das Fases 1 e 2. A principal vantagem declarada de eficiência é que o NCP-ArchPreview atinge uma perda final de pré-treinamento comparável ao OLMo-3-7B, utilizando apenas aproximadamente 51,3% do volume total de tokens de treinamento.

Após o pré-treinamento completo, o modelo supera o modelo base de 7B em 2,45 pontos na média macro em tarefas subsequentes, incluindo um aumento de 5,99 pontos no benchmark GSM8K. Análises de ablação controlada mostraram que esse ganho é atribuído tanto à arquitetura latente quanto à função objetivo de conceito seguinte. Com um tamanho de parâmetros comparável, o modelo se aproxima da perda de treinamento do modelo base de próximo token de 8,9B, utilizando cerca de 85% do orçamento computacional padrão.

Mesmo após a conclusão do pré-treinamento, o espaço latente permanece utilizável. A atualização do módulo de quantização de vetores, que contém aproximadamente 17 milhões de parâmetros, fornece uma interface fácil para adaptação ao domínio. Além disso, a incorporação de representações de conceitos no draftador DFlash2 melhorou o comprimento médio aceito em cerca de 4,17% com custos adicionais insignificantes na configuração descrita. Checkpoints básicos das Fases 1 e várias Fases 2 estão disponíveis para conclusão, avaliação e adaptação adicional. Para pesquisadores interessados na eficiência do pré-treinamento, o NCP-ArchPreview é mais um roteiro aberto para combinar objetivos em nível de conceito e nível de token em escala de quase 9B com pesos e código públicos, do que simplesmente um lançamento de produto de chat.

Histórias semelhantes

Modelo local StartLux com 27 bilhões de parâmetros supera DeepSeek V4 Flash em benchmark de IA chinês
Leia mais
pandaily.com

Modelo local StartLux com 27 bilhões de parâmetros supera DeepSeek V4 Flash em benchmark de IA chinês

De acordo com um relatório preparado pela Academia Chinesa de Tecnologia da Informação e Comunicação (CAICT), um novo jogador surgiu no mapa dos modelos locais. A empresa StartLux, sediada em Xangai e que desenvolveu o modelo StartLux-V1.0-27B-Preview, conquistou o segundo lugar no geral no teste especial MCP dentro da linha de benchmarks de IA verificados, superando o DeepSeek-V4-Flash, utilizando apenas 27 bilhões de parâmetros.

O teste MCP avalia seis tarefas especializadas: navegação por localização, busca na internet, automação de navegador, análise financeira, gerenciamento de repositórios de código e design 3D, além de incluir uma avaliação abrangente focada na coordenação de múltiplas ferramentas, execução de tarefas complexas e interação em condições reais. Entre os modelos testados estavam DeepSeek-V4-Pro (1,6 trilhão de parâmetros), DeepSeek-V4-Flash-0731 (284 bilhões), Step-3.7-Flash (198 bilhões), StartLux-27B-260715 (27 bilhões), Qwen-3.6-27B (27 bilhões) e AgentCPM-Explore (4 bilhões).

O modelo StartLux-V1.0-27B-Preview obteve uma pontuação de 39,25, garantindo-lhe o segundo lugar, ultrapassando tanto o DeepSeek-V4-Flash com 284 bilhões de parâmetros quanto o Step-3.7-Flash com 198 bilhões. Com o mesmo tamanho de parâmetros, superou o Qwen-3.6-27B em 5,34 pontos. O modelo ficou em primeiro lugar na navegação por localização e também alcançou o primeiro lugar ou empatou na automação de navegador e análise financeira, atingindo, em alguns casos, o nível do modelo de trilhão DeepSeek-V4-Pro.

Este modelo é construído com base no Qwen3.6-27B com melhorias adicionais após o treinamento. A StartLux implementou uma abordagem que eles chamaram de 'IA ensina IA' (Busca Automática), permitindo treinamentos experimentais autônomos e aprimoramento da estratégia por meio de feedback. A empresa afirma que este é o primeiro uso deste método para um modelo de agente local na China.

Este resultado reflete uma mudança mais ampla na indústria. À medida que o desempenho dos modelos avançados atinge limiares práticos, a era da corrida de parâmetros transformou-se em uma fase de homogeneização; as prioridades dos usuários estão cada vez mais voltadas para a resolução de problemas reais, garantia de segurança de dados e controle de custos, e não apenas para alcançar altos resultados em benchmarks. Os jogadores mundiais estão seguindo a mesma direção: Google's Gemma 4, Meta's open Muse Glimmer e Nvidia's Nemotron 3.5 Lightning visam implantação local.

O StartLux-V1.0-27B-Preview pode funcionar em PCs de consumo, e a empresa planeja lançar sua primeira geração de soluções de inteligência local neste ano. Os resultados da CAICT sinalizam às empresas que modelos compactos e implantáveis localmente agora são capazes de competir com soluções em nuvem muito maiores em tarefas importantes nos fluxos de trabalho reais, o que está começando a mudar as decisões de compra.

Popular