A equipe NCP do Laboratório de Inteligência Artificial de Xangai (Shanghai Artificial Intelligence Laboratory), em colaboração com a LUMIA Lab da Universidade de Jiaotong de Xangai (Shanghai Jiao Tong University), lançou o NCP-ArchPreview, um modelo de linguagem aberto com espaço latente contendo cerca de 8,9 bilhões de parâmetros.
Este modelo é treinado simultaneamente para previsão padrão do próximo token e previsão de conceitos subsequentes (Next Concept Prediction). O relatório técnico está disponível no arXiv sob o número 2609.10715, e os checkpoints para o Hugging Face estão na coleção ArchSpace-Collection. Os caminhos do código para avaliação e inferência também foram publicados, incluindo links através das ferramentas InternLM e do repositório de avaliação da LUMIA.
O projeto representa a maior demonstração até hoje de um modelo de linguagem com espaço latente treinado em uma escala superior a trilhões de tokens.
Em vez de prever apenas o próximo token, o NCP-ArchPreview é capaz de prever conceitos discretos que abrangem vários tokens. Para isso, foi criada uma base de vocabulário de conceitos produtivamente quantizada, baseada nos estados ocultos do próprio modelo. Um Módulo de Conceitos especializado prevê conceitos futuros, e essas previsões são usadas para direcionar a geração no nível do token.
O codificador, o Módulo de Conceitos e o decodificador utilizam uma arquitetura Transformer causal com tamanho de camada oculta de 4096 e proporção de 16/8/16. Os conceitos comprimem o estado de quatro tokens cada, e a quantização produtiva é aplicada a 32 vocabulários com 128 palavras de código. A geração mantém a interface familiar de previsão do próximo token em uma arquitetura tipo NCPOlmo3ForCausalLM, permitindo avaliar e usar o modelo como um checkpoint autossregressivo comum, enquanto o objetivo latente é executado durante o pré-treinamento.
Para o treinamento, foram utilizados cerca de 5,73 trilhões de tokens da família Dolma-3 dentro dos planos de estudo das Fases 1 e 2. A principal vantagem declarada de eficiência é que o NCP-ArchPreview atinge uma perda final de pré-treinamento comparável ao OLMo-3-7B, utilizando apenas aproximadamente 51,3% do volume total de tokens de treinamento.
Após o pré-treinamento completo, o modelo supera o modelo base de 7B em 2,45 pontos na média macro em tarefas subsequentes, incluindo um aumento de 5,99 pontos no benchmark GSM8K. Análises de ablação controlada mostraram que esse ganho é atribuído tanto à arquitetura latente quanto à função objetivo de conceito seguinte. Com um tamanho de parâmetros comparável, o modelo se aproxima da perda de treinamento do modelo base de próximo token de 8,9B, utilizando cerca de 85% do orçamento computacional padrão.
Mesmo após a conclusão do pré-treinamento, o espaço latente permanece utilizável. A atualização do módulo de quantização de vetores, que contém aproximadamente 17 milhões de parâmetros, fornece uma interface fácil para adaptação ao domínio. Além disso, a incorporação de representações de conceitos no draftador DFlash2 melhorou o comprimento médio aceito em cerca de 4,17% com custos adicionais insignificantes na configuração descrita. Checkpoints básicos das Fases 1 e várias Fases 2 estão disponíveis para conclusão, avaliação e adaptação adicional. Para pesquisadores interessados na eficiência do pré-treinamento, o NCP-ArchPreview é mais um roteiro aberto para combinar objetivos em nível de conceito e nível de token em escala de quase 9B com pesos e código públicos, do que simplesmente um lançamento de produto de chat.

