NaiveAI lança o modelo Naive-N0.5-Flash: 309B MoE com contexto de 1M sob licença MIT
Leia mais
Pandaily
pandaily.com

NaiveAI lança o modelo Naive-N0.5-Flash: 309B MoE com contexto de 1M sob licença MIT

A NaiveAI apresentou o modelo Naive-N0.5-Flash com pesos abertos na plataforma Hugging Face. Este modelo representa uma arquitetura Mixture-of-Experts (MoE), projetada para tarefas de desenvolvimento de código e pesquisas em inteligência artificial. As informações sobre o modelo foram publicadas em meados ou final de setembro de 2026.

O nome oficial do produto é NaiveAI / Naive-N0.5-Flash. De acordo com a documentação técnica, o número total de parâmetros é de cerca de 309 bilhões, sendo que 15,5 bilhões de pesos estão ativos. O modelo é distribuído sob a licença MIT e inclui código para inferência, além de suporte nativo a uma janela de contexto de um milhão de tokens.

O comprimento do contexto é alcançado através de uma combinação híbrida dos mecanismos Sliding-Window Attention (SWA) e DeepSeek Sparse Attention (DSA) leve, que utiliza atenção agrupada. A arquitetura é descrita como predominantemente uma proporção SWA–DSA de aproximadamente 5:1, sem camadas totalmente atencionais no stack. O modelo é baseado no modelo aberto MiMo-V2.5, passando por ajuste fino e pós-treinamento, e não por pré-treinamento completo do zero.

Em termos de serviço, a NaiveAI enfatiza o NaiveRT — um stack para inferência desenvolvido usando pesquisas orientadas para IA. Este stack combina fusão de mega-núcleos (mega-kernel fusion), Lançamento Dependente Programático (Programmatic Dependent Launch) e decodificação especulativa. Segundo o fornecedor, a velocidade de processamento atinge cerca de 50 tokens por segundo por usuário no Modo Padrão e até 2000 tokens por segundo no Modo Ultrarrápido.

As tags no Hugging Face destacam que o modelo é adequado para geração de texto para código, trabalho com contexto longo e tarefas de pesquisa de IA. Isso corresponde à concepção declarada de que o ajuste fino e o pós-treinamento em uma base aberta forte podem avançar os limites para agentes de codificação. Para desenvolvedores que comparam lançamentos chineses MoE nesta semana, o Naive-N0.5-Flash é um exemplo específico de MoE 309B / 15.5B com contexto híbrido de um milhão de tokens sob licença MIT, representando uma notícia sobre arquitetura, e não sobre custo ou lançamento de produtos.

Histórias semelhantes

Pesquisadores da Xiaomi apresentam HySparse2 para MiMo-V3, reduzindo custos computacionais no pré-processamento de tokens
Leia mais
pandaily.com

Pesquisadores da Xiaomi apresentam HySparse2 para MiMo-V3, reduzindo custos computacionais no pré-processamento de tokens

Pesquisadores do LLM-Core da Xiaomi publicaram um artigo no arXiv (2609.26368) apresentando a arquitetura HySparse2. Esta tecnologia é um híbrido de atenção esparsa com um mecanismo de compartilhamento de chaves-valores (KV sharing) de dois níveis e foi desenvolvida para trabalhar com tarefas de agentes da classe MiMo-V3, que exigem o processamento de horizontes longos.

A nomenclatura oficial deste desenvolvimento inclui Xiaomi, MiMo e HySparse2. Esta publicação foca na arquitetura de pesquisa e nos indicadores de desempenho declarados, diferenciando-se das revisões anteriores do MiMo-V2.6 de pesos abertos.

O HySparse2 divide a maior parte do modelo em um auto-decodificador estilo YOCO e um decodificador cruzado. No nível externo, o mecanismo KV Bridging conecta apenas as camadas de atenção completa, enquanto os caches KV do decodificador cruzado são projetados a partir dos estados ocultos do auto-decodificador. No nível interno, a reutilização aprimorada de KV mantém o compartilhamento no estilo HySparse dentro de cada bloco híbrido, mas muda de seleção no nível de blocos para seleção no nível de tokens. Além disso, em vez de um ramo separado de janela deslizante, uma janela local recente é forçadamente incluída nas seleções esparsas.

Graças a essas mudanças, a fase de pré-processamento (Prefill) pode ser concluída após o auto-decodificador, contornando as camadas do decodificador cruzado durante a construção do cache. Isso é particularmente útil em agentes multi-turnos, onde os tokens de entrada consistem em grande parte em observações de ferramentas.

Ao usar modelos MoE de 80B-A3B, treinados em dados e gráficos idênticos, o artigo relata que, após um pequeno ajuste fino, o HySparse2 aumenta os indicadores MRCR-v2 e RULER-v2 em 11,30 e 19,81 pontos percentuais, mantendo valores mais baixos de AgentPPL e LongPPL dentro do contexto de 256 mil tokens. Ao trabalhar com 1 milhão de tokens, a análise demonstra uma redução de FLOPs no pré-processamento de 2,92× em comparação com HySparse e 5,02× em comparação com Hybrid SWA. Também se observa que o tamanho do cache FP8 KV diminui para aproximadamente 2,69 GB em comparação com 6,72 GB e 12,09 GB para os modelos base especificados.

A análise de ablations mostra que a seleção no nível de tokens promove uma busca mais forte com um orçamento de atenção fixo. Ao escalar para 290B-A8B, o mecanismo KV Bridging mantém qualidade comparável, ao mesmo tempo que garante a possibilidade de saída antecipada durante o pré-processamento. Para especialistas que estudam pesquisas de sistemas LLM chineses, o HySparse2 é um sinal arquitetônico por trás das alegações de eficácia do MiMo-V3, e não um novo lançamento de pesos abertos.

Laboratório de IA de Xangai lança modelo multimodal científico Intern-S2-397B com decodificador de memória
Leia mais
pandaily.com

Laboratório de IA de Xangai lança modelo multimodal científico Intern-S2-397B com decodificador de memória

O Laboratório de IA de Xangai apresentou seu modelo base multimodal orientado para ciência, Intern-S2-397B, com pesos abertos nas plataformas Hugging Face e ModelScope. O anúncio ocorreu após uma apresentação no Fórum de Inovação Putian em 13 de setembro de 2026 e um briefing de laboratório em 21 de setembro.

O nome oficial em inglês do laboratório é Shanghai AI Laboratory / Intern-S2. Este lançamento difere de publicações recentes do laboratório, como Atria Dawn, Intern Physical World Model W0 e NCP-ArchPreview, pois representa o lançamento dos pesos de um modelo científico com arquitetura, e não o anúncio de outro agente ou modelo de mundo.

O modelo Intern-S2 é projetado para executar tarefas científicas de longo alcance e ciclos de agentes. Os materiais do laboratório destacam a presença de um Decodificador de Memória (Memory Decoder) conectável, que permite anexar módulos de domínio sem a necessidade de retreinar todo o modelo base. Por exemplo, o uso do Intern-MemDec-4B em experimentos biológicos aumentou as pontuações médias em Instruções Biológicas de aproximadamente 56,92 para 60,32, mantendo os resultados gerais no nível do modelo principal.

No Hugging Face, está indicado que o mapa Intern-S2-397B contém cerca de 403 bilhões de parâmetros. O modelo passou por pré-treinamento visual em páginas de literatura científica não processada, treinamento científico multdomínio por reforço em mais de 20 áreas, e treinamento por reforço de agente de longo alcance em ambientes isolados. Caminhos de serviço estão previstos através de LMDeploy, vLLM e SGLang, e um endpoint de API oficial da Intern foi documentado.

O Laboratório de IA de Xangai informa que o Intern-S2 foi profundamente otimizado em conjunto com o stack computacional Ascend da Huawei em aspectos de computação, comunicação e memória. Além disso, o modelo será integrado à plataforma de descobertas científicas Intern DuanYan do laboratório, que abrange áreas de ciências da vida, materiais, semicondutores e disciplinas afins. De acordo com as declarações do fornecedor, o Intern-S2 ocupa o primeiro lugar entre modelos de código aberto em conhecimento, código e conjuntos de agentes, demonstrando fortes resultados em tarefas de biologia e ciência dos materiais; no entanto, esses números são atualmente dados do laboratório antes de testes independentes.

Para grupos de pesquisa, o resultado final é o acesso aos pesos baixáveis do Intern-S2-397B, acompanhados pela documentação do Decodificador de Memória e uma nota sobre a colaboração com a Ascend. Assim, este é um modelo base multimodal aberto, atualizado para uso pela comunidade, e não apenas um anúncio baseado em API fechada.

Laboratório de IA de Xangai lança versão preliminar do modelo Atria Dawn, baseado na arquitetura MoE com 744 bilhões de parâmetros
Leia mais
pandaily.com

Laboratório de IA de Xangai lança versão preliminar do modelo Atria Dawn, baseado na arquitetura MoE com 744 bilhões de parâmetros

O Laboratório de Inteligência Artificial de Xangai apresentou o Atria Dawn Preview — um modelo de linguagem agente desenvolvido para apoiar processos complexos de pesquisa e engenharia, e não apenas para chats demonstrativos. Esta versão preliminar é baseada na fundação Mixture-of-Experts (MoE) com 744 bilhões de parâmetros, identificada como GLM-5.2.

O modelo possui uma janela de contexto de 256K e é distribuído sob a licença MIT. Checkpoints, tanto os padrão de instrução quanto os quantizados no formato FP8-instruct, estão disponíveis nas plataformas Hugging Face e ModelScope. Além disso, há acesso à API para usuários em regiões internacionais e chinesas.

De acordo com a documentação do modelo e o artigo de acompanhamento no arXiv, o sistema foi treinado usando o Verifiable Experience Pipeline (Pipeline de Experiência Verificável). Este pipeline conecta raciocínios mediados por ferramentas a ambientes executáveis e resultados verificáveis externamente. O conceito principal é o ciclo de execução completo: análise do problema, projeto da solução, chamada de ferramentas, execução de código e experimentos, verificação dos resultados e recuperação de falhas dentro de um feedback contínuo do ambiente, em vez de apenas obter uma resposta única.

O laboratório agrupou as capacidades do modelo para cenários que abrangem descoberta, criação, entrega e segurança cibernética. Esses cenários incluem pesquisa profunda, desenvolvimento de software, preparação de materiais de escritório estruturados e verificação de segurança autorizada.

Na avaliação por 16 benchmarks apresentados pelo laboratório, o Atria Dawn Preview demonstrou o desempenho mais alto em cinco tarefas. Entre elas, AutomationBench com resultado de 53.8, BrowseComp com 92.5, DeepSearchQA com 96.0, BFCL v4 com 77.0 e CyberGym com 86.5. Os outros indicadores permanecem competitivos, mas não são dominantes em comparação com modelos agentes básicos avançados.

Este lançamento difere dos desenvolvimentos anteriores do Laboratório de IA de Xangai, como Intern W0 e trabalhos relacionados ao NCP. Dawn é posicionado como um parceiro agente aberto para projetos científicos e de engenharia multifásicos, e juntamente com o lançamento dos pesos, ativos públicos foram fornecidos no GitHub e no site especial do projeto Atria.

Os desenvolvedores podem baixar os pesos para uso local através de frameworks como SGLang e vLLM, ou usar consoles de API regionais. Clientes no estilo Codex podem interagir com a Responses API usando configurações apenas de modo de texto. No entanto, recomenda-se às equipes reproduzir independentemente os resultados do AutomationBench e das cadeias de ferramentas para tarefas de longo prazo, bem como verificar as condições de licenciamento e implantação. É importante levar em consideração o rótulo 'preview', pois a confiabilidade do agente fora dos conjuntos de dados publicados permanece uma questão em aberto enquanto o laboratório avança de assistentes de tarefas para colaboração em projetos.

Popular