Pesquisadores da Xiaomi apresentam HySparse2 para MiMo-V3, reduzindo custos computacionais no pré-processamento de tokens
Leia mais
Pandaily
pandaily.com

Pesquisadores da Xiaomi apresentam HySparse2 para MiMo-V3, reduzindo custos computacionais no pré-processamento de tokens

Pesquisadores do LLM-Core da Xiaomi publicaram um artigo no arXiv (2609.26368) apresentando a arquitetura HySparse2. Esta tecnologia é um híbrido de atenção esparsa com um mecanismo de compartilhamento de chaves-valores (KV sharing) de dois níveis e foi desenvolvida para trabalhar com tarefas de agentes da classe MiMo-V3, que exigem o processamento de horizontes longos.

A nomenclatura oficial deste desenvolvimento inclui Xiaomi, MiMo e HySparse2. Esta publicação foca na arquitetura de pesquisa e nos indicadores de desempenho declarados, diferenciando-se das revisões anteriores do MiMo-V2.6 de pesos abertos.

O HySparse2 divide a maior parte do modelo em um auto-decodificador estilo YOCO e um decodificador cruzado. No nível externo, o mecanismo KV Bridging conecta apenas as camadas de atenção completa, enquanto os caches KV do decodificador cruzado são projetados a partir dos estados ocultos do auto-decodificador. No nível interno, a reutilização aprimorada de KV mantém o compartilhamento no estilo HySparse dentro de cada bloco híbrido, mas muda de seleção no nível de blocos para seleção no nível de tokens. Além disso, em vez de um ramo separado de janela deslizante, uma janela local recente é forçadamente incluída nas seleções esparsas.

Graças a essas mudanças, a fase de pré-processamento (Prefill) pode ser concluída após o auto-decodificador, contornando as camadas do decodificador cruzado durante a construção do cache. Isso é particularmente útil em agentes multi-turnos, onde os tokens de entrada consistem em grande parte em observações de ferramentas.

Ao usar modelos MoE de 80B-A3B, treinados em dados e gráficos idênticos, o artigo relata que, após um pequeno ajuste fino, o HySparse2 aumenta os indicadores MRCR-v2 e RULER-v2 em 11,30 e 19,81 pontos percentuais, mantendo valores mais baixos de AgentPPL e LongPPL dentro do contexto de 256 mil tokens. Ao trabalhar com 1 milhão de tokens, a análise demonstra uma redução de FLOPs no pré-processamento de 2,92× em comparação com HySparse e 5,02× em comparação com Hybrid SWA. Também se observa que o tamanho do cache FP8 KV diminui para aproximadamente 2,69 GB em comparação com 6,72 GB e 12,09 GB para os modelos base especificados.

A análise de ablations mostra que a seleção no nível de tokens promove uma busca mais forte com um orçamento de atenção fixo. Ao escalar para 290B-A8B, o mecanismo KV Bridging mantém qualidade comparável, ao mesmo tempo que garante a possibilidade de saída antecipada durante o pré-processamento. Para especialistas que estudam pesquisas de sistemas LLM chineses, o HySparse2 é um sinal arquitetônico por trás das alegações de eficácia do MiMo-V3, e não um novo lançamento de pesos abertos.

Histórias semelhantes

Xiaomi libera pesos e recursos para os modelos MiMo-V2.6 Pro e MiMo-V2.6 Flash usando pilha RL
Leia mais
pandaily.com

Xiaomi libera pesos e recursos para os modelos MiMo-V2.6 Pro e MiMo-V2.6 Flash usando pilha RL

A Xiaomi disponibilizou publicamente pesos, documentação técnica e recursos de aprendizado por reforço (reinforcement learning) para sua série MiMo-V2.6. De acordo com notas em inglês da Xiaomi de 22 de setembro, os repositórios MiMo-V2.6-Pro e MiMo-V2.6-Flash foram publicados na plataforma Hugging Face juntamente com o código RL e mais de 7000 ambientes de teste.

Este lançamento consiste no fornecimento de pesos e código, o que difere da cobertura anterior do processo de treinamento RL através de transmissão ao vivo. A marca permanece inalterada: Xiaomi / MiMo.

Os modelos Pro e Flash são posicionados como modelos multimodais nativos, com uma janela de contexto declarada de um milhão de tokens. Os cartões dos modelos e relatórios adicionais em inglês indicam que o modelo Pro possui uma arquitetura de mistura esparsa de especialistas (sparse mixture-of-experts) com um total de parâmetros de cerca de 1,02 trilhão, utilizando ativamente aproximadamente 42 bilhões de parâmetros. O modelo Flash é avaliado em 309 bilhões de parâmetros totais com uma atividade de cerca de 15 bilhões.

A Xiaomi informa que cada modelo passou por 30 etapas de RL em aproximadamente 750.000 trajetórias em menos de seis dias. O processo utilizou uma mistura de tarefas, incluindo codificação, trabalho de agente geral, tarefas visuais e cibersegurança. Em cada atualização, foram utilizados cerca de 1568 solicitações e 16 execuções, e o volume de dados por etapa foi de 3,5 a 3,7 bilhões de tokens.

De acordo com a empresa, houve um aumento de desempenho nas tarefas de treinamento de cerca de 25% para o Flash e de 12% para o Pro. Além disso, foram observadas melhorias no DeepSWE v1.1: de 48,8 para cerca de 65,7 para o Flash e de 58,4 para cerca de 72,6 para o Pro, embora esses indicadores sejam dados fornecidos pelo fornecedor e exijam confirmação por terceiros.

Os ativos disponíveis vão além de simples checkpoints. A Xiaomi forneceu um framework RL abrangente, construído sobre verl e mecanismos de agentes relacionados, mais de 7000 ambientes classificados cobrindo desenvolvimento de software, reprodução de vulnerabilidades, trabalho intelectual e design web. Também estão disponíveis o ponto de partida Distill-Qwen-9B para experimentos da comunidade em RL e componentes leves para treinamento multicanal. O custo da API para as versões Pro e Flash hospedadas é declarado como correspondente ao MiMo-V2.5, enquanto o nível UltraSpeed promete uma largura de banda até 20 vezes maior que o Pro padrão mantendo a qualidade.

No entanto, os engenheiros ainda enfrentam custos elevados de manutenção de grandes MoE, e as declarações da Xiaomi sobre análise artificial e benchmarks de agentes necessitam de reprodução externa. A principal notícia é o pacote completo MiMo-V2.6 com pesos abertos, código RL e ambientes que os laboratórios podem estudar, em vez de apenas uma representação gráfica em transmissão ao vivo.

Popular