A Xiaomi disponibilizou publicamente pesos, documentação técnica e recursos de aprendizado por reforço (reinforcement learning) para sua série MiMo-V2.6. De acordo com notas em inglês da Xiaomi de 22 de setembro, os repositórios MiMo-V2.6-Pro e MiMo-V2.6-Flash foram publicados na plataforma Hugging Face juntamente com o código RL e mais de 7000 ambientes de teste.
Este lançamento consiste no fornecimento de pesos e código, o que difere da cobertura anterior do processo de treinamento RL através de transmissão ao vivo. A marca permanece inalterada: Xiaomi / MiMo.
Os modelos Pro e Flash são posicionados como modelos multimodais nativos, com uma janela de contexto declarada de um milhão de tokens. Os cartões dos modelos e relatórios adicionais em inglês indicam que o modelo Pro possui uma arquitetura de mistura esparsa de especialistas (sparse mixture-of-experts) com um total de parâmetros de cerca de 1,02 trilhão, utilizando ativamente aproximadamente 42 bilhões de parâmetros. O modelo Flash é avaliado em 309 bilhões de parâmetros totais com uma atividade de cerca de 15 bilhões.
A Xiaomi informa que cada modelo passou por 30 etapas de RL em aproximadamente 750.000 trajetórias em menos de seis dias. O processo utilizou uma mistura de tarefas, incluindo codificação, trabalho de agente geral, tarefas visuais e cibersegurança. Em cada atualização, foram utilizados cerca de 1568 solicitações e 16 execuções, e o volume de dados por etapa foi de 3,5 a 3,7 bilhões de tokens.
De acordo com a empresa, houve um aumento de desempenho nas tarefas de treinamento de cerca de 25% para o Flash e de 12% para o Pro. Além disso, foram observadas melhorias no DeepSWE v1.1: de 48,8 para cerca de 65,7 para o Flash e de 58,4 para cerca de 72,6 para o Pro, embora esses indicadores sejam dados fornecidos pelo fornecedor e exijam confirmação por terceiros.
Os ativos disponíveis vão além de simples checkpoints. A Xiaomi forneceu um framework RL abrangente, construído sobre verl e mecanismos de agentes relacionados, mais de 7000 ambientes classificados cobrindo desenvolvimento de software, reprodução de vulnerabilidades, trabalho intelectual e design web. Também estão disponíveis o ponto de partida Distill-Qwen-9B para experimentos da comunidade em RL e componentes leves para treinamento multicanal. O custo da API para as versões Pro e Flash hospedadas é declarado como correspondente ao MiMo-V2.5, enquanto o nível UltraSpeed promete uma largura de banda até 20 vezes maior que o Pro padrão mantendo a qualidade.
No entanto, os engenheiros ainda enfrentam custos elevados de manutenção de grandes MoE, e as declarações da Xiaomi sobre análise artificial e benchmarks de agentes necessitam de reprodução externa. A principal notícia é o pacote completo MiMo-V2.6 com pesos abertos, código RL e ambientes que os laboratórios podem estudar, em vez de apenas uma representação gráfica em transmissão ao vivo.
