Компания Xiaomi сделала общедоступными веса, техническую документацию и ресурсы для обучения с подкреплением (reinforcement-learning) для своей серии MiMo-V2.6. Согласно английским заметкам от Xiaomi от 22 сентября, были опубликованы репозитории MiMo-V2.6-Pro и MiMo-V2.6-Flash на платформе Hugging Face вместе с кодом RL и более чем 7000 тестовых сред.
Этот релиз представляет собой предоставление весов и кода, что отличается от предыдущего освещения процесса обучения RL через прямую трансляцию. Брендинг остается неизменным: Xiaomi / MiMo.
Модели Pro и Flash позиционируются как нативные мультимодальные модели, обладающие заявленным контекстным окном в один миллион токенов. Карточки моделей и дополнительные отчеты на английском языке указывают, что модель Pro имеет архитектуру разреженной смеси экспертов (sparse mixture-of-experts) с общим количеством параметров около 1,02 триллиона, при этом активно используется примерно 42 миллиарда параметров. Модель Flash оценена в 309 миллиардов общих параметров с активностью около 15 миллиардов.
Xiaomi сообщает, что каждая модель прошла 30 шагов RL в рамках приблизительно 750 000 траекторий менее чем за шесть дней. В процессе использовалось смешение задач, включая кодирование, работу общего агента, визуальные задачи и кибербезопасность. При этом в каждом обновлении было использовано около 1568 запросов и 16 прогонов, а объем данных на шаг составлял 3,5–3,7 миллиарда токенов.
По данным компании, наблюдался прирост производительности по задачам обучения примерно на 25% для Flash и на 12% для Pro. Кроме того, зафиксированы улучшения в DeepSWE v1.1: с 48,8 до примерно 65,7 для Flash и с 58,4 до примерно 72,6 для Pro, однако эти показатели являются данными, предоставленными вендором, и требуют подтверждения третьими сторонами.
Доступные активы выходят за рамки просто контрольных точек. Xiaomi предоставила комплексный фреймворк RL, построенный на verl и связанных механизмах агентов, более 7000 классифицированных сред, охватывающих разработку программного обеспечения, воспроизведение уязвимостей, интеллектуальный труд и веб-дизайн. Также доступны отправная точка Distill-Qwen-9B для экспериментов сообщества в области RL и легковесные компоненты для многоканального обучения. Стоимость API для размещенных версий Pro и Flash заявлена как соответствующая MiMo-V2.5, при этом уровень UltraSpeed обещает пропускную способность до 20 раз выше стандартного Pro при сохранении качества.
Тем не менее, инженерам все еще приходится сталкиваться с высокими расходами на обслуживание больших MoE, а заявления Xiaomi относительно искусственного анализа и бенчмарков агентов нуждаются во внешнем воспроизведении. Основная новость заключается в полном пакете MiMo-V2.6 с открытыми весами, кодом RL и средами, которые лаборатории могут изучить, а не просто графическое представление в прямой трансляции.

