Xiaomi открыла веса и ресурсы для моделей MiMo-V2.6 Pro и MiMo-V2.6 Flash с использованием RL стека
Подробнее
Pandaily
pandaily.com

Xiaomi открыла веса и ресурсы для моделей MiMo-V2.6 Pro и MiMo-V2.6 Flash с использованием RL стека

Компания Xiaomi сделала общедоступными веса, техническую документацию и ресурсы для обучения с подкреплением (reinforcement-learning) для своей серии MiMo-V2.6. Согласно английским заметкам от Xiaomi от 22 сентября, были опубликованы репозитории MiMo-V2.6-Pro и MiMo-V2.6-Flash на платформе Hugging Face вместе с кодом RL и более чем 7000 тестовых сред.

Этот релиз представляет собой предоставление весов и кода, что отличается от предыдущего освещения процесса обучения RL через прямую трансляцию. Брендинг остается неизменным: Xiaomi / MiMo.

Модели Pro и Flash позиционируются как нативные мультимодальные модели, обладающие заявленным контекстным окном в один миллион токенов. Карточки моделей и дополнительные отчеты на английском языке указывают, что модель Pro имеет архитектуру разреженной смеси экспертов (sparse mixture-of-experts) с общим количеством параметров около 1,02 триллиона, при этом активно используется примерно 42 миллиарда параметров. Модель Flash оценена в 309 миллиардов общих параметров с активностью около 15 миллиардов.

Xiaomi сообщает, что каждая модель прошла 30 шагов RL в рамках приблизительно 750 000 траекторий менее чем за шесть дней. В процессе использовалось смешение задач, включая кодирование, работу общего агента, визуальные задачи и кибербезопасность. При этом в каждом обновлении было использовано около 1568 запросов и 16 прогонов, а объем данных на шаг составлял 3,5–3,7 миллиарда токенов.

По данным компании, наблюдался прирост производительности по задачам обучения примерно на 25% для Flash и на 12% для Pro. Кроме того, зафиксированы улучшения в DeepSWE v1.1: с 48,8 до примерно 65,7 для Flash и с 58,4 до примерно 72,6 для Pro, однако эти показатели являются данными, предоставленными вендором, и требуют подтверждения третьими сторонами.

Доступные активы выходят за рамки просто контрольных точек. Xiaomi предоставила комплексный фреймворк RL, построенный на verl и связанных механизмах агентов, более 7000 классифицированных сред, охватывающих разработку программного обеспечения, воспроизведение уязвимостей, интеллектуальный труд и веб-дизайн. Также доступны отправная точка Distill-Qwen-9B для экспериментов сообщества в области RL и легковесные компоненты для многоканального обучения. Стоимость API для размещенных версий Pro и Flash заявлена как соответствующая MiMo-V2.5, при этом уровень UltraSpeed обещает пропускную способность до 20 раз выше стандартного Pro при сохранении качества.

Тем не менее, инженерам все еще приходится сталкиваться с высокими расходами на обслуживание больших MoE, а заявления Xiaomi относительно искусственного анализа и бенчмарков агентов нуждаются во внешнем воспроизведении. Основная новость заключается в полном пакете MiMo-V2.6 с открытыми весами, кодом RL и средами, которые лаборатории могут изучить, а не просто графическое представление в прямой трансляции.

Похожие сюжеты

Xiaomi открыла модель воплощенного мирового фундамента и набор для обучения Robotics-U0
Подробнее
pandaily.com

Xiaomi открыла модель воплощенного мирового фундамента и набор для обучения Robotics-U0

Компания Xiaomi сделала доступным для общественности свой продукт Xiaomi-Robotics-U0 — авторегрессивную фундаментальную модель воплощенного мира. Эта модель рассматривает синтез, ориентированный на роботов, не просто как узкоспециализированный процесс генерации траекторий, а как продолжение генерации изображений и видео на основе фундаментальных моделей.

Согласно официальным материалам, основная линия модели содержит около 38 миллиардов параметров и постоянно обучается для достижения воплощенного интеллекта. Дополнительные публичные веса, включая варианты Xiaomi-Robotics-U0-4B и FlashAR, доступны на платформах Hugging Face и ModelScope, а также предоставляется код для инференса, демонстрации через Gradio и релизы обучения FSDP, датированные началом сентября.

В рамках одного фреймворка следующего токена данная модель объединяет несколько функций: генерацию изображений из текста, редактирование изображений из любого источника, создание многовидовых сцен, воплощенный контролируемый трансфер и генерацию воплощенного видео. Xiaomi утверждает, что этот стек сохраняет фундаментальную визуальную семантику, одновременно добавляя способность к рассуждению, ориентированному на роботов, посредством стадий обучения — как одношаговых, так и последовательных. Эти стадии включают потоки подзадач-целей, чередующиеся друг с другом, а также воплощенное видео с частотой 1, 3 и 5 кадров в секунду.

Архитектурные заметки указывают на использование токенизации изображений IBQ и мультимодального словаря, который поддерживает авторегрессивное масштабирование между различными модальностями. Эта архитектура построена на компонентах, происходящих от линий Qwen3-32B и EMU3.5.

Вторым важным аспектом является эффективность инференса. Технология FlashAR+ заменяет последовательное декодирование токенов изображения на антидиагональную параллельную генерацию и используется совместно с пакетной обработкой vLLM. Xiaomi сообщает о возможном ускорении генерации изображений размером 1024x1024 до почти 83 раз быстрее, что снижает задержку для одного образца с примерно 450,8 секунд до 5,44 секунд на заявленном оборудовании.

Страницы возможностей заявляют, что показатели побед в многовидовых сценах и трансфере превосходят GPT-Image-2 при внутреннем разделении данных на сложные и простые. Кроме того, UNIS (Xiaomi-Robotics-U0) занимает первое место среди более чем 100 моделей на WorldArena с показателем EWMScore_P, равным 73,64.

В области применения, данные для переноса стиля из модели смешиваются с реальными демонстрационными наборами для последующего обучения политики. Xiaomi сообщает об увеличении прогресса по задачам вмешательства с приблизительно 36,9% до 63,2% при использовании фонов и освещения, которые не использовались в обучении, при этом снижение по сравнению с базовым лабораторным уровнем было меньшим.

Хотя контрольные точки для генерации видео все еще догоняют релизы изображений и трансфера, команды должны проверить условия лицензирования, выбор движка FlashAR и воспроизводимость WorldArena сторонних разработчиков, прежде чем использовать открытые веса как готовый завод по данным для производственных роботов.

Популярное