Исследователи Xiaomi представили HySparse2 для MiMo-V3, снижающего вычислительные затраты при предварительной обработке токенов
Подробнее
Pandaily
pandaily.com

Исследователи Xiaomi представили HySparse2 для MiMo-V3, снижающего вычислительные затраты при предварительной обработке токенов

Исследователи LLM-Core компании Xiaomi опубликовали в статье на arXiv (2609.26368) архитектуру HySparse2. Эта технология представляет собой гибридное разреженное внимание с механизмом двухуровневого совместного использования ключей-значений (KV sharing) и разработана для работы с задачами агентов класса MiMo-V3, требующими обработки длинных горизонтов.

Официальное брендирование данной разработки включает Xiaomi, MiMo и HySparse2. Данная публикация фокусируется на исследовательской архитектуре и заявленных показателях эффективности, отличаясь от предыдущих обзоров MiMo-V2.6 с открытым весом.

HySparse2 разделяет основную часть модели на самодекодер в стиле YOCO и кросс-декодер. На внешнем уровне механизм KV Bridging соединяет только слои с полным вниманием, при этом кэши KV кросс-декодера проецируются из скрытых состояний самодекодера. На внутреннем уровне усовершенствованное повторное использование KV сохраняет совместное использование в стиле HySparse внутри каждого гибридного блока, однако оно переключается с выбора на уровне блоков на выбор на уровне токенов. Кроме того, вместо отдельной ветви скользящего окна, в разреженные выборы принудительно включается недавнее локальное окно.

Благодаря этим изменениям, этап предварительной обработки (Prefill) может завершиться после самодекодера, минуя слои кросс-декодера при построении кэша. Это особенно полезно в многоходовых агентах, где входные токены в значительной степени состоят из наблюдений инструментов.

При использовании моделей MoE размером 80B-A3B, обученных на идентичных данных и графиках, статья сообщает, что после незначительного дообучения HySparse2 повышает показатели MRCR-v2 и RULER-v2 на 11,30 и 19,81 процентных пункта соответственно, при этом поддерживает более низкие значения AgentPPL и LongPPL в пределах контекста в 256 тысяч токенов. При работе с 1 миллионом токенов анализ демонстрирует снижение FLOPs при предварительной обработке на 2,92× по сравнению с HySparse и на 5,02× по сравнению с Hybrid SWA. Также отмечается, что размер кэша FP8 KV снижается примерно до 2,69 ГБ по сравнению с 6,72 ГБ и 12,09 ГБ для указанных базовых моделей.

Анализ аблиций показывает, что выбор на уровне токенов способствует более сильному поиску при фиксированном бюджете внимания. При масштабировании до 290B-A8B, механизм KV Bridging сохраняет сравнимое качество, одновременно обеспечивая возможность раннего выхода при предварительной обработке. Для специалистов, изучающих исследования китайских LLM-систем, HySparse2 является архитектурным сигналом, стоящим за заявлениями об эффективности MiMo-V3, а не новым релизом с открытым весом.

Похожие сюжеты

Xiaomi открыла веса и ресурсы для моделей MiMo-V2.6 Pro и MiMo-V2.6 Flash с использованием RL стека
Подробнее
pandaily.com

Xiaomi открыла веса и ресурсы для моделей MiMo-V2.6 Pro и MiMo-V2.6 Flash с использованием RL стека

Компания Xiaomi сделала общедоступными веса, техническую документацию и ресурсы для обучения с подкреплением (reinforcement-learning) для своей серии MiMo-V2.6. Согласно английским заметкам от Xiaomi от 22 сентября, были опубликованы репозитории MiMo-V2.6-Pro и MiMo-V2.6-Flash на платформе Hugging Face вместе с кодом RL и более чем 7000 тестовых сред.

Этот релиз представляет собой предоставление весов и кода, что отличается от предыдущего освещения процесса обучения RL через прямую трансляцию. Брендинг остается неизменным: Xiaomi / MiMo.

Модели Pro и Flash позиционируются как нативные мультимодальные модели, обладающие заявленным контекстным окном в один миллион токенов. Карточки моделей и дополнительные отчеты на английском языке указывают, что модель Pro имеет архитектуру разреженной смеси экспертов (sparse mixture-of-experts) с общим количеством параметров около 1,02 триллиона, при этом активно используется примерно 42 миллиарда параметров. Модель Flash оценена в 309 миллиардов общих параметров с активностью около 15 миллиардов.

Xiaomi сообщает, что каждая модель прошла 30 шагов RL в рамках приблизительно 750 000 траекторий менее чем за шесть дней. В процессе использовалось смешение задач, включая кодирование, работу общего агента, визуальные задачи и кибербезопасность. При этом в каждом обновлении было использовано около 1568 запросов и 16 прогонов, а объем данных на шаг составлял 3,5–3,7 миллиарда токенов.

По данным компании, наблюдался прирост производительности по задачам обучения примерно на 25% для Flash и на 12% для Pro. Кроме того, зафиксированы улучшения в DeepSWE v1.1: с 48,8 до примерно 65,7 для Flash и с 58,4 до примерно 72,6 для Pro, однако эти показатели являются данными, предоставленными вендором, и требуют подтверждения третьими сторонами.

Доступные активы выходят за рамки просто контрольных точек. Xiaomi предоставила комплексный фреймворк RL, построенный на verl и связанных механизмах агентов, более 7000 классифицированных сред, охватывающих разработку программного обеспечения, воспроизведение уязвимостей, интеллектуальный труд и веб-дизайн. Также доступны отправная точка Distill-Qwen-9B для экспериментов сообщества в области RL и легковесные компоненты для многоканального обучения. Стоимость API для размещенных версий Pro и Flash заявлена как соответствующая MiMo-V2.5, при этом уровень UltraSpeed обещает пропускную способность до 20 раз выше стандартного Pro при сохранении качества.

Тем не менее, инженерам все еще приходится сталкиваться с высокими расходами на обслуживание больших MoE, а заявления Xiaomi относительно искусственного анализа и бенчмарков агентов нуждаются во внешнем воспроизведении. Основная новость заключается в полном пакете MiMo-V2.6 с открытыми весами, кодом RL и средами, которые лаборатории могут изучить, а не просто графическое представление в прямой трансляции.

Популярное