China Mobile Cloud представила гетерогенный стек для инференса LLM на базе GPU и нейроморфных чипов
Подробнее
Pandaily
pandaily.com

China Mobile Cloud представила гетерогенный стек для инференса LLM на базе GPU и нейроморфных чипов

China Mobile Cloud представила отечественную гибридную систему для смешанного инференса больших языковых моделей (LLM), которая объединяет графические процессоры (GPU) и нейроморфные технологии. Эта система была впервые продемонстрирована на Конференции по вычислительной мощности в Ланфанге, провинция Хэбэй, в 2026 году.

В разработку этого стека вошли China Mobile Cloud, а также Научно-исследовательский институт электротехники Китая Наньху (China Electronics Technology Nanhu Research Institute), Lynxi, Iluvatar CoreX, Университет Цинхуа и Пекинский университет. Ду Юцзянь, технический директор нейроморфной и оптической лаборатории China Mobile Cloud, подчеркнул, что нейроморфные возможности призваны ускорить существующие парки GPU, а не требовать их полной замены.

Основная концепция заключается в четком разделении работы Трансформера между различными типами чипов. Вычисления внимания остаются на отечественных GPU от Iluvatar CoreX, используя их общую пропускную способность. Блоки прямого распространения (feed-forward network blocks), включая эксперты с механизмом смешивания экспертов (mixture-of-experts), которые критичны к задержке, переносятся на нейроморфный кремний Lynxi. Этот кремний оптимизирован для вычислений в памяти и большого объема SRAM на кристалле, что помогает снизить давление, создаваемое «стеной памяти» и «стеной мощности» в кластерах на одной архитектуре GPU при обслуживании токенов с высокой конкурентностью.

Для обеспечения синхронизации двух этих структур используется саморазработанный компилятор моделей, высокоскоростной протокол межсоединений и унифицированный механизм инференса, которые отвечают за декомпозицию задач, совместное планирование и агрегацию результатов.

В качестве тестовой нагрузки был выбран DeepSeek V4 Flash. China Mobile Cloud утверждает, что по сравнению с другими отечественными кластерами GPU, этот гибридный стек более чем удваивает выход инференса и энергоэффективность, а также сокращает операционные расходы бизнеса более чем на 40%. Партнеры объясняют эти показатели приростом, обусловленным архитектурой на основе зрелых отечественных процессов, акцентируя внимание на программном обеспечении системы и размещении рабочих нагрузок, а не только на гонке процессов и узлов. Они также считают, что эту модель могут повторить другие операторы, уже использующие отечественные GPU.

Конференционные материалы также указывают, что следующими целями внедрения для данного разделения PD и Attention-FFN являются фабрики токенов, AI-кодирование, преобразование текста в видео, многоагентное взаимодействие, интеллектуальное производство, а также безопасность финансов и коммуникаций.

Консорциум заявил о планах продолжать совершенствовать гетерогенный движок и постепенно открывать части основного фреймворка для отечественных производителей GPU, нейроморфных чипов и вычислительных операторов. Для покупателей облачных услуг, ориентированных на стоимость одного токена, дебют представляет собой не столько коронацию одного ускорителя, сколько проверку того, сможет ли планирование Attention-on-GPU плюс MoE FFN-on-neuromorphic поддерживать задержку, выход и утилизацию после того, как трафик покинет стенд конференции. На момент запуска не было опубликовано независимых бенчмарков кластеров третьих сторон, отличных от настроек DeepSeek V4 Flash партнеров; до появления этих данных дебют на Конференции по вычислительной мощности в основном документирует воспроизводимый рецепт программного обеспечения и кремния, а не готовый SKU емкости.

Популярное