Huawei открыла исходный код обучения openPangu-2.0 (Pretrain, SFT и RL) для платформы Ascend
Подробнее
Pandaily
pandaily.com

Huawei открыла исходный код обучения openPangu-2.0 (Pretrain, SFT и RL) для платформы Ascend

Компания Huawei открыла исходный код для процессов предварительного обучения (pretraining), контролируемой тонкой настройки (SFT) и обучения с подкреплением (RL) для модели openPangu-2.0. Этот релиз состоялся 28 сентября 2026 года, согласно информации от TMT Post и освещению, связанному со стеком обучения, оптимизированным для Ascend.

Официальное брендирование используется как Huawei / openPangu. Ранее уже были выпущены веса моделей openPangu-2.0-Pro и openPangu-2.0-Flash на платформе Hugging Face; однако текущий выпуск касается именно пути тренировочного кода, который лежит в основе этих моделей MoE, обученных на Ascend, а не выпуска новых параметров.

Карточки моделей на Hugging Face описывают openPangu как бренд открытых моделей искусственного интеллекта от Huawei, предназначенных для обучения и инференса на Ascend. Модель openPangu-2.0-Pro представлена примерно 505 миллиардами общих параметров с около 18 миллиардами активных на токен, окном контекста 512K и бюджетом обучения около 34 триллионов токенов. Модель openPangu-2.0-Flash имеет около 92 миллиардов общих параметров, примерно 6 миллиардов активных, тот же контекстный размер 512K и сопоставимый бюджет в ~34 триллиона токенов.

Дополнительные сведения после обучения обеих моделей упоминают комбинированную быструю/медленную SFT, многоспециализированный RL и онлайн-дистилляцию (OPD). Архитектурные особенности, общие для Pro и Flash, включают многоголовое латентное внимание, слоистый микс DSA-plus-SWA (примерно 1:2), топологию остатка mHC с четырьмя ветвями, трехголовое прогнозирование мультитокенов и обучение с использованием оптимизатора Muon.

Выпуск от 28 сентября представляет компоненты предварительного обучения, SFT и RL как инструменты, специфичные для Ascend, позволяя разработчикам воспроизводить и расширять этот стек, вместо того чтобы просто загружать веса для инференса. Важно различать открытые веса, код инференса и этот набор тренировочного кода: веса уже были общедоступны; новость заключается в том, что Huawei открывает путь обучения openPangu-2.0 на стороне Ascend для компонентов pretrain/SFT/RL.

Для команд, работающих на Ascend, конкретный результат — это OSS тренировочный стек, соответствующий подтвержденной семейству моделей Pro (505B / ~18B активных, 512K) и Flash (92B / ~6B активных, 512K).

Похожие сюжеты

Huawei представила Ascend 960 SuperPoD с оптикой ближнего пакета на конференции Connect 2026
Подробнее
pandaily.com

Huawei представила Ascend 960 SuperPoD с оптикой ближнего пакета на конференции Connect 2026

На мероприятии Huawei Connect 2026, которое состоялось в Шанхае 17 сентября, председательствующий директор Дэвид Ванг представил Ascend 960 SuperPoD как суперузел следующего поколения для искусственного интеллекта. Акцент в разработке сделан на масштабируемости межсоединений, а не на производительности одного чипа.

Согласно описанию системы, Ascend 960 SuperPoD является первой моделью, использующей оптику ближнего пакета (NPO). Эта технология объединяет фабрику Lingqu UnifiedBus от Huawei с оптическим движком Hi-ONE, что позволяет размещать оптические соединения ближе к корпусу чипа.

По данным First Finance и сопутствующих отчетов, один Ascend 960 SuperPoD способен соединять около 4096 карт с задержкой туда-обратно, приближающейся к 2 микросекундам. Huawei утверждает, что такие показатели позволяют осуществлять крупномасштабное обучение и инференс моделей объемом до 10 триллионов параметров.

Кроме того, была озвучена более широкая информация о поставках: системы Ascend SuperPoD уже были отгружены более чем 1000 клиентам из более чем 370 компаний, что свидетельствует о переходе архитектуры из демонстрационных стендов в коммерческое использование.

Была скорректирована дорожная карта чипов. Huawei объявила, что Ascend 960DT планируется к выпуску в первом квартале 2027 года, а Ascend 960PR — в третьем квартале. Также запланирован выпуск жидкостного Atlas 960 SuperPoD в третьем квартале 2027 года, что на три квартала раньше первоначального публичного прогноза, который указывал на конец 2027 года для Ascend 960. Ванг также сообщил, что Huawei разработала 11 чипов на базе UnifiedBus для крупных систем и подтвердила долгосрочную цель создания SuperCluster на миллион карт.

Основной акцент делается на системной инженерии: это включает оптику NPO, UnifiedBus, системы охлаждения и программное обеспечение кластера, которые позволяют множеству карт Ascend функционировать как единая машина. Репортажи Reuters подтвердили двойные даты запуска в 2027 году и цифры поставок более 1000 суперузлов и более 370 клиентов, однако не назвали имена покупателей. Данная новость отличается от отчета Huawei об Интеллектуальном мире 2035, опубликованного накануне, поскольку здесь представлена конкретная информация о межсоединении SuperPoD и пересмотренном графике Atlas 960 для операторов, которые уже оценивают кластеры Ascend.

Популярное