DeepSeek открыл версии TileLang, DeepGEMM и DeepEP для платформы Ascend от Huawei, представив SuperPoD Flex
Подробнее
Pandaily
pandaily.com

DeepSeek открыл версии TileLang, DeepGEMM и DeepEP для платформы Ascend от Huawei, представив SuperPoD Flex

Компания DeepSeek 30 сентября открыла набор инфраструктурных компонентов для вычислительной платформы Ascend от Huawei. Эти компоненты охватывают поддержку ядра программирования TileLang для Ascend, библиотеки вычислительных ядер и библиотеку распределенной связи.

DeepSeek заявила, что каждый из этих компонентов соответствует библиотекам, которые компания ранее выпускала для графических процессоров NVIDIA, что позволяет разработчикам использовать одни и те же инструменты на обеих платформах. Данный релиз выходит за рамки простой адаптации моделей, затрагивая программное обеспечение, на котором основаны собственные процессы обучения и инференса DeepSeek.

TileLang в центре внимания

TileLang является ключевым элементом. DeepSeek утверждает, что этот язык упрощает написание кода по сравнению с CUDA, сохраняя при этом возможность использования особенностей чипа. Уже реализованы большинство операторов, необходимых для обучения серии V4. Версия для Ascend оборачивает низкоуровневые инструкции Ascend C, и теперь каждый оператор TileLang, используемый DeepSeek в обучении, имеет высокопроизводительную реализацию для Ascend. Компания выражает надежду, что этот порт послужит образцом для экосистемного программного обеспечения на различных чипах искусственного интеллекта.

Для матричного умножения представлен DeepGEMM-Ascend, который совместим по API с оригинальным DeepGEMM и поддерживает форматы BF16, FP8 и FP4 на устройствах Ascend 950. TileKernels предоставляет единый интерфейс Python как для GPU, так и для NPU от Huawei, а FlashMLA занимается разреженным вниманием, в то время как DeepSelect обеспечивает выборку по топ-k для индексации и сэмплирования внимания. DeepEP-Ascend отвечает за межпроцессное общение типа all-to-all для моделей с экспертами (mixture-of-experts) на устройствах Ascend 950DT NPU.

На странице GitHub для Ascend 950DT NPU указана пропускная способность диспетчеризации FP8 в диапазоне от 373 до 375 ГБ/с и комбинированная пропускная способность от 345 до 347 ГБ/с при EP8, что, по словам DeepSeek, приближается к аппаратным пределам. Эти показатели получены с использованием тестового пакета прошивки; DeepSeek направляет пользователей к коммерческому выпуску от Huawei, запланированному примерно на 15 октября.

Поддержка от Huawei и результаты тестирования

Huawei, которой DeepSeek выразила благодарность за неограниченную поддержку, сообщила, что предоставила суперузел SuperPoD Flex, определенный совместно, а также схему сетевого взаимодействия UBL128. Эта схема обеспечивает масштабируемую сеть одного уровня на 128 карт с пропускной способностью 3,2 Тбит/с и двухуровневую сеть масштабирования до 256 тысяч карт, а также библиотеку ASC-COMM для пользовательских операторов связи. Huawei опубликовала совместную работу в своем сообществе CANN в виде рецептов, освещающих низколатентный инференс с большим количеством экспертов, развертывание на одной карте и одном узле, обучение в крупном масштабе, пулинг KV-кэша с длинным контекстом и агентное обучение с подкреплением.

В офлайн-тестах с конфигурацией EP32 и контекстом в 128 тысяч токенов Huawei сообщила, что DeepSeek-V4.1-Flash достиг скорости 2469 выходных токенов в секунду на карту при 5 мс на выходной токен, а также 5102 токена в секунду при 10 мс, исключая балансировку нагрузки фреймворка и планирование обслуживания. В объявлении не было указано, завершило ли V4 полное обучение в масштабе на Ascend.

Популярное