Компания DeepSeek 30 сентября открыла набор инфраструктурных компонентов для вычислительной платформы Ascend от Huawei. Эти компоненты охватывают поддержку ядра программирования TileLang для Ascend, библиотеки вычислительных ядер и библиотеку распределенной связи.
DeepSeek заявила, что каждый из этих компонентов соответствует библиотекам, которые компания ранее выпускала для графических процессоров NVIDIA, что позволяет разработчикам использовать одни и те же инструменты на обеих платформах. Данный релиз выходит за рамки простой адаптации моделей, затрагивая программное обеспечение, на котором основаны собственные процессы обучения и инференса DeepSeek.
TileLang в центре внимания
TileLang является ключевым элементом. DeepSeek утверждает, что этот язык упрощает написание кода по сравнению с CUDA, сохраняя при этом возможность использования особенностей чипа. Уже реализованы большинство операторов, необходимых для обучения серии V4. Версия для Ascend оборачивает низкоуровневые инструкции Ascend C, и теперь каждый оператор TileLang, используемый DeepSeek в обучении, имеет высокопроизводительную реализацию для Ascend. Компания выражает надежду, что этот порт послужит образцом для экосистемного программного обеспечения на различных чипах искусственного интеллекта.
Для матричного умножения представлен DeepGEMM-Ascend, который совместим по API с оригинальным DeepGEMM и поддерживает форматы BF16, FP8 и FP4 на устройствах Ascend 950. TileKernels предоставляет единый интерфейс Python как для GPU, так и для NPU от Huawei, а FlashMLA занимается разреженным вниманием, в то время как DeepSelect обеспечивает выборку по топ-k для индексации и сэмплирования внимания. DeepEP-Ascend отвечает за межпроцессное общение типа all-to-all для моделей с экспертами (mixture-of-experts) на устройствах Ascend 950DT NPU.
На странице GitHub для Ascend 950DT NPU указана пропускная способность диспетчеризации FP8 в диапазоне от 373 до 375 ГБ/с и комбинированная пропускная способность от 345 до 347 ГБ/с при EP8, что, по словам DeepSeek, приближается к аппаратным пределам. Эти показатели получены с использованием тестового пакета прошивки; DeepSeek направляет пользователей к коммерческому выпуску от Huawei, запланированному примерно на 15 октября.
Поддержка от Huawei и результаты тестирования
Huawei, которой DeepSeek выразила благодарность за неограниченную поддержку, сообщила, что предоставила суперузел SuperPoD Flex, определенный совместно, а также схему сетевого взаимодействия UBL128. Эта схема обеспечивает масштабируемую сеть одного уровня на 128 карт с пропускной способностью 3,2 Тбит/с и двухуровневую сеть масштабирования до 256 тысяч карт, а также библиотеку ASC-COMM для пользовательских операторов связи. Huawei опубликовала совместную работу в своем сообществе CANN в виде рецептов, освещающих низколатентный инференс с большим количеством экспертов, развертывание на одной карте и одном узле, обучение в крупном масштабе, пулинг KV-кэша с длинным контекстом и агентное обучение с подкреплением.
В офлайн-тестах с конфигурацией EP32 и контекстом в 128 тысяч токенов Huawei сообщила, что DeepSeek-V4.1-Flash достиг скорости 2469 выходных токенов в секунду на карту при 5 мс на выходной токен, а также 5102 токена в секунду при 10 мс, исключая балансировку нагрузки фреймворка и планирование обслуживания. В объявлении не было указано, завершило ли V4 полное обучение в масштабе на Ascend.
