Компания Cambricon объявила об успешном завершении адаптации модели DeepSeek-V4.1-Flash в рамках программы Day-0 на базе открытого стека инференса vLLM. Это означает, что недавно выпущенная модель может стабильно работать на ускорителях Cambricon в тот же день, когда DeepSeek опубликовала контрольную точку.
Данное объявление подчеркивает синергию между чипом и программным обеспечением: одновременная доступность модели и чипа, а также зрелость подхода Cambricon, сочетающего NeuWare и vLLM. Это не повторение информации о общей доступности самой модели.
DeepSeek-V4.1-Flash представляет собой наименьший вариант новой архитектурной линейки DeepSeek. Это модель типа mixture-of-experts с 552 миллиардами параметров, которая активирует около 8 миллиардов параметров на входной стороне и 16 миллиардов на выходной, а также обладает встроенным пониманием мультимодального зрения. DeepSeek отмечает использование структуры Causal-Encoder-Decoder и агрессивное сжатие KV-кэша, что снижает потребность в HBM примерно до четверти и в SSD — до восьмой части по сравнению с предыдущим поколением, при этом размер кэша в сотни раз меньше, чем у первой версии.
Эти экономии памяти критически важны для производителей ускорителей, которые стремятся контролировать задержку инференса, объем DRAM и уровни хранения на плотных серверах, которые уже испытывают нагрузку на бюджеты HBM.
Со своей стороны, инженеры Cambricon использовали библиотеку объединенных операторов Torch-MLU-Ops для ускорения таких структур, как Engram и Compressor, а также написали оптимизированные ядра на BangC для горячих точек разреженного и сжатого внимания. Внутри vLLM Cambricon заявляет о поддержке пятимерного смешанного параллелизма, охватывающего тензорный, конвейерный, последовательный, пакетный и экспертный параллелизм, с перекрытием коммуникаций и вычислений, квантованием с низкой точностью и разделением префилла и декодирования для повышения пропускной способности от начала до конца. Этот стек функционирует на NeuWare, долгосрочной программной платформе компании.
Несколько дней ранее Cambricon присоединилась к PyTorch Foundation в качестве платинового члена, заняв место в управляющем совете наряду с другими крупными разработчиками оборудования и облачных сервисов, что сигнализирует о более глубоких инвестициях в экосистему открытого обучения и инференса.
Теперь Cambricon поддерживает поддержку инференса Day-0 для пяти основных китайских линеек моделей: GLM, DeepSeek, Qwen, Kimi и MiniMax, представляющих Zhipu AI, DeepSeek, Alibaba, Moonshot AI и MiniMax соответственно. Издание Caixin Global отдельно отметило возможность включения Cambricon в тот же день как признак сокращения внутренних циклов разработки моделей и чипов в Китае — переход от многомесячных закрытых портов к готовности к запуску на публичных фреймворках, которые уже стандартизированы операторами.
Для операторов кластеров практический вывод заключается в совместной доступности: когда выходит передовая открытая модель, клиенты Cambricon могут использовать документированный рецепт vLLM вместо ожидания закрытой форка. Следующим испытанием для экосистемы программного обеспечения станет вопрос о том, применима ли эта схема Day-0 к более крупным вариантам DeepSeek и смесям мультимодального обслуживания.

