Cambricon адаптировал модель DeepSeek-V4.1-Flash на стеке vLLM
Подробнее
Pandaily
pandaily.com

Cambricon адаптировал модель DeepSeek-V4.1-Flash на стеке vLLM

Компания Cambricon объявила об успешном завершении адаптации модели DeepSeek-V4.1-Flash в рамках программы Day-0 на базе открытого стека инференса vLLM. Это означает, что недавно выпущенная модель может стабильно работать на ускорителях Cambricon в тот же день, когда DeepSeek опубликовала контрольную точку.

Данное объявление подчеркивает синергию между чипом и программным обеспечением: одновременная доступность модели и чипа, а также зрелость подхода Cambricon, сочетающего NeuWare и vLLM. Это не повторение информации о общей доступности самой модели.

DeepSeek-V4.1-Flash представляет собой наименьший вариант новой архитектурной линейки DeepSeek. Это модель типа mixture-of-experts с 552 миллиардами параметров, которая активирует около 8 миллиардов параметров на входной стороне и 16 миллиардов на выходной, а также обладает встроенным пониманием мультимодального зрения. DeepSeek отмечает использование структуры Causal-Encoder-Decoder и агрессивное сжатие KV-кэша, что снижает потребность в HBM примерно до четверти и в SSD — до восьмой части по сравнению с предыдущим поколением, при этом размер кэша в сотни раз меньше, чем у первой версии.

Эти экономии памяти критически важны для производителей ускорителей, которые стремятся контролировать задержку инференса, объем DRAM и уровни хранения на плотных серверах, которые уже испытывают нагрузку на бюджеты HBM.

Со своей стороны, инженеры Cambricon использовали библиотеку объединенных операторов Torch-MLU-Ops для ускорения таких структур, как Engram и Compressor, а также написали оптимизированные ядра на BangC для горячих точек разреженного и сжатого внимания. Внутри vLLM Cambricon заявляет о поддержке пятимерного смешанного параллелизма, охватывающего тензорный, конвейерный, последовательный, пакетный и экспертный параллелизм, с перекрытием коммуникаций и вычислений, квантованием с низкой точностью и разделением префилла и декодирования для повышения пропускной способности от начала до конца. Этот стек функционирует на NeuWare, долгосрочной программной платформе компании.

Несколько дней ранее Cambricon присоединилась к PyTorch Foundation в качестве платинового члена, заняв место в управляющем совете наряду с другими крупными разработчиками оборудования и облачных сервисов, что сигнализирует о более глубоких инвестициях в экосистему открытого обучения и инференса.

Теперь Cambricon поддерживает поддержку инференса Day-0 для пяти основных китайских линеек моделей: GLM, DeepSeek, Qwen, Kimi и MiniMax, представляющих Zhipu AI, DeepSeek, Alibaba, Moonshot AI и MiniMax соответственно. Издание Caixin Global отдельно отметило возможность включения Cambricon в тот же день как признак сокращения внутренних циклов разработки моделей и чипов в Китае — переход от многомесячных закрытых портов к готовности к запуску на публичных фреймворках, которые уже стандартизированы операторами.

Для операторов кластеров практический вывод заключается в совместной доступности: когда выходит передовая открытая модель, клиенты Cambricon могут использовать документированный рецепт vLLM вместо ожидания закрытой форка. Следующим испытанием для экосистемы программного обеспечения станет вопрос о том, применима ли эта схема Day-0 к более крупным вариантам DeepSeek и смесям мультимодального обслуживания.

Похожие сюжеты

Локальная модель StartLux с 27 млрд параметров превзошла DeepSeek V4 Flash в китайском AI-бенчмарке
Подробнее
pandaily.com

Локальная модель StartLux с 27 млрд параметров превзошла DeepSeek V4 Flash в китайском AI-бенчмарке

Согласно отчету, подготовленному Китайской академией информационных и коммуникационных технологий (CAICT), на карте локальных моделей появился новый игрок. Компания StartLux, базирующаяся в Шанхае и разработавшая модель StartLux-V1.0-27B-Preview, заняла второе место в общем зачете специального теста MCP в рамках линейки проверенных AI-бенчмарков, опередив DeepSeek-V4-Flash, используя всего 27 миллиардов параметров.

Тест MCP оценивает шесть специализированных задач: навигацию по местоположению, поиск в интернете, автоматизацию браузера, финансовый анализ, управление репозиториями кода и 3D-дизайн, а также включает комплексную оценку, фокусирующуюся на координации нескольких инструментов, выполнении сложных задач и взаимодействии в реальных условиях. Среди протестированных моделей были DeepSeek-V4-Pro (1,6 триллиона параметров), DeepSeek-V4-Flash-0731 (284 миллиарда), Step-3.7-Flash (198 миллиардов), StartLux-27B-260715 (27 миллиардов), Qwen-3.6-27B (27 миллиардов) и AgentCPM-Explore (4 миллиарда).

Модель StartLux-V1.0-27B-Preview получила балл 39.25, что обеспечило ей второе место, обойдя как DeepSeek-V4-Flash с 284 миллиардами параметров, так и Step-3.7-Flash с 198 миллиардами. При одинаковом размере параметров она опередила Qwen-3.6-27B на 5.34 пункта. Модель заняла первое место в навигации по местоположению, а также показала первое место или сравнялась с ним в автоматизации браузера и финансовом анализе, в некоторых случаях достигая уровня триллионной модели DeepSeek-V4-Pro.

Данная модель построена на основе Qwen3.6-27B с дополнительным улучшением после обучения. StartLux внедрила подход, который они назвали «AI обучает AI» (Автоматический поиск), позволяющий автономно проводить экспериментальные тренировки и совершенствовать стратегию посредством обратной связи. Компания утверждает, что это первое применение данного метода для локальной агентной модели в Китае.

Этот результат отражает более широкий сдвиг в индустрии. Поскольку производительность передовых моделей достигла практических пороговых значений, эра гонки параметров трансформировалась в фазу гомогенизации; приоритеты пользователей все чаще смещаются в сторону решения реальных проблем, обеспечения безопасности данных и контроля затрат, а не только достижения высоких показателей в бенчмарках. Мировые игроки движутся в том же направлении: Google's Gemma 4, Meta's open Muse Glimmer и Nvidia's Nemotron 3.5 Lightning нацелены на локальное развертывание.

StartLux-V1.0-27B-Preview может работать на потребительских ПК, и компания планирует выпустить свое первое поколение решений локального интеллекта в текущем году. Результаты CAICT сигнализируют предприятиям о том, что компактные, локально развертываемые модели теперь способны конкурировать с гораздо более крупными облачными решениями в задачах, имеющих значение в реальных рабочих процессах, что начинает менять решения о закупках.

Популярное