DeepSeek выпустила модель DeepSeek-V4.1-Flash с архитектурой MoE, контекстом в 1 миллион токенов и сжатием KV
Подробнее
Pandaily
pandaily.com

DeepSeek выпустила модель DeepSeek-V4.1-Flash с архитектурой MoE, контекстом в 1 миллион токенов и сжатием KV

Компания DeepSeek представила модель DeepSeek-V4.1-Flash, которая является мультимодальной моделью типа Mixture-of-Experts (MoE) с 552 миллиардами параметров. Эта модель построена на основе архитектуры Causal Encoder–Decoder и поддерживает окно контекста размером в один миллион токенов. Компания позиционирует ее как наименьший член новой архитектурной линейки, нацеленной на повышение возможностей, ускорение декодирования и увеличение пропускной способности при развертывании, предоставляя доступ через API под названием deepseek-flash.

Стек Causal Encoder–Decoder использует трансформер из 40 слоев, разделенный на 20-слойный причинный кодировщик и 20-слойный декодер. При активации префикса активируется около 8 миллиардов параметров на токен, а при декодировании — около 16 миллиардов, что позволяет рабочим нагрузкам, интенсивно использующим входные данные, потреблять меньше ресурсов по сравнению с симметричными дизайнами MoE аналогичного размера.

Для оптимизации используются методы Compressed Sparse Attention 2 (CSA2), который распределяет режимы Full, Reindex или Reuse между слоями, а также FP4 основной кэш KV, который уменьшает общий объем KV примерно до 890 байт на токен — что составляет около четверти объема DeepSeek-V4-Flash. Кроме того, SWA Bounded Replay снижает постоянный спрос на KV в SSD примерно до одной восьмой.

Обучение проводилось на приблизительно 45 триллионах мультимодальных токенов, включая разреженное внимание на последовательностях в 64K, а расширение контекста до 1 миллиона произошло позже в процессе предварительного обучения. После этого следует тонкая настройка с учителем, обучение с подкреплением и дистилляция по политике, сопровождаемые интенсивным автоматизированным синтезом задач агентов.

В бенчмарках для агентных инструкций, при максимальном усилие рассуждения, DeepSeek сообщает следующие результаты: Terminal-Bench 2.1 достигает 90.6, DeepSWE v1.1 — 74.2, а AutomationBench — 54.8. Модель также обладает нативной поддержкой зрения благодаря энкодеру DeepSeek-ViT, созданному с нуля.

Веса и рецепты инференса опубликованы на Hugging Face под лицензией MIT, и DeepSeek заявляет о поддержке адаптеров для инференса с открытым исходным кодом для крупномасштабных внедрений. Старые псевдонимы V4 Flash временно перенаправляются на V4.1-Flash; DeepSeek также планирует отказаться от маршрутизации V4 Pro в пользу нового SKU Flash. Основной акцент делается на архитектуре и экономичном инференсе с длинным контекстом, основанном на сжатии KV и асимметричной активации, что делает обслуживание сессий агентов с миллионом токенов более дешевым.

Похожие сюжеты

OpenBMB выпустила MiniCPM5-2B как открытую модель SOTA для работы на устройстве весом менее 4 млрд параметров
Подробнее
pandaily.com

OpenBMB выпустила MiniCPM5-2B как открытую модель SOTA для работы на устройстве весом менее 4 млрд параметров

OpenBMB, открытый проект, связанный с ModelBest, представил MiniCPM5-2B — плотную языковую модель для работы непосредственно на устройстве. Эта модель имеет приблизительно 2,52 миллиарда параметров и поддерживает нативную контекстную длину в 131 072 токена, распространяясь под лицензией Apache-2.0.

MiniCPM5-2B является вторым релизом серии MiniCPM5 после MiniCPM5-1B. Он использует стандартную компоновку LlamaForCausalLM, которая включает 42 слоя с групповым вниманием (grouped-query attention), использующим 16 голов запросов и 2 головы ключа/значения. Благодаря этому, основные движки могут загружать модель без необходимости в кастомных ядрах или форках кода модели.

Параметры, не являющиеся эмбеддингами, составляют около 1,98 миллиарда, что позволяет разместить модель в классе менее 4 миллиардов параметров, подходящем для хостинга на телефонах, ноутбуках и периферийных устройствах.

При сравнении на наборе данных 34-бенчмарк OpenBMB, MiniCPM5-2B демонстрирует средний показатель 53,9, опережая ряд более крупных открытых базовых моделей. Среди них Qwen3.5-4B показал 51,1, а granite-4.2-3B — 42,7. При этом аналогичные по размеру модели, такие как LFM2.5-2.6B и Qwen3.5-2B, отстают.

Сильные стороны модели сосредоточены в областях кодирующих агентов, использования инструментов и извлечения информации из длинного контекста. Например, на LiveCodeBench v6 MiniCPM5-2B показал 69,1 против 56,4 у Qwen3.5-4B, а на SWE-bench Verified — 46,4 против 33,6. Также высокие результаты достигнуты на τ²-Bench Telecom (97,1), BFCL v4 (66,6) и NoLiMa (68,1 против 43,5).

В задачах, требующих глубоких знаний, показатели остаются ближе к верхней границе размера; например, на MMLU-Pro модель показала 70,8, в то время как эталонная модель Qwen размером 4B набрала 78,0. OpenBMB отдельно отмечает строки, полученные из источников Artificial Analysis, чтобы пользователи могли различать данные от вендоров и сторонние результаты.

Послетренировочный процесс следовал управлению уровня UltraData: сначала проводилось тонкое дообучение с учителем (supervised fine-tuning) на основе глубокого мышления с использованием примерно 400 миллиардов токенов. Затем применялись специализированные учителя обучения с подкреплением (reinforcement-learning teachers) для математики, кода, агентов и письма с помощью алгоритма JustRL II, основанного на критике. Завершающим этапом стала дистилляция по политике (on-policy distillation), которая объединила 16 экспертов RL — пятеро из которых были агентными — в одну конечную модель-студента.

OpenBMB связывает средний прирост около 10,96 баллов в задачах рассуждения и общих наборах, а также 6,96 баллов в агентных наборах, с этапом RL и дистилляции. Для возможности прямого измерения вклада каждой части, компания выпускает промежуточные контрольные точки: Base, Midtrain и SFT-only.

Вместе с весами, корпорации UltraData публикуют корпуса данных, охватывающие веб, код, математику, образцы SFT и RL для агентов, что позволяет проводить воспроизведение результатов. Поддержка времени выполнения включает vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT и многочиповые сборки FlagOS. Предоставляются пакеты GGUF, MLX и GPTQ, предназначенные для локальных помощников, которым необходимо выполнять вызовы инструментов и работать с длинным контекстом без использования графического процессора дата-центра.

Для разработчиков, ориентированных на работу на устройстве, MiniCPM5-2B позиционируется не столько как гигант общего знания, сколько как компактный агент с лицензией Apache и компаньон для кодирования, который уже превосходит некоторые открытые базовые модели класса 4B по опубликованному среднему показателю.

DeepSeek выпустила V4.1-Flash, новую модель ИИ, которая быстрее и имеет сниженные затраты
Подробнее
olhardigital.com.br

DeepSeek выпустила V4.1-Flash, новую модель ИИ, которая быстрее и имеет сниженные затраты

Китайская компания DeepSeek представила V4.1-Flash, свою новейшую модель искусственного интеллекта. Эта новая технология представлена как самая компактная в ее семействе моделей и обещает более быстрые ответы, большую вычислительную мощность и более низкие эксплуатационные расходы.

Этот запуск происходит на фоне подготовки DeepSeek к первичному публичному размещению акций (IPO) на рынке STAR в Шанхае, о чем сообщило Reuters. Кроме того, компания внедряет V4.1-Flash, заменяя предыдущие версии своих моделей.

Несмотря на то, что это самая маленькая модель в новой линейке, V4.1-Flash имеет 552 миллиарда параметров, которые используются ИИ для обработки данных и генерации результатов. Однако во время выполнения каждой задачи он использует лишь малую часть этих ресурсов, а именно 8 миллиардов параметров для приема информации и 16 миллиардов для формирования ответов.

Практическая цель для пользователя состоит в том, чтобы позволить модели работать быстрее и справляться с большим объемом запросов без чрезмерного потребления вычислительных ресурсов. DeepSeek также гарантирует, что система спроектирована таким образом, чтобы в будущем было легче разрабатывать еще более крупные модели.

Компания подчеркнула, что V4.1-Flash обладает «нативным визуальным пониманием», позволяющим интерпретировать визуальный контент, такой как изображения. Тесты, проведенные различными организациями, показали, что эта новая модель превосходит V4-Pro по производительности, стоимости, скорости и общему времени выполнения.

Значительное изменение заключается в том, как модель хранит данные во время операции, что исторически могло увеличивать стоимость долгосрочных услуг ИИ. По сравнению с предыдущим поколением DeepSeek заявила, что V4.1-Flash требует меньше ресурсов, что, по утверждению компании, может резко сократить расходы, особенно в агентах ИИ и системах, выполняющих задачи с минимальным вмешательством человека.

V4.1-Flash уже доступен через API DeepSeek, который позволяет интегрировать модель в другие приложения. Модели V4-Flash и V4-Flash-Vision-Exp были выведены из эксплуатации, и их вызовы временно перенаправляются на новую систему.

Дополнительная информация:

V4-Pro будет постепенно выводиться из эксплуатации. Начиная с 14 сентября 2026 года, все запросы, направленные к нему, будут автоматически перенаправляться на V4.1-Flash с применением тарифа, соответствующего новой модели. Этот процесс продлится до выпуска V4.1-Pro.

Новые тарифы API вступают в силу 10 сентября. DeepSeek устанавливает разные ставки для периодов высокого и низкого спроса; вне часов пик цена составит половину максимальной ставки. Компания подчеркнула: «V4.1-Flash позволяет обслуживать больше пользователей при меньших затратах. Мы передаем эту экономию вам».

Кроме того, DeepSeek планирует сотрудничать с сообществом с открытым исходным кодом для расширения поддержки модели и изучения других методологий внедрения. Информация о выпуске новой модели была первоначально опубликована в Olhar Digital.

Популярное