Компания DeepSeek представила модель DeepSeek-V4.1-Flash, которая является мультимодальной моделью типа Mixture-of-Experts (MoE) с 552 миллиардами параметров. Эта модель построена на основе архитектуры Causal Encoder–Decoder и поддерживает окно контекста размером в один миллион токенов. Компания позиционирует ее как наименьший член новой архитектурной линейки, нацеленной на повышение возможностей, ускорение декодирования и увеличение пропускной способности при развертывании, предоставляя доступ через API под названием deepseek-flash.
Стек Causal Encoder–Decoder использует трансформер из 40 слоев, разделенный на 20-слойный причинный кодировщик и 20-слойный декодер. При активации префикса активируется около 8 миллиардов параметров на токен, а при декодировании — около 16 миллиардов, что позволяет рабочим нагрузкам, интенсивно использующим входные данные, потреблять меньше ресурсов по сравнению с симметричными дизайнами MoE аналогичного размера.
Для оптимизации используются методы Compressed Sparse Attention 2 (CSA2), который распределяет режимы Full, Reindex или Reuse между слоями, а также FP4 основной кэш KV, который уменьшает общий объем KV примерно до 890 байт на токен — что составляет около четверти объема DeepSeek-V4-Flash. Кроме того, SWA Bounded Replay снижает постоянный спрос на KV в SSD примерно до одной восьмой.
Обучение проводилось на приблизительно 45 триллионах мультимодальных токенов, включая разреженное внимание на последовательностях в 64K, а расширение контекста до 1 миллиона произошло позже в процессе предварительного обучения. После этого следует тонкая настройка с учителем, обучение с подкреплением и дистилляция по политике, сопровождаемые интенсивным автоматизированным синтезом задач агентов.
В бенчмарках для агентных инструкций, при максимальном усилие рассуждения, DeepSeek сообщает следующие результаты: Terminal-Bench 2.1 достигает 90.6, DeepSWE v1.1 — 74.2, а AutomationBench — 54.8. Модель также обладает нативной поддержкой зрения благодаря энкодеру DeepSeek-ViT, созданному с нуля.
Веса и рецепты инференса опубликованы на Hugging Face под лицензией MIT, и DeepSeek заявляет о поддержке адаптеров для инференса с открытым исходным кодом для крупномасштабных внедрений. Старые псевдонимы V4 Flash временно перенаправляются на V4.1-Flash; DeepSeek также планирует отказаться от маршрутизации V4 Pro в пользу нового SKU Flash. Основной акцент делается на архитектуре и экономичном инференсе с длинным контекстом, основанном на сжатии KV и асимметричной активации, что делает обслуживание сессий агентов с миллионом токенов более дешевым.


