DeepSeek выпустила бета-версию V4.1 Flash с нативной мультимодальной архитектурой
Подробнее
Pandaily
pandaily.com

DeepSeek выпустила бета-версию V4.1 Flash с нативной мультимодальной архитектурой

Компания DeepSeek запустила ограниченную внутреннюю бета-версию модели DeepSeek V4.1 Flash. Эта промежуточная контрольная точка построена на новой архитектуре, которая изначально поддерживает мультимодальность.

DeepSeek позиционирует этот релиз как более быстрый, мощный и экономичный по сравнению с предыдущими версиями Flash. При этом в течение строго ограниченного тестового периода сохраняется ценообразование уровня Flash. Доступ предоставляется до истечения идентификатора модели.

Разработчики могут использовать предварительный просмотр, не меняя базовый URL своего существующего API. Идентификатор модели — deepseek-v4.1-flash-expires-on-0910. Платежи во время бета-тестирования соответствуют DeepSeek V4 Flash, однако каждый аккаунт ограничен 20 одновременными запросами, что значительно ниже производственной пропускной способности Flash. Таким образом, этот период явно предназначен для оценки, а не для активного трафика.

Дата, указанная в названии модели, сигнализирует о том, что данный идентификатор перестанет работать примерно 10 сентября 2026 года, оставляя около двух дней доступа с момента запуска 8 сентября.

С архитектурной точки зрения, V4.1 Flash отличается от раннего эксперимента V4 Flash Vision, который прикреплял отдельный пакет расширения для обработки изображений к текстовой модели. DeepSeek утверждает, что мультимодальный ввод теперь является неотъемлемой частью переработанной архитектуры. Это означает, что текст и изображения, а также другие связанные модальности, обрабатываются внутри единого стека, вместо того чтобы проходить через внешний путь кодировщика с последующим вставлением данных.

Для продуктовой линейки, оптимизированной по задержке, это изменение имеет меньшее значение как заявление о пиковых визуальных показателях, а скорее как попытка избежать дополнительной задержки, которую часто добавляет видение в стиле плагина, когда изображения должны быть преобразованы перед тем, как попасть в языковую последовательность.

Ранние отчеты разработчиков, полученные в ходе бета-тестирования, указывают на устойчивую генерацию в диапазоне примерно от 300 до 500 токенов в секунду при низкой параллельности. Генерация описывается как относительно стабильная для циклов итеративного кодирования и прототипирования пользовательского интерфейса, где частые повторные попытки важнее, чем одна длинная завершенная последовательность. Следует отметить, что эти цифры являются наблюдениями сообщества, а не официальными бенчмарками; DeepSeek не опубликовала количество параметров, длину контекста или формальные таблицы оценки для этой промежуточной сборки.

В приложенной к тесту анкете обратной связи задан вопрос о том, считают ли пользователи, что модель может заменить DeepSeek V4 Pro в онлайн-среде. Это указывает на то, что компания исследует возможность достижения полезности уровня Pro при скорости и цене Flash, не отказываясь от структуры затрат Flash.

В совокупности, ограниченный по времени идентификатор, потолок параллелизма и опрос о замене Pro-версии представляют V4.1 Flash как временный мультимодальный предварительный просмотр уровня Flash новой архитектуры, а не постоянный SKU. Разработчикам, которым необходима эта функциональность, следует протестировать модель до истечения срока действия ее идентификатора; тем, кто планирует рабочие нагрузки, потребуется последующий релиз с более высокой параллельностью, документированными ограничениями и неизменяемым названием, прежде чем считать новую архитектуру стандартной инфраструктурой.

Похожие сюжеты

DeepSeek выпустила первую нативную мультимодальную модель V4-Flash-Vision-Exp с открытым исходным кодом
Подробнее
pandaily.com

DeepSeek выпустила первую нативную мультимодальную модель V4-Flash-Vision-Exp с открытым исходным кодом

Компания DeepSeek представила свою первую нативную мультимодальную модель. Модель DeepSeek-V4-Flash-Vision-Exp стала доступна на платформе Hugging Face 31 августа под лицензией MIT, ознаменовав собой первоначальную поддержку ввода изображений в серии V4 наряду с текстом.

Релиз включает файлы модели, токенизатор, минимальную реализацию для кодирования промптов, а также минимальную реализацию инференса на PyTorch. Эта реализация охватывает визовый энкодер, выравниватель (aligner), внимание DFlash, слой маршрутизации с использованием смеси экспертов (mixture-of-experts routing layer), модули Hyper-Connections и DSpark.

DeepSeek отметила, что вес модели является экспериментальной сборкой «Exp»; ранее модель была доступна через API DeepSeek с 21 августа. Благодаря визуальным возможностям, модель способна описывать изображения, считывать текст на скриншотах и анализировать графики, принимая входные данные в форматах JPEG, PNG, GIF и WebP.

В задачах, основанных исключительно на тексте — таких как рассуждения, агенты и знание мира — компания утверждает, что производительность соответствует версии V4-Flash, сохраняя прежние сильные стороны. Однако в бенчмарках для агентов, требующих визуального понимания, модель значительно превосходит V4-Flash, приближая возможности мультимодального агента к уровню Claude Opus 4.8.

Открывая стек инференса и сами веса, DeepSeek позиционирует эту модель для интеграции в различные фреймворки и инструменты для агентов, расширяя свою стратегию с открытыми весами от текстовых задач к задачам с поддержкой зрения. Для разработчиков и предприятий этот релиз снижает порог входа для локального развертывания конкурентоспособной модели с возможностями зрения или использования стандартной инфраструктуры, что соответствует общеотраслевому тренду на экономичные и настраиваемые открытые модели.

Модели, способные работать с визуальными данными, стали ключевыми элементами рынка ИИ-агентов, поскольку разработчики объединяют скриншоты и реальные изображения с функциями рассуждения. Шаг DeepSeek следует за тенденцией растущего числа открытых мультимодальных релизов от китайских лабораторий, которые используют разрешительные лицензии и агрессивное ценообразование для завоевания популярности на платформах разработчиков США, в каталогах облачных сервисов и в меню корпоративных моделей.

Поскольку модель достаточно легкая для своего уровня веса и поставляется с минимальной ссылкой на инференс, команды могут быстро ее внедрить без необходимости в проприетарных инструментах оркестрации. Компания заявила, что будет продолжать совершенствовать линейку V4, используя экспериментальную сборку с функцией зрения как средство проверки архитектурных решений — компонентов выравнивателя, DSpark и Hyper-Connections — перед более широким мультимодальным выпуском. На данный момент экспериментальный флаг указывает на необходимость осторожности: распознавание и понимание графиков сильны, но DeepSeek советует тестировать модель на конкретных рабочих нагрузках, а не предполагать производственную готовность во всех задачах с изображениями. Ранние пользователи, включая исследовательские группы и разработчиков приложений, используют открытый стек для оценки того, насколько навыки мультимодального агента модели, близкие к уровню Opus, выдержат проверку в их собственных процессах.

Локальная модель StartLux с 27 млрд параметров превзошла DeepSeek V4 Flash в китайском AI-бенчмарке
Подробнее
pandaily.com

Локальная модель StartLux с 27 млрд параметров превзошла DeepSeek V4 Flash в китайском AI-бенчмарке

Согласно отчету, подготовленному Китайской академией информационных и коммуникационных технологий (CAICT), на карте локальных моделей появился новый игрок. Компания StartLux, базирующаяся в Шанхае и разработавшая модель StartLux-V1.0-27B-Preview, заняла второе место в общем зачете специального теста MCP в рамках линейки проверенных AI-бенчмарков, опередив DeepSeek-V4-Flash, используя всего 27 миллиардов параметров.

Тест MCP оценивает шесть специализированных задач: навигацию по местоположению, поиск в интернете, автоматизацию браузера, финансовый анализ, управление репозиториями кода и 3D-дизайн, а также включает комплексную оценку, фокусирующуюся на координации нескольких инструментов, выполнении сложных задач и взаимодействии в реальных условиях. Среди протестированных моделей были DeepSeek-V4-Pro (1,6 триллиона параметров), DeepSeek-V4-Flash-0731 (284 миллиарда), Step-3.7-Flash (198 миллиардов), StartLux-27B-260715 (27 миллиардов), Qwen-3.6-27B (27 миллиардов) и AgentCPM-Explore (4 миллиарда).

Модель StartLux-V1.0-27B-Preview получила балл 39.25, что обеспечило ей второе место, обойдя как DeepSeek-V4-Flash с 284 миллиардами параметров, так и Step-3.7-Flash с 198 миллиардами. При одинаковом размере параметров она опередила Qwen-3.6-27B на 5.34 пункта. Модель заняла первое место в навигации по местоположению, а также показала первое место или сравнялась с ним в автоматизации браузера и финансовом анализе, в некоторых случаях достигая уровня триллионной модели DeepSeek-V4-Pro.

Данная модель построена на основе Qwen3.6-27B с дополнительным улучшением после обучения. StartLux внедрила подход, который они назвали «AI обучает AI» (Автоматический поиск), позволяющий автономно проводить экспериментальные тренировки и совершенствовать стратегию посредством обратной связи. Компания утверждает, что это первое применение данного метода для локальной агентной модели в Китае.

Этот результат отражает более широкий сдвиг в индустрии. Поскольку производительность передовых моделей достигла практических пороговых значений, эра гонки параметров трансформировалась в фазу гомогенизации; приоритеты пользователей все чаще смещаются в сторону решения реальных проблем, обеспечения безопасности данных и контроля затрат, а не только достижения высоких показателей в бенчмарках. Мировые игроки движутся в том же направлении: Google's Gemma 4, Meta's open Muse Glimmer и Nvidia's Nemotron 3.5 Lightning нацелены на локальное развертывание.

StartLux-V1.0-27B-Preview может работать на потребительских ПК, и компания планирует выпустить свое первое поколение решений локального интеллекта в текущем году. Результаты CAICT сигнализируют предприятиям о том, что компактные, локально развертываемые модели теперь способны конкурировать с гораздо более крупными облачными решениями в задачах, имеющих значение в реальных рабочих процессах, что начинает менять решения о закупках.

Популярное