Компания DeepSeek запустила ограниченную внутреннюю бета-версию модели DeepSeek V4.1 Flash. Эта промежуточная контрольная точка построена на новой архитектуре, которая изначально поддерживает мультимодальность.
DeepSeek позиционирует этот релиз как более быстрый, мощный и экономичный по сравнению с предыдущими версиями Flash. При этом в течение строго ограниченного тестового периода сохраняется ценообразование уровня Flash. Доступ предоставляется до истечения идентификатора модели.
Разработчики могут использовать предварительный просмотр, не меняя базовый URL своего существующего API. Идентификатор модели — deepseek-v4.1-flash-expires-on-0910. Платежи во время бета-тестирования соответствуют DeepSeek V4 Flash, однако каждый аккаунт ограничен 20 одновременными запросами, что значительно ниже производственной пропускной способности Flash. Таким образом, этот период явно предназначен для оценки, а не для активного трафика.
Дата, указанная в названии модели, сигнализирует о том, что данный идентификатор перестанет работать примерно 10 сентября 2026 года, оставляя около двух дней доступа с момента запуска 8 сентября.
С архитектурной точки зрения, V4.1 Flash отличается от раннего эксперимента V4 Flash Vision, который прикреплял отдельный пакет расширения для обработки изображений к текстовой модели. DeepSeek утверждает, что мультимодальный ввод теперь является неотъемлемой частью переработанной архитектуры. Это означает, что текст и изображения, а также другие связанные модальности, обрабатываются внутри единого стека, вместо того чтобы проходить через внешний путь кодировщика с последующим вставлением данных.
Для продуктовой линейки, оптимизированной по задержке, это изменение имеет меньшее значение как заявление о пиковых визуальных показателях, а скорее как попытка избежать дополнительной задержки, которую часто добавляет видение в стиле плагина, когда изображения должны быть преобразованы перед тем, как попасть в языковую последовательность.
Ранние отчеты разработчиков, полученные в ходе бета-тестирования, указывают на устойчивую генерацию в диапазоне примерно от 300 до 500 токенов в секунду при низкой параллельности. Генерация описывается как относительно стабильная для циклов итеративного кодирования и прототипирования пользовательского интерфейса, где частые повторные попытки важнее, чем одна длинная завершенная последовательность. Следует отметить, что эти цифры являются наблюдениями сообщества, а не официальными бенчмарками; DeepSeek не опубликовала количество параметров, длину контекста или формальные таблицы оценки для этой промежуточной сборки.
В приложенной к тесту анкете обратной связи задан вопрос о том, считают ли пользователи, что модель может заменить DeepSeek V4 Pro в онлайн-среде. Это указывает на то, что компания исследует возможность достижения полезности уровня Pro при скорости и цене Flash, не отказываясь от структуры затрат Flash.
В совокупности, ограниченный по времени идентификатор, потолок параллелизма и опрос о замене Pro-версии представляют V4.1 Flash как временный мультимодальный предварительный просмотр уровня Flash новой архитектуры, а не постоянный SKU. Разработчикам, которым необходима эта функциональность, следует протестировать модель до истечения срока действия ее идентификатора; тем, кто планирует рабочие нагрузки, потребуется последующий релиз с более высокой параллельностью, документированными ограничениями и неизменяемым названием, прежде чем считать новую архитектуру стандартной инфраструктурой.


