Компания DeepSeek представила свою первую нативную мультимодальную модель. Модель DeepSeek-V4-Flash-Vision-Exp стала доступна на платформе Hugging Face 31 августа под лицензией MIT, ознаменовав собой первоначальную поддержку ввода изображений в серии V4 наряду с текстом.
Релиз включает файлы модели, токенизатор, минимальную реализацию для кодирования промптов, а также минимальную реализацию инференса на PyTorch. Эта реализация охватывает визовый энкодер, выравниватель (aligner), внимание DFlash, слой маршрутизации с использованием смеси экспертов (mixture-of-experts routing layer), модули Hyper-Connections и DSpark.
DeepSeek отметила, что вес модели является экспериментальной сборкой «Exp»; ранее модель была доступна через API DeepSeek с 21 августа. Благодаря визуальным возможностям, модель способна описывать изображения, считывать текст на скриншотах и анализировать графики, принимая входные данные в форматах JPEG, PNG, GIF и WebP.
В задачах, основанных исключительно на тексте — таких как рассуждения, агенты и знание мира — компания утверждает, что производительность соответствует версии V4-Flash, сохраняя прежние сильные стороны. Однако в бенчмарках для агентов, требующих визуального понимания, модель значительно превосходит V4-Flash, приближая возможности мультимодального агента к уровню Claude Opus 4.8.
Открывая стек инференса и сами веса, DeepSeek позиционирует эту модель для интеграции в различные фреймворки и инструменты для агентов, расширяя свою стратегию с открытыми весами от текстовых задач к задачам с поддержкой зрения. Для разработчиков и предприятий этот релиз снижает порог входа для локального развертывания конкурентоспособной модели с возможностями зрения или использования стандартной инфраструктуры, что соответствует общеотраслевому тренду на экономичные и настраиваемые открытые модели.
Модели, способные работать с визуальными данными, стали ключевыми элементами рынка ИИ-агентов, поскольку разработчики объединяют скриншоты и реальные изображения с функциями рассуждения. Шаг DeepSeek следует за тенденцией растущего числа открытых мультимодальных релизов от китайских лабораторий, которые используют разрешительные лицензии и агрессивное ценообразование для завоевания популярности на платформах разработчиков США, в каталогах облачных сервисов и в меню корпоративных моделей.
Поскольку модель достаточно легкая для своего уровня веса и поставляется с минимальной ссылкой на инференс, команды могут быстро ее внедрить без необходимости в проприетарных инструментах оркестрации. Компания заявила, что будет продолжать совершенствовать линейку V4, используя экспериментальную сборку с функцией зрения как средство проверки архитектурных решений — компонентов выравнивателя, DSpark и Hyper-Connections — перед более широким мультимодальным выпуском. На данный момент экспериментальный флаг указывает на необходимость осторожности: распознавание и понимание графиков сильны, но DeepSeek советует тестировать модель на конкретных рабочих нагрузках, а не предполагать производственную готовность во всех задачах с изображениями. Ранние пользователи, включая исследовательские группы и разработчиков приложений, используют открытый стек для оценки того, насколько навыки мультимодального агента модели, близкие к уровню Opus, выдержат проверку в их собственных процессах.
