Модель DeepSeek V4 Flash продемонстрировала колоссальный спрос, потребив 8 триллионов токенов всего за один день в инструменте OpenCode. Этот объем превысил среднесуточный показатель платформы OpenRouter, который составляет около 6,6 триллиона токенов. Данный всплеск использования отражает фундаментальный сдвиг в методах работы с ИИ: если раньше задача завершалась простым вопросом и ответом, то теперь агенты выполняют более сложные операции, такие как чтение файлов, изменение кода, запуск программ и повторные попытки после ошибок, что многократно увеличивает потребление токенов.
Пример такого сложного взаимодействия показал пользователь, создавший одностраничный 3D-игровой проект с помощью Claude Opus 5. Этот процесс завершился одним HTML-файлом, который потребовал 690 миллионов токенов и обошелся почти в 3000 юаней.
С появлением задач, выполняемых агентами, критерием оценки моделей сместился от качества отдельного ответа к стоимости выполнения длительной задачи. Например, миллион выходных токенов стоил 2 юаня у DeepSeek, тогда как у Claude Opus 4.8 эта же операция обошлась в 25 долларов США, что эквивалентно примерно 170 юаням, демонстрируя разницу в цене в 85 раз. Хотя в индексе Artificial Analysis Intelligence Index v4.1 модель V4 Flash Max набрала 50 баллов против 56 у Opus Max, стоимость прохождения этого теста составила 72,02 доллара США для V4 Flash против 3752,55 доллара США для Opus, при этом Opus получил 6 дополнительных баллов при примерно 52-кратном увеличении затрат на вызов.
V4 Flash пока не может доказать абсолютное превосходство, однако если обе модели попадут в один список кандидатов, разница в цене в 85 раз может изменить стандартный выбор. Когда модель, опережающая конкурента всего на несколько процентов, стоит в десятки раз дороже, математика выбора перестает работать в пользу более дорогого варианта.
Первыми, кто ощущает влияние этого тренда, являются не самые слабые модели, поскольку небольшие модели остаются подходящими для маршрутизации, а флагманские модели продолжают справляться с самыми сложными задачами. Наиболее уязвимыми оказываются модели среднего уровня — они сильнее V4 Flash, но стоят в десятки раз дороже и недостаточно мощны, чтобы решать те задачи, которые справляется V4 Flash. Именно это и представляет собой «убийственная линия» DeepSeek: модели не обязательно должны быть самыми сильными, им достаточно быть достаточно хорошими для выполнения большинства задач, используя разрыв в цене, составляющий почти два порядка величины, чтобы вытеснить более дорогие варианты из списка по умолчанию.
В контексте ценообразования, Opus стоит 25 долларов США за миллион выходных токенов, Fable 5 — 50 долларов США, а китайские модели включают Qwen 3.8 Max по цене 36 юаней, Kimi K3 — 100 юаней и GLM 5.2 — 28 юаней.
Возможность продавать Мутай по ценам минеральной воды обусловлена прямой стоимостью инференса за токен, которая зависит от активированных параметров, точности, внимания, KV-кэша, длины вывода, использования оборудования и параллелизма. V4 Flash имеет 284 миллиарда общих параметров, но активирует около 13 миллиардов на каждый токен, используя гибридное внимание, веса низкой точности и оптимизацию кэша. При контексте в один миллион токенов вычислительная нагрузка инференса составляет около 10% от V3.2, а размер KV-кэша — около 7%. Серия V4 переработала механизм внимания, внедрив механизмы CSA compress-then-focus и HCA full-browse, а также использует маршрутизацию DeepSeekMoE, направляя каждый токен к небольшой подгруппе экспертов. Коммерческое ценообразование и сервисные издержки следуют за этими техническими особенностями. Таким образом, «убийственная линия» переопределяет границу развития: решающим фактором становится сочетание производительности и цены, где стоимость выполнения задачи является определяющей метрикой.