С 17 августа DeepSeek начал применять новое ценообразование для своего API. Флагманские модели DeepSeek-V4-Flash и DeepSeek-V4-Pro впервые используют дифференцированные тарифы, основанные на пиковых и непиковых часах, при этом ставки в непиковое время установлены на половину от пиковых.
Новая структура тарифов предусматривает следующие цены для DeepSeek-V4-Flash: 0.1 юаня за миллион токенов при вводе с попаданием в кэш, 3 юаня при вводе без попадания в кэш и 9 юаней за вывод. В непиковое время эти цены снижаются до 0.05, 1.5 и 4.5 юаней соответственно. Более продвинутая модель DeepSeek-V4-Pro стоит 0.3, 9 и 27 юаней в часы пик, а в непиковое время ее стоимость падает до 0.15, 4.5 и 13.5 юаней.
Часами пиковой нагрузки являются период с 9:00 до 12:00 и с 14:00 до 18:00 по времени Пекина ежедневно, что составляет семь часов. Остальные семнадцать часов считаются непиковыми. Задачи, которые могут позволить себе более медленный отклик, такие как пакетная обработка данных, генерация кода и оценка моделей, рекомендуется переносить на непиковые часы для экономии средств.
По сравнению с предыдущим ценообразованием, изменения не ограничиваются простым удвоением. Для V4-Pro старые цены на вход с попаданием в кэш, вход без попадания в кэш и вывод составляли 0.025, 3 и 6 юаней; теперь пиковые цены выросли на 1100%, 200% и 350% соответственно, а непиковые — на 500%, 50% и 125%. Модель V4-Flash также продемонстрировала заметный рост: прежние цены были 0.02, 1 и 2 юаня, а пиковые показывают прирост в 400%, 200% и 350%, при увеличении в непиковое время на 150%, 50% и 125%. Таким образом, общий рост варьируется от 50% до 1100% в зависимости от комбинации модели, типа токена и времени вызова.
DeepSeek объявила о новых ценах 13 августа, в тот же день, когда выпустила официальную DeepSeek-V4-Pro. Эта модель, получившая идентификатор DeepSeek-V4-Pro-0813, поддерживает режимы работы с рассуждениями и без них, имеет контекстное окно в 1 миллион токенов и может генерировать до 384 000 токенов вывода, а также нативно поддерживает вызов инструментов, Responses API и Anthropic API. Лимиты одновременных запросов составляют 500 для V4-Pro и 2 500 для V4-Flash.
Этот шаг знаменует переход больших языковых API от унифицированного ценообразования к детализированному планированию вычислительных ресурсов. Вычисления моделей постоянно потребляют ресурсы ИИ: запросы концентрируются в рабочее время, тогда как использование в непиковое время снижается. Используя ценовой рычаг для стимулирования распределенного использования, DeepSeek может повысить загрузку своих интеллектуальных вычислительных кластеров и снизить нагрузку в часы пик. Для разработчиков планирование задач теперь напрямую влияет на счета за токены: разговор в реальном времени и онлайн-агенты вряд ли смогут избежать пиковых цен, в то время как офлайн-анализ, пакетный перевод, очистка данных и ночная оценка имеют больше возможностей для переноса.

