Компания StepFun представила предварительную версию модели Step 5, которая является базовой моделью с разреженной архитектурой Mixture-of-Experts (MoE) и имеет около 600 миллиардов общих параметров, при этом примерно 27 миллиардов активируются на каждый токен. Этот релиз ориентирован на рабочие нагрузки агентов с длительным горизонтом, включая разработку кода с помощью ИИ, программную инженерию, финансовый анализ и профессиональную работу с знаниями. Модель поддерживает окно контекста в один миллион токенов и принимает как текстовые, так и графические входные данные. StepFun сообщила, что доступ через API уже открыт, а сами веса модели планируется сделать общедоступными 15 октября.
Вместо расширения сети, Step 5 Preview использует узкую, глубокую архитектуру Трансформера, состоящую из 92 слоев. Компания утверждает, что более глубокие стеки обеспечивают более длинные пути передачи информации для неявного многошагового рассуждения во время длительного предварительного заполнения, когда агенты выполняют поиск, запускают код и обрабатывают результаты использования инструментов. Чтобы поддерживать практичность сессий в миллион токенов, модель включает разреженное внимание с группировкой запросов (Sparse Grouped-Query Attention) с объединением токенов по блокам. По словам StepFun, это снижает стоимость выбора индексатора и top-k примерно до одной восьмой по сравнению с более плотной базовой моделью, одновременно объединяя перекрывающиеся соседние выборы.
В процессе обучения акцент сделан на обучении с подкреплением с долгосрочным горизонтом по политике (on-policy long-horizon reinforcement learning), а также на согласовании обучения и инференса на уровне битов в маршрутизации MoE. Кроме того, применяются такие методы, как планирование с учетом нагрузки (load-aware scheduling), спекулятивное декодирование MTP-3, FP8 MoE и выгрузка KV-кэша. StepFun отчитывается о более чем трехкратном ускорении сквозного процесса RL для долгосрочного горизонта и показателе потерь по реестру образцов ниже одного процента. Эта модель также используется внутри конвейера данных, управляемого человеком, который генерирует проверяемые сложные задачи в масштабе миллионов, охватывающие науку, разработку программного обеспечения и исследования в области машинного обучения.
Что касается анализа искусственного интеллекта, Step 5 Preview набирает около 44 баллов по индексу интеллекта, который StepFun относит к числу лучших моделей с открытыми весами в этой рейтинговой системе. Стоимость API, согласно опубликованным ценам, составляет около 1 доллара за миллион входных токенов и 2,7 доллара за миллион выходных токенов, при скорости вывода около 100 токенов в секунду. Основной фокус модели — архитектура и эффективность агента, что отличает ее от предыдущих выпусков Step 3.5 Flash и Step 3.7 Flash, делая акцент на глубине, разреженном длинном контексте и надежном многоэтапном использовании инструментов перед тем, как веса станут доступны в октябре.



