StepFun выпустила предварительную версию модели Step 5: агент с 600 млрд параметров и открытые веса ожидаются 15 октября
Подробнее
Pandaily
pandaily.com

StepFun выпустила предварительную версию модели Step 5: агент с 600 млрд параметров и открытые веса ожидаются 15 октября

StepFun представила предварительную версию Step 5 20 сентября 2026 года как свою следующую флагманскую базовую модель, предназначенную для работы агентов с длинным горизонтом, согласно информации от Tencent Tech, карточек моделей DataLearner и материалов компании, доступных на stepfun.com. Официальное английское наименование модели — StepFun / Step 5.

Важно отметить, что хотя идентификатор модели step-5-preview уже доступен через API продукта и открытую платформу StepFun, открытые веса в формате BF16 запланированы только на 15 октября 2026 года и не были доступны на момент запуска. Следовательно, доступность через API и открытость весов следует рассматривать как отдельные моменты.

Архитектура модели представляет собой разреженную смесь экспертов (MoE) с общим количеством параметров около 600 миллиардов. При этом примерно 27 миллиардов параметров активируются на каждый токен в рамках 92-слойного Трансформера типа «узкий и глубокий». Выбор глубины обусловлен потребностями агентов, поскольку более длинные пути информации через слои способствуют улучшению многошагового неявного рассуждения и обработки длинных результатов инструментов.

Модель поддерживает контекстное окно в один миллион токенов, принимая как текстовый, так и графический ввод (хотя видеоввод упоминается на сторонних карточках). Она ориентирована на применение в области ИИ-кодирования, разработки программного обеспечения, финансового анализа и использования профессиональных агентов. Для поддержания практичности внимания на миллион токенов, было применено разреженное GQA в сочетании с блочным объединением токенов, что снижает стоимость индексатора и выбора топ-k примерно до одной восьмой.

В процессе обучения особое внимание уделялось выравниванию битового уровня между обучением и выводом для обеспечения стабильности маршрутизации MoE, а также использовались планирование с учетом нагрузки, спекулятивное декодирование и пути FP8. StepFun утверждает, что эти методы ускоряют процесс обучения с подкреплением (RL) с длинным горизонтом в целом более чем в три раза.

Согласно данным, композитный индекс искусственного анализа от Artificial Analysis составляет 44 балла. Компания размещает эту оценку среди ведущих моделей, ориентированных на открытый доступ. На агрегаторных карточках также указаны цены API: около 1,00 доллара за входной токен и 2,70 доллара за выходной токен на миллион токенов, однако следует рассматривать сравнения по показателям и стоимости как заявления третьих сторон или поставщиков.

До даты 15 октября Step 5 Preview следует воспринимать прежде всего как действующий API для агентов с длинным горизонтом, имеющий лишь запланированное обязательство по открытым весам, а не как релиз весов на Hugging Face или как взаимозаменяемый продукт с Meituan LongCat, MiniMax Code Flash или NaiveAI OSS MoE.

Похожие сюжеты

Inspur представила суперузел MetaBrain SD200 Ultra с 128 отечественными чипами для работы с моделью Kimi K3
Подробнее
pandaily.com

Inspur представила суперузел MetaBrain SD200 Ultra с 128 отечественными чипами для работы с моделью Kimi K3

Компания Inspur Information представила суперузел искусственного интеллекта MetaBrain SD200 Ultra на конференции по вычислениям в области искусственного интеллекта AICC2026. Этот узел позиционируется как система класса возможностей для обработки задач с триллионными параметрами и агентами. Официальное английское наименование системы — Inspur / MetaBrain.

Согласно данным компании и информационных агентств, узел объединяет 128 отечественных чипов ИИ, предоставляет доступ к 8 ТБ унифицированной памяти ускорителя и 64 ТБ хостовой памяти. Он способен запускать модель Kimi K3 от Moonshot AI, имеющую 2,8 триллиона параметров, на одной машине с задержкой генерации токена менее 5,85 миллисекунд, что составляет около 170 токенов в секунду для одного пользователя, по оценкам Inspur.

Архитектурные особенности узла включают фабрику 3D Hyper Mesh, обеспечивающую нативную коммуникацию, чувствительную к семантике памяти, с заявленной задержкой в 0,69 микросекунды. Также используются короткодействующие медные интерконнекты и симметричная память, позволяющая ускорителям напрямую обращаться к памяти удаленных узлов. Inspur утверждает, что время выполнения операции AllReduce сократилось примерно в 3,5 раза по сравнению с предыдущими решениями.

Кроме того, встроенные «супероператоры» для стадий KDA, gated MLA и MoE модели Kimi K3 уменьшают количество операторов примерно в десять раз, одновременно повышая производительность инференса более чем втрое. Эти показатели являются заявлениями вендора. Материалы также указывают на потенциал поддержки моделей размером до 10 триллионов параметров на одном узле.

Другой продукт, MetaBrain HC2000, представляет собой стойку с несколькими ускорителями, предназначенную для инференса класса емкости, с заявленной десятикратной пропускной способностью токенов на инвестицию при соблюдении согласованных ограничений SLA. Хотя различные издания описывают ускорители лишь как отечественные или локальные чипы ИИ, ни один из основных источников, проанализированных для данного обзора, не называет производителя кремния или SKU внутри SD200 Ultra. Следовательно, данная статья не приписывает узел Ascend, Cambricon или любому другому конкретному поставщику.

StepFun выпустила предварительную версию Step 5: модель с 600 млрд параметров, разреженным MoE и контекстом в 1 млн токенов
Подробнее
pandaily.com

StepFun выпустила предварительную версию Step 5: модель с 600 млрд параметров, разреженным MoE и контекстом в 1 млн токенов

Компания StepFun представила предварительную версию модели Step 5, которая является базовой моделью с разреженной архитектурой Mixture-of-Experts (MoE) и имеет около 600 миллиардов общих параметров, при этом примерно 27 миллиардов активируются на каждый токен. Этот релиз ориентирован на рабочие нагрузки агентов с длительным горизонтом, включая разработку кода с помощью ИИ, программную инженерию, финансовый анализ и профессиональную работу с знаниями. Модель поддерживает окно контекста в один миллион токенов и принимает как текстовые, так и графические входные данные. StepFun сообщила, что доступ через API уже открыт, а сами веса модели планируется сделать общедоступными 15 октября.

Вместо расширения сети, Step 5 Preview использует узкую, глубокую архитектуру Трансформера, состоящую из 92 слоев. Компания утверждает, что более глубокие стеки обеспечивают более длинные пути передачи информации для неявного многошагового рассуждения во время длительного предварительного заполнения, когда агенты выполняют поиск, запускают код и обрабатывают результаты использования инструментов. Чтобы поддерживать практичность сессий в миллион токенов, модель включает разреженное внимание с группировкой запросов (Sparse Grouped-Query Attention) с объединением токенов по блокам. По словам StepFun, это снижает стоимость выбора индексатора и top-k примерно до одной восьмой по сравнению с более плотной базовой моделью, одновременно объединяя перекрывающиеся соседние выборы.

В процессе обучения акцент сделан на обучении с подкреплением с долгосрочным горизонтом по политике (on-policy long-horizon reinforcement learning), а также на согласовании обучения и инференса на уровне битов в маршрутизации MoE. Кроме того, применяются такие методы, как планирование с учетом нагрузки (load-aware scheduling), спекулятивное декодирование MTP-3, FP8 MoE и выгрузка KV-кэша. StepFun отчитывается о более чем трехкратном ускорении сквозного процесса RL для долгосрочного горизонта и показателе потерь по реестру образцов ниже одного процента. Эта модель также используется внутри конвейера данных, управляемого человеком, который генерирует проверяемые сложные задачи в масштабе миллионов, охватывающие науку, разработку программного обеспечения и исследования в области машинного обучения.

Что касается анализа искусственного интеллекта, Step 5 Preview набирает около 44 баллов по индексу интеллекта, который StepFun относит к числу лучших моделей с открытыми весами в этой рейтинговой системе. Стоимость API, согласно опубликованным ценам, составляет около 1 доллара за миллион входных токенов и 2,7 доллара за миллион выходных токенов, при скорости вывода около 100 токенов в секунду. Основной фокус модели — архитектура и эффективность агента, что отличает ее от предыдущих выпусков Step 3.5 Flash и Step 3.7 Flash, делая акцент на глубине, разреженном длинном контексте и надежном многоэтапном использовании инструментов перед тем, как веса станут доступны в октябре.

Shanghai AI Lab выпустила предварительную версию модели Atria Dawn, основанной на архитектуре MoE с 744 миллиардами параметров
Подробнее
pandaily.com

Shanghai AI Lab выпустила предварительную версию модели Atria Dawn, основанной на архитектуре MoE с 744 миллиардами параметров

Shanghai Artificial Intelligence Laboratory представила Atria Dawn Preview — агентскую языковую модель, разработанную для поддержки сложных исследовательских и инженерных процессов, а не только для демонстрационных чатов. Эта предварительная версия базируется на фундаменте Mixture-of-Experts (MoE) с 744 миллиардами параметров, который идентифицирован как GLM-5.2.

Модель обладает окном контекста размером 256K и распространяется под лицензией MIT. Чекпоинты, как стандартные инструкционные, так и квантованные в формате FP8-instruct, доступны на платформах Hugging Face и ModelScope. Кроме того, предоставляется доступ к API для пользователей в международных и китайских регионах.

Согласно документации модели и сопроводительной статье на arXiv, система обучалась с использованием Конвейера Проверяемого Опыта (Verifiable Experience Pipeline). Этот конвейер связывает рассуждения, опосредованные инструментами, с исполняемыми средами и внешне проверяемыми результатами. Основная концепция заключается в полном цикле выполнения: анализ проблемы, проектирование решения, вызов инструментов, выполнение кода и экспериментов, проверка результатов и восстановление после сбоев в рамках непрерывной обратной связи от среды, а не просто получение единичного ответа.

Лаборатория сгруппировала возможности модели для сценариев, охватывающих открытие, создание, доставку и кибербезопасность. Эти сценарии включают глубокие исследования, разработку программного обеспечения, подготовку структурированных офисных материалов и авторизованную проверку безопасности.

При оценке по 16 бенчмаркам, представленным лабораторией, Atria Dawn Preview продемонстрировала наивысший показатель по пяти задачам. Среди них — AutomationBench с результатом 53.8, BrowseComp с 92.5, DeepSearchQA с 96.0, BFCL v4 с 77.0 и CyberGym с 86.5. Остальные показатели остаются конкурентоспособными, но не являются доминирующими по сравнению с передовыми базовыми моделями агентов.

Этот релиз отличается от предыдущих разработок Shanghai AI Lab, таких как Intern W0 и связанные работы NCP. Dawn позиционируется как открытый агентский партнер для многоэтапных научных и инженерных проектов, и вместе с выпуском весов были предоставлены публичные активы на GitHub и специальный сайт проекта Atria.

Разработчики могут загрузить веса для локального использования через такие фреймворки, как SGLang и vLLM, либо использовать региональные консоли API. Клиенты в стиле Codex могут взаимодействовать с Responses API, используя настройки только текстового режима. Тем не менее, командам рекомендуется самостоятельно воспроизводить результаты AutomationBench и цепочки инструментов для долгосрочных задач, а также проверять условия лицензирования и развертывания. Важно воспринимать метку «preview» серьезно, поскольку надежность агента вне опубликованных наборов данных остается открытым вопросом, пока лаборатории продвигаются от помощников по задачам к совместной работе над проектами.

Популярное