StepFun выпустила предварительную версию Step 5: модель с 600 млрд параметров, разреженным MoE и контекстом в 1 млн токенов
Подробнее
Pandaily
pandaily.com

StepFun выпустила предварительную версию Step 5: модель с 600 млрд параметров, разреженным MoE и контекстом в 1 млн токенов

Компания StepFun представила предварительную версию модели Step 5, которая является базовой моделью с разреженной архитектурой Mixture-of-Experts (MoE) и имеет около 600 миллиардов общих параметров, при этом примерно 27 миллиардов активируются на каждый токен. Этот релиз ориентирован на рабочие нагрузки агентов с длительным горизонтом, включая разработку кода с помощью ИИ, программную инженерию, финансовый анализ и профессиональную работу с знаниями. Модель поддерживает окно контекста в один миллион токенов и принимает как текстовые, так и графические входные данные. StepFun сообщила, что доступ через API уже открыт, а сами веса модели планируется сделать общедоступными 15 октября.

Вместо расширения сети, Step 5 Preview использует узкую, глубокую архитектуру Трансформера, состоящую из 92 слоев. Компания утверждает, что более глубокие стеки обеспечивают более длинные пути передачи информации для неявного многошагового рассуждения во время длительного предварительного заполнения, когда агенты выполняют поиск, запускают код и обрабатывают результаты использования инструментов. Чтобы поддерживать практичность сессий в миллион токенов, модель включает разреженное внимание с группировкой запросов (Sparse Grouped-Query Attention) с объединением токенов по блокам. По словам StepFun, это снижает стоимость выбора индексатора и top-k примерно до одной восьмой по сравнению с более плотной базовой моделью, одновременно объединяя перекрывающиеся соседние выборы.

В процессе обучения акцент сделан на обучении с подкреплением с долгосрочным горизонтом по политике (on-policy long-horizon reinforcement learning), а также на согласовании обучения и инференса на уровне битов в маршрутизации MoE. Кроме того, применяются такие методы, как планирование с учетом нагрузки (load-aware scheduling), спекулятивное декодирование MTP-3, FP8 MoE и выгрузка KV-кэша. StepFun отчитывается о более чем трехкратном ускорении сквозного процесса RL для долгосрочного горизонта и показателе потерь по реестру образцов ниже одного процента. Эта модель также используется внутри конвейера данных, управляемого человеком, который генерирует проверяемые сложные задачи в масштабе миллионов, охватывающие науку, разработку программного обеспечения и исследования в области машинного обучения.

Что касается анализа искусственного интеллекта, Step 5 Preview набирает около 44 баллов по индексу интеллекта, который StepFun относит к числу лучших моделей с открытыми весами в этой рейтинговой системе. Стоимость API, согласно опубликованным ценам, составляет около 1 доллара за миллион входных токенов и 2,7 доллара за миллион выходных токенов, при скорости вывода около 100 токенов в секунду. Основной фокус модели — архитектура и эффективность агента, что отличает ее от предыдущих выпусков Step 3.5 Flash и Step 3.7 Flash, делая акцент на глубине, разреженном длинном контексте и надежном многоэтапном использовании инструментов перед тем, как веса станут доступны в октябре.

Похожие сюжеты

Shanghai AI Lab выпустила предварительную версию модели Atria Dawn, основанной на архитектуре MoE с 744 миллиардами параметров
Подробнее
pandaily.com

Shanghai AI Lab выпустила предварительную версию модели Atria Dawn, основанной на архитектуре MoE с 744 миллиардами параметров

Shanghai Artificial Intelligence Laboratory представила Atria Dawn Preview — агентскую языковую модель, разработанную для поддержки сложных исследовательских и инженерных процессов, а не только для демонстрационных чатов. Эта предварительная версия базируется на фундаменте Mixture-of-Experts (MoE) с 744 миллиардами параметров, который идентифицирован как GLM-5.2.

Модель обладает окном контекста размером 256K и распространяется под лицензией MIT. Чекпоинты, как стандартные инструкционные, так и квантованные в формате FP8-instruct, доступны на платформах Hugging Face и ModelScope. Кроме того, предоставляется доступ к API для пользователей в международных и китайских регионах.

Согласно документации модели и сопроводительной статье на arXiv, система обучалась с использованием Конвейера Проверяемого Опыта (Verifiable Experience Pipeline). Этот конвейер связывает рассуждения, опосредованные инструментами, с исполняемыми средами и внешне проверяемыми результатами. Основная концепция заключается в полном цикле выполнения: анализ проблемы, проектирование решения, вызов инструментов, выполнение кода и экспериментов, проверка результатов и восстановление после сбоев в рамках непрерывной обратной связи от среды, а не просто получение единичного ответа.

Лаборатория сгруппировала возможности модели для сценариев, охватывающих открытие, создание, доставку и кибербезопасность. Эти сценарии включают глубокие исследования, разработку программного обеспечения, подготовку структурированных офисных материалов и авторизованную проверку безопасности.

При оценке по 16 бенчмаркам, представленным лабораторией, Atria Dawn Preview продемонстрировала наивысший показатель по пяти задачам. Среди них — AutomationBench с результатом 53.8, BrowseComp с 92.5, DeepSearchQA с 96.0, BFCL v4 с 77.0 и CyberGym с 86.5. Остальные показатели остаются конкурентоспособными, но не являются доминирующими по сравнению с передовыми базовыми моделями агентов.

Этот релиз отличается от предыдущих разработок Shanghai AI Lab, таких как Intern W0 и связанные работы NCP. Dawn позиционируется как открытый агентский партнер для многоэтапных научных и инженерных проектов, и вместе с выпуском весов были предоставлены публичные активы на GitHub и специальный сайт проекта Atria.

Разработчики могут загрузить веса для локального использования через такие фреймворки, как SGLang и vLLM, либо использовать региональные консоли API. Клиенты в стиле Codex могут взаимодействовать с Responses API, используя настройки только текстового режима. Тем не менее, командам рекомендуется самостоятельно воспроизводить результаты AutomationBench и цепочки инструментов для долгосрочных задач, а также проверять условия лицензирования и развертывания. Важно воспринимать метку «preview» серьезно, поскольку надежность агента вне опубликованных наборов данных остается открытым вопросом, пока лаборатории продвигаются от помощников по задачам к совместной работе над проектами.

OpenBMB выпустила MiniCPM5-2B как открытую модель SOTA для работы на устройстве весом менее 4 млрд параметров
Подробнее
pandaily.com

OpenBMB выпустила MiniCPM5-2B как открытую модель SOTA для работы на устройстве весом менее 4 млрд параметров

OpenBMB, открытый проект, связанный с ModelBest, представил MiniCPM5-2B — плотную языковую модель для работы непосредственно на устройстве. Эта модель имеет приблизительно 2,52 миллиарда параметров и поддерживает нативную контекстную длину в 131 072 токена, распространяясь под лицензией Apache-2.0.

MiniCPM5-2B является вторым релизом серии MiniCPM5 после MiniCPM5-1B. Он использует стандартную компоновку LlamaForCausalLM, которая включает 42 слоя с групповым вниманием (grouped-query attention), использующим 16 голов запросов и 2 головы ключа/значения. Благодаря этому, основные движки могут загружать модель без необходимости в кастомных ядрах или форках кода модели.

Параметры, не являющиеся эмбеддингами, составляют около 1,98 миллиарда, что позволяет разместить модель в классе менее 4 миллиардов параметров, подходящем для хостинга на телефонах, ноутбуках и периферийных устройствах.

При сравнении на наборе данных 34-бенчмарк OpenBMB, MiniCPM5-2B демонстрирует средний показатель 53,9, опережая ряд более крупных открытых базовых моделей. Среди них Qwen3.5-4B показал 51,1, а granite-4.2-3B — 42,7. При этом аналогичные по размеру модели, такие как LFM2.5-2.6B и Qwen3.5-2B, отстают.

Сильные стороны модели сосредоточены в областях кодирующих агентов, использования инструментов и извлечения информации из длинного контекста. Например, на LiveCodeBench v6 MiniCPM5-2B показал 69,1 против 56,4 у Qwen3.5-4B, а на SWE-bench Verified — 46,4 против 33,6. Также высокие результаты достигнуты на τ²-Bench Telecom (97,1), BFCL v4 (66,6) и NoLiMa (68,1 против 43,5).

В задачах, требующих глубоких знаний, показатели остаются ближе к верхней границе размера; например, на MMLU-Pro модель показала 70,8, в то время как эталонная модель Qwen размером 4B набрала 78,0. OpenBMB отдельно отмечает строки, полученные из источников Artificial Analysis, чтобы пользователи могли различать данные от вендоров и сторонние результаты.

Послетренировочный процесс следовал управлению уровня UltraData: сначала проводилось тонкое дообучение с учителем (supervised fine-tuning) на основе глубокого мышления с использованием примерно 400 миллиардов токенов. Затем применялись специализированные учителя обучения с подкреплением (reinforcement-learning teachers) для математики, кода, агентов и письма с помощью алгоритма JustRL II, основанного на критике. Завершающим этапом стала дистилляция по политике (on-policy distillation), которая объединила 16 экспертов RL — пятеро из которых были агентными — в одну конечную модель-студента.

OpenBMB связывает средний прирост около 10,96 баллов в задачах рассуждения и общих наборах, а также 6,96 баллов в агентных наборах, с этапом RL и дистилляции. Для возможности прямого измерения вклада каждой части, компания выпускает промежуточные контрольные точки: Base, Midtrain и SFT-only.

Вместе с весами, корпорации UltraData публикуют корпуса данных, охватывающие веб, код, математику, образцы SFT и RL для агентов, что позволяет проводить воспроизведение результатов. Поддержка времени выполнения включает vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT и многочиповые сборки FlagOS. Предоставляются пакеты GGUF, MLX и GPTQ, предназначенные для локальных помощников, которым необходимо выполнять вызовы инструментов и работать с длинным контекстом без использования графического процессора дата-центра.

Для разработчиков, ориентированных на работу на устройстве, MiniCPM5-2B позиционируется не столько как гигант общего знания, сколько как компактный агент с лицензией Apache и компаньон для кодирования, который уже превосходит некоторые открытые базовые модели класса 4B по опубликованному среднему показателю.

Компания HUMAIN представила модель HUMAIN-M3 на базе MiniMax M3 в рамках гонки за открытые ИИ-платформы
Подробнее
pandaily.com

Компания HUMAIN представила модель HUMAIN-M3 на базе MiniMax M3 в рамках гонки за открытые ИИ-платформы

На мероприятии LEAP 2026, состоявшемся 3 сентября, компания HUMAIN, поддерживаемая Фондом по будущему Саудовской Аравии (PIF), представила модель HUMAIN-M3. Эта модель ориентирована на арабский язык и сейчас доступна в предварительном просмотре на платформе HUMAIN Node, при этом планируется выпуск ее с открытыми весами позднее.

Фундаментом для HUMAIN-M3 послужила открытая многоэкспертная (mixture-of-experts) структура M3 от китайского стартапа MiniMax, которая была выпущена примерно за три месяца до этого. Модель HUMAIN-M3 сохраняет архитектурные особенности M3, обладая общим количеством параметров около 428 миллиардов, при этом приблизительно 23 миллиарда параметров активны на каждый токен. Далее модель проходит дополнительное обучение на более чем триллионе нативных арабских токенов.

Согласно семи публичным арабским бенчмаркам, опубликованным HUMAIN, данная модель достигла пяти первых мест и среднего взвешенного показателя в 89,37%. Этот результат на 9,03 пункта выше, чем у базовой модели M3, и превосходит заявленные результаты GPT-5.6 SOL и Claude Opus 5. Основной акцент делается на скорости: используется общее рассуждение, мультимодальность, агенты и длинный контекст из открытой базовой модели, после чего происходит локальная специализация языка и культуры.

Этот подход соответствует более широкой глобальной гонке за суверенный искусственный интеллект. Согласно данным CNAS, отслеживаемым в китайских публикациях, к середине 2026 года было зарегистрировано 184 государственных проектов суверенного ИИ в 67 странах, причем в первой половине года было добавлено 41 проект. Количество открытых баз для локального продолженного обучения более чем удвоилось с конца 2024 года. Покупатели уделяют внимание смешению диалектов, хранению данных на собственных серверах и риску исчезновения удаленного API после шока экспортного контроля, что благоприятствует загружаемым весам и локальному пост-тренингу.

Международная деятельность MiniMax также следует этой тенденции. Компания заявляет, что ее продукты уже доступны более чем в 230 странах и регионах. В Европе MiniMax сотрудничает с SambaNova для высокоскоростного инференса на оборудовании SN50, а также с Nebius Token Factory в качестве специализированного размещенного открытого решения. HUMAIN продвигает эту концепцию дальше: от простого скачивания и API к национальной программе моделей, которая инвестирует собственные языковые данные и вычислительные мощности поверх китайского контрольного образца.

Для лабораторий, занимающихся открытыми моделями в Китае, клиентом перестали быть только разработчики, участвующие в рейтингах. Государства теперь требуют стартовый контрольный образец, которым они могут владеть, обновлять и запускать самостоятельно. Интеграция MiniMax M3 в HUMAIN-M3 является ранним и конкретным примером, сигнализирующим о том, что открытая доставка весов, адаптация оборудования и долгосрочная поддержка могут иметь такое же значение, как и следующий показатель в бенчмарках. Гонка вне дуополии США и Китая все больше сводится к тому, кто предоставляет повторно используемую базу, а не кто выигрывает каждый тест на английском языке.

Популярное