OpenBMB выпустила MiniCPM5-2B как открытую модель SOTA для работы на устройстве весом менее 4 млрд параметров
Подробнее
Pandaily
pandaily.com

OpenBMB выпустила MiniCPM5-2B как открытую модель SOTA для работы на устройстве весом менее 4 млрд параметров

OpenBMB, открытый проект, связанный с ModelBest, представил MiniCPM5-2B — плотную языковую модель для работы непосредственно на устройстве. Эта модель имеет приблизительно 2,52 миллиарда параметров и поддерживает нативную контекстную длину в 131 072 токена, распространяясь под лицензией Apache-2.0.

MiniCPM5-2B является вторым релизом серии MiniCPM5 после MiniCPM5-1B. Он использует стандартную компоновку LlamaForCausalLM, которая включает 42 слоя с групповым вниманием (grouped-query attention), использующим 16 голов запросов и 2 головы ключа/значения. Благодаря этому, основные движки могут загружать модель без необходимости в кастомных ядрах или форках кода модели.

Параметры, не являющиеся эмбеддингами, составляют около 1,98 миллиарда, что позволяет разместить модель в классе менее 4 миллиардов параметров, подходящем для хостинга на телефонах, ноутбуках и периферийных устройствах.

При сравнении на наборе данных 34-бенчмарк OpenBMB, MiniCPM5-2B демонстрирует средний показатель 53,9, опережая ряд более крупных открытых базовых моделей. Среди них Qwen3.5-4B показал 51,1, а granite-4.2-3B — 42,7. При этом аналогичные по размеру модели, такие как LFM2.5-2.6B и Qwen3.5-2B, отстают.

Сильные стороны модели сосредоточены в областях кодирующих агентов, использования инструментов и извлечения информации из длинного контекста. Например, на LiveCodeBench v6 MiniCPM5-2B показал 69,1 против 56,4 у Qwen3.5-4B, а на SWE-bench Verified — 46,4 против 33,6. Также высокие результаты достигнуты на τ²-Bench Telecom (97,1), BFCL v4 (66,6) и NoLiMa (68,1 против 43,5).

В задачах, требующих глубоких знаний, показатели остаются ближе к верхней границе размера; например, на MMLU-Pro модель показала 70,8, в то время как эталонная модель Qwen размером 4B набрала 78,0. OpenBMB отдельно отмечает строки, полученные из источников Artificial Analysis, чтобы пользователи могли различать данные от вендоров и сторонние результаты.

Послетренировочный процесс следовал управлению уровня UltraData: сначала проводилось тонкое дообучение с учителем (supervised fine-tuning) на основе глубокого мышления с использованием примерно 400 миллиардов токенов. Затем применялись специализированные учителя обучения с подкреплением (reinforcement-learning teachers) для математики, кода, агентов и письма с помощью алгоритма JustRL II, основанного на критике. Завершающим этапом стала дистилляция по политике (on-policy distillation), которая объединила 16 экспертов RL — пятеро из которых были агентными — в одну конечную модель-студента.

OpenBMB связывает средний прирост около 10,96 баллов в задачах рассуждения и общих наборах, а также 6,96 баллов в агентных наборах, с этапом RL и дистилляции. Для возможности прямого измерения вклада каждой части, компания выпускает промежуточные контрольные точки: Base, Midtrain и SFT-only.

Вместе с весами, корпорации UltraData публикуют корпуса данных, охватывающие веб, код, математику, образцы SFT и RL для агентов, что позволяет проводить воспроизведение результатов. Поддержка времени выполнения включает vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT и многочиповые сборки FlagOS. Предоставляются пакеты GGUF, MLX и GPTQ, предназначенные для локальных помощников, которым необходимо выполнять вызовы инструментов и работать с длинным контекстом без использования графического процессора дата-центра.

Для разработчиков, ориентированных на работу на устройстве, MiniCPM5-2B позиционируется не столько как гигант общего знания, сколько как компактный агент с лицензией Apache и компаньон для кодирования, который уже превосходит некоторые открытые базовые модели класса 4B по опубликованному среднему показателю.

Популярное