Shanghai AI Lab и SJTU представили открытую модель NCP-ArchPreview с латентным пространством
Подробнее
Pandaily
pandaily.com

Shanghai AI Lab и SJTU представили открытую модель NCP-ArchPreview с латентным пространством

Команда NCP из Шанхайской лаборатории искусственного интеллекта (Shanghai Artificial Intelligence Laboratory) совместно с LUMIA Lab из Шанхайского университета Цзяотун (Shanghai Jiao Tong University) выпустила NCP-ArchPreview — открытую языковую модель с латентным пространством, содержащую около 8,9 миллиардов параметров.

Эта модель обучается одновременно стандартному прогнозированию следующего токена и прогнозированию следующих концепций (Next Concept Prediction). Технический отчет доступен на arXiv под номером 2609.10715, а контрольные точки для Hugging Face находятся в коллекции ArchSpace-Collection. Также опубликованы пути кода для оценки и инференса, включая ссылки через инструментарий InternLM и репозиторий оценки LUMIA.

Проект представляет собой крупнейшую на сегодняшний день демонстрацию языковой модели с латентным пространством, обученной в масштабе, превышающем триллионы токенов.

Вместо того чтобы предсказывать только следующий токен, NCP-ArchPreview способен прогнозировать дискретные концепции, которые охватывают несколько токенов. Для этого была создана продуктивно квантованная словарная база концепций, основанная на скрытых состояниях самой модели. Специализированный Модуль Концепций предсказывает будущие концепции, и эти прогнозы используются для направления генерации на уровне токенов.

Кодировщик, Модуль Концепций и декодер используют архитектуру причинного Трансформера с размером скрытого слоя 4096 и соотношением 16/8/16. Концепции сжимают состояние четырех токенов каждая, причем продуктивная квантизация применяется к 32 словарям с 128 кодовыми словами. Генерация сохраняет привычный интерфейс прогнозирования следующего токена в архитектуре типа NCPOlmo3ForCausalLM, что позволяет оценивать и использовать модель как обычную авторегрессионную контрольную точку, в то время как латентная цель выполняется во время предварительного обучения.

Для обучения использовалось около 5,73 триллиона токенов из семейства Dolma-3 в рамках учебных планов Этапа 1 и Этапа 2. Основное заявленное преимущество эффективности заключается в том, что NCP-ArchPreview достигает конечной потери предварительного обучения, сравнимой с OLMo-3-7B, используя лишь приблизительно 51,3% от общего объема обучающих токенов.

После полного предварительного обучения модель опережает базовую модель 7B на 2,45 пункта по среднему макро-показателю на последующих задачах, включая прирост в 5,99 пункта на бенчмарке GSM8K. Анализ контролируемых абляций показал, что этот прирост обусловлен как латентной архитектурой, так и целевой функцией следующей концепции. При сопоставимом размере параметров модель приближается к потере обучения базовой модели следующего токена 8,9B, используя при этом около 85% стандартного вычислительного бюджета.

Даже после завершения предварительного обучения латентное пространство остается пригодным для использования. Обновление модуля квантования векторов, содержащего примерно 17 миллионов параметров, предоставляет легкий интерфейс для адаптации к предметной области. Кроме того, внедрение представлений концепций в драфтер DFlash2 улучшило среднюю принятую длину примерно на 4,17% при незначительных накладных расходах в описанной конфигурации. Базовые контрольные точки Этапа 1 и нескольких Этапов 2 доступны для завершения, оценки и дальнейшей адаптации. Для исследователей, следящих за эффективностью предварительного обучения, NCP-ArchPreview является скорее открытым рецептом для сочетания целей на уровне концепций и на уровне токенов в масштабе почти 9B с общедоступными весами и кодом, нежели просто релизом чат-продукта.

Похожие сюжеты

Локальная модель StartLux с 27 млрд параметров превзошла DeepSeek V4 Flash в китайском AI-бенчмарке
Подробнее
pandaily.com

Локальная модель StartLux с 27 млрд параметров превзошла DeepSeek V4 Flash в китайском AI-бенчмарке

Согласно отчету, подготовленному Китайской академией информационных и коммуникационных технологий (CAICT), на карте локальных моделей появился новый игрок. Компания StartLux, базирующаяся в Шанхае и разработавшая модель StartLux-V1.0-27B-Preview, заняла второе место в общем зачете специального теста MCP в рамках линейки проверенных AI-бенчмарков, опередив DeepSeek-V4-Flash, используя всего 27 миллиардов параметров.

Тест MCP оценивает шесть специализированных задач: навигацию по местоположению, поиск в интернете, автоматизацию браузера, финансовый анализ, управление репозиториями кода и 3D-дизайн, а также включает комплексную оценку, фокусирующуюся на координации нескольких инструментов, выполнении сложных задач и взаимодействии в реальных условиях. Среди протестированных моделей были DeepSeek-V4-Pro (1,6 триллиона параметров), DeepSeek-V4-Flash-0731 (284 миллиарда), Step-3.7-Flash (198 миллиардов), StartLux-27B-260715 (27 миллиардов), Qwen-3.6-27B (27 миллиардов) и AgentCPM-Explore (4 миллиарда).

Модель StartLux-V1.0-27B-Preview получила балл 39.25, что обеспечило ей второе место, обойдя как DeepSeek-V4-Flash с 284 миллиардами параметров, так и Step-3.7-Flash с 198 миллиардами. При одинаковом размере параметров она опередила Qwen-3.6-27B на 5.34 пункта. Модель заняла первое место в навигации по местоположению, а также показала первое место или сравнялась с ним в автоматизации браузера и финансовом анализе, в некоторых случаях достигая уровня триллионной модели DeepSeek-V4-Pro.

Данная модель построена на основе Qwen3.6-27B с дополнительным улучшением после обучения. StartLux внедрила подход, который они назвали «AI обучает AI» (Автоматический поиск), позволяющий автономно проводить экспериментальные тренировки и совершенствовать стратегию посредством обратной связи. Компания утверждает, что это первое применение данного метода для локальной агентной модели в Китае.

Этот результат отражает более широкий сдвиг в индустрии. Поскольку производительность передовых моделей достигла практических пороговых значений, эра гонки параметров трансформировалась в фазу гомогенизации; приоритеты пользователей все чаще смещаются в сторону решения реальных проблем, обеспечения безопасности данных и контроля затрат, а не только достижения высоких показателей в бенчмарках. Мировые игроки движутся в том же направлении: Google's Gemma 4, Meta's open Muse Glimmer и Nvidia's Nemotron 3.5 Lightning нацелены на локальное развертывание.

StartLux-V1.0-27B-Preview может работать на потребительских ПК, и компания планирует выпустить свое первое поколение решений локального интеллекта в текущем году. Результаты CAICT сигнализируют предприятиям о том, что компактные, локально развертываемые модели теперь способны конкурировать с гораздо более крупными облачными решениями в задачах, имеющих значение в реальных рабочих процессах, что начинает менять решения о закупках.

Популярное