Команда NCP из Шанхайской лаборатории искусственного интеллекта (Shanghai Artificial Intelligence Laboratory) совместно с LUMIA Lab из Шанхайского университета Цзяотун (Shanghai Jiao Tong University) выпустила NCP-ArchPreview — открытую языковую модель с латентным пространством, содержащую около 8,9 миллиардов параметров.
Эта модель обучается одновременно стандартному прогнозированию следующего токена и прогнозированию следующих концепций (Next Concept Prediction). Технический отчет доступен на arXiv под номером 2609.10715, а контрольные точки для Hugging Face находятся в коллекции ArchSpace-Collection. Также опубликованы пути кода для оценки и инференса, включая ссылки через инструментарий InternLM и репозиторий оценки LUMIA.
Проект представляет собой крупнейшую на сегодняшний день демонстрацию языковой модели с латентным пространством, обученной в масштабе, превышающем триллионы токенов.
Вместо того чтобы предсказывать только следующий токен, NCP-ArchPreview способен прогнозировать дискретные концепции, которые охватывают несколько токенов. Для этого была создана продуктивно квантованная словарная база концепций, основанная на скрытых состояниях самой модели. Специализированный Модуль Концепций предсказывает будущие концепции, и эти прогнозы используются для направления генерации на уровне токенов.
Кодировщик, Модуль Концепций и декодер используют архитектуру причинного Трансформера с размером скрытого слоя 4096 и соотношением 16/8/16. Концепции сжимают состояние четырех токенов каждая, причем продуктивная квантизация применяется к 32 словарям с 128 кодовыми словами. Генерация сохраняет привычный интерфейс прогнозирования следующего токена в архитектуре типа NCPOlmo3ForCausalLM, что позволяет оценивать и использовать модель как обычную авторегрессионную контрольную точку, в то время как латентная цель выполняется во время предварительного обучения.
Для обучения использовалось около 5,73 триллиона токенов из семейства Dolma-3 в рамках учебных планов Этапа 1 и Этапа 2. Основное заявленное преимущество эффективности заключается в том, что NCP-ArchPreview достигает конечной потери предварительного обучения, сравнимой с OLMo-3-7B, используя лишь приблизительно 51,3% от общего объема обучающих токенов.
После полного предварительного обучения модель опережает базовую модель 7B на 2,45 пункта по среднему макро-показателю на последующих задачах, включая прирост в 5,99 пункта на бенчмарке GSM8K. Анализ контролируемых абляций показал, что этот прирост обусловлен как латентной архитектурой, так и целевой функцией следующей концепции. При сопоставимом размере параметров модель приближается к потере обучения базовой модели следующего токена 8,9B, используя при этом около 85% стандартного вычислительного бюджета.
Даже после завершения предварительного обучения латентное пространство остается пригодным для использования. Обновление модуля квантования векторов, содержащего примерно 17 миллионов параметров, предоставляет легкий интерфейс для адаптации к предметной области. Кроме того, внедрение представлений концепций в драфтер DFlash2 улучшило среднюю принятую длину примерно на 4,17% при незначительных накладных расходах в описанной конфигурации. Базовые контрольные точки Этапа 1 и нескольких Этапов 2 доступны для завершения, оценки и дальнейшей адаптации. Для исследователей, следящих за эффективностью предварительного обучения, NCP-ArchPreview является скорее открытым рецептом для сочетания целей на уровне концепций и на уровне токенов в масштабе почти 9B с общедоступными весами и кодом, нежели просто релизом чат-продукта.

