Stable AI, в сотрудничестве с группой профессора Университета Цинхуа Пэн Цюя, выпустила LimiX-2 — фундаментальную модель с 400 миллионами параметров, предназначенную для работы со структурированными и табличными данными. Веса и код для инференса доступны на Hugging Face по адресу stable-ai/LimiX-2, а технический отчет размещен на arXiv под номером 2609.17488.
Одна из проверенных моделей способна выполнять классификацию, регрессию и заполнение пропущенных значений за один проход вперед, не требуя тонкой настройки под конкретную задачу.
Архитектурно LimiX-2 использует Контекстные Сетевые Механизмы (Contextual Mechanism Networks, CMNs), которые были предварительно обучены с помощью Контекстно-Условного Маскированного Моделирования. Вместо того чтобы фокусироваться на традиционной целевой функции, настроенной на табличные данные и предсказывающей заданную цель на основе контекста, CMNs обучаются обнаруживать совместную структуру зависимостей между признаками и метками, что ближе к выявлению того, как переменные совместно генерируют данные, нежели к настройке одной колонки за раз.
Предварительное обучение проводилось на синтетических наборах данных, полученных из структурных причинно-следственных моделей, охватывающих разнообразные графы, механизмы и процессы наблюдения. Затем модель масштабировалась согласно ранее опубликованным законам масштабирования LimiX до класса 400M.
На публичных рейтинговых таблицах команда продемонстрировала Elo 1935 на TabArena, 1432 на BCCO и 1506 на TALENT. Эти результаты заявлены как первые среди сравниваемых табличных фундаментальных моделей и базовых моделей в стиле AutoGluon в рамках опубликованных протоколов. Результаты TabArena также подчеркивают сильные показатели в разделениях регрессии и классификации; в карточке модели дополнительно отмечается восстановление причинно-следственного скелета посредством внимания к признакам, которое кодирует прямые причинно-следственные связи.
Предыдущие релизы LimiX уже покрывали сотни сценариев корпоративных структурированных данных; LimiX-2 представляет собой масштабированную генерацию CMN, призванную продвинуть эту область общих табличных моделей дальше.
Для команд, занимающихся данными, практическая ценность заключается в наличии единого открытого веса, который может классифицировать, регрессировать и импутировать данные в гетерогенных таблицах без необходимости повторной настройки для каждого набора данных. Это особенно полезно там, где корпоративные таблицы не имеют сходства с общедоступными текстовыми корпусами. Тем не менее, следует учитывать, что бенчмарки представлены как Elo, заявленные авторами при определенных конфигурациях; конечным пользователям в производственной среде потребуется провести проверки на отложенных выборках и контролировать утечки данных перед заменой специализированных конвейеров AutoML.
