Компания SenseTime представила SenseNova U1.5 — модель с восемью миллиардами параметров, которая объединяет понимание, рассуждение и генерацию в пространстве пикселей в единую нативную мультимодальную систему.
В отличие от существующих конвейеров, которые используют кодировщик зрения для восприятия и отдельный вариационный автокодировщик для синтеза, U1.5 отображает пиксели и текст в общий каркас без этих внешних модулей. Это соответствует линии NEO-unify компании, при этом улучшена пространственная реконструкция для достижения более высокой точности при производственных разрешениях.
Архитектурное изменение заключается в замене независимого декодирования MLP патчей на легковесный пространственный декодер. Визуальные токены преобразуются в двумерное поле признаков, а затем восстанавливаются с помощью стадий Pixel Shuffle и локальных сверток, что позволяет соседним областям обмениваться информацией перед финализацией пикселей.
SenseTime сообщила, что интерфейс по-прежнему отображает каждую область размером 32 на 32 на один визуальный токен, однако он поддерживает нативную генерацию до 4K с меньшим количеством разрывов швов и текстурных неоднородностей по сравнению с предыдущей версией U1. Это стало возможным благодаря шумовому кондиционированию, учитывающему разрешение, в более широких соотношениях сторон.
Процесс после обучения следует рецепту специализации, а затем унификации. Специалисты по обучению с подкреплением фокусируются на визуальной эстетике, билингвальном рендеринге текста, макетировании инфографики и редактировании изображений. Затем многоэкспертная дистилляция по политике объединяет эти навыки в одного студента вдоль его собственных траекторий генерации.
SenseTime утверждает, что результаты U1.5 превосходят U1 в наборах данных для генерации и редактирования изображений, включая конкурентный билингвальный рендеринг текста и многореференсное редактирование, при этом сохраняя в целом высокие показатели мультимодального понимания на стандартных бенчмарках STEM, VQA и OCR.
Наряду с техническим отчетом, опубликованным на arXiv и Hugging Face Papers, SenseTime делает открытым код обучения, который охватывает контролируемую тонкую настройку, обучение с подкреплением и дистилляцию по политике. Активы модели доступны в коллекциях SenseNova и Hugging Face под организацией OpenSenseNova. Этот релиз представляет собой полный продукт U1.5, а не раннюю версию U1.5-Lite-Preview, и предназначен для разработчиков, желающих получить компактную нативную унифицированную модель зрения, которую можно исследовать, настраивать и переобучать полностью.
