SenseTime выпустила модель генерации изображений SenseNova U1 Pro с поддержкой разрешения до 8K через Raccoon и API
Подробнее
Pandaily
pandaily.com

SenseTime выпустила модель генерации изображений SenseNova U1 Pro с поддержкой разрешения до 8K через Raccoon и API

Компания SenseTime представила производственную версию своей модели создания изображений SenseNova U1 Pro. Эта модель теперь доступна пользователям через приложение Raccoon компании, а также через сервис SenseNova API. Согласно сообщению, которое передало TechNode 22 сентября 2026 года, информация была взята из объявления, опубликованного на Sina Finance. Официальное англоязычное наименование продукта — SenseTime / SenseNova.

Данный релиз отличается от предыдущего освещения исследования SenseNova U1.5 и открытого кода обучения. SenseTime утверждает, что U1 Pro использует цепочку рассуждений, чередующуюся с текстово-изобразительным процессом, для создания визуальных материалов, содержащих структурированную информацию и читаемый текст непосредственно на холсте, а также подходящие для производства макеты.

Вместо того чтобы рассматривать подписи и пиксели как отдельные этапы, модель интегрирует шаги рассуждения с формированием изображения. Это гарантирует, что иерархия макета, расположение типографики и графические элементы остаются согласованными на протяжении всего процесса генерации. Продукт поддерживает вывод изображений с разрешением до 8K и позволяет задавать пользовательские соотношения сторон, что ориентировано на работу с большими форматами и высокой детализацией, а не только на квадратные обрезки для социальных сетей.

В объявлении перечислены целевые задачи, среди которых инфографика, плакаты, архитектурные визуализации и другой контент, требующий единообразного стиля и компоновки во всем готовом произведении. Эти сценарии подчеркивают необходимость контроля композиции и рендеринга текста внутри самого изображения, а не использования отдельного инструмента для компоновки после завершения генерации. Таким образом, команды маркетинга и дизайна могут запрашивать готовые к производству кадры из одного запроса.

Распространение осуществляется по двум каналам: потребители и создатели получают доступ через Raccoon, а продуктовые команды могут использовать программный доступ через SenseNova API для интеграции генерации в свои рабочие процессы. SenseTime не опубликовала полную публичную карточку модели с данными о параметрах, условиями лицензирования или независимыми таблицами бенчмаркинга в сводке TechNode на английском языке. Поэтому покупателям рекомендуется рассматривать заявления о пределе 8K и возможностях компоновки как утверждения компании до появления оценок третьих сторон. Для покупателей мультимодальных систем, отслеживающих китайские модели изображений, ближайшим сигналом является наличие готового SKU U1 Pro для производства в каналах Raccoon и API с явным ограничением ультравысокого разрешения.

Похожие сюжеты

SenseTime выпустила SenseNova U1.5: модель с 8 млрд параметров для унифицированного зрения с открытым кодом обучения
Подробнее
pandaily.com

SenseTime выпустила SenseNova U1.5: модель с 8 млрд параметров для унифицированного зрения с открытым кодом обучения

Компания SenseTime представила SenseNova U1.5 — модель с восемью миллиардами параметров, которая объединяет понимание, рассуждение и генерацию в пространстве пикселей в единую нативную мультимодальную систему.

В отличие от существующих конвейеров, которые используют кодировщик зрения для восприятия и отдельный вариационный автокодировщик для синтеза, U1.5 отображает пиксели и текст в общий каркас без этих внешних модулей. Это соответствует линии NEO-unify компании, при этом улучшена пространственная реконструкция для достижения более высокой точности при производственных разрешениях.

Архитектурное изменение заключается в замене независимого декодирования MLP патчей на легковесный пространственный декодер. Визуальные токены преобразуются в двумерное поле признаков, а затем восстанавливаются с помощью стадий Pixel Shuffle и локальных сверток, что позволяет соседним областям обмениваться информацией перед финализацией пикселей.

SenseTime сообщила, что интерфейс по-прежнему отображает каждую область размером 32 на 32 на один визуальный токен, однако он поддерживает нативную генерацию до 4K с меньшим количеством разрывов швов и текстурных неоднородностей по сравнению с предыдущей версией U1. Это стало возможным благодаря шумовому кондиционированию, учитывающему разрешение, в более широких соотношениях сторон.

Процесс после обучения следует рецепту специализации, а затем унификации. Специалисты по обучению с подкреплением фокусируются на визуальной эстетике, билингвальном рендеринге текста, макетировании инфографики и редактировании изображений. Затем многоэкспертная дистилляция по политике объединяет эти навыки в одного студента вдоль его собственных траекторий генерации.

SenseTime утверждает, что результаты U1.5 превосходят U1 в наборах данных для генерации и редактирования изображений, включая конкурентный билингвальный рендеринг текста и многореференсное редактирование, при этом сохраняя в целом высокие показатели мультимодального понимания на стандартных бенчмарках STEM, VQA и OCR.

Наряду с техническим отчетом, опубликованным на arXiv и Hugging Face Papers, SenseTime делает открытым код обучения, который охватывает контролируемую тонкую настройку, обучение с подкреплением и дистилляцию по политике. Активы модели доступны в коллекциях SenseNova и Hugging Face под организацией OpenSenseNova. Этот релиз представляет собой полный продукт U1.5, а не раннюю версию U1.5-Lite-Preview, и предназначен для разработчиков, желающих получить компактную нативную унифицированную модель зрения, которую можно исследовать, настраивать и переобучать полностью.

Kinetix AI привлекла раунд ангельского финансирования в размере 75 миллионов долларов для развития аппаратного обеспечения моделей ИИ
Подробнее
ventureburn.com

Kinetix AI привлекла раунд ангельского финансирования в размере 75 миллионов долларов для развития аппаратного обеспечения моделей ИИ

Инженеры долгое время сталкивались с проблемой: искусственный интеллект, способный писать романы за секунды, испытывает трудности с захватом хрупкого стекла, не раздавив его. Эта проблема связана с существенным разрывом между цифровым интеллектом и физическим исполнением.

Для преодоления этого пробела необходима безупречная и непрерывная обратная связь между программными системами и механическими телами. Чтобы решить эту узкую проблему, Kinetix AI привлекла 75 миллионов долларов в рамках крупного и значимого раунда ангельского финансирования, что является серьезным шагом вперед в области воплощенного интеллекта.

Исторический раунд финансирования компании возглавила Vertex Ventures, мощное венчурное подразделение сингапурской Temasek Holdings. Также в раунд присоединились F&G Venture и Wanshi Capital, чтобы инвестировать более 500 миллионов юаней (примерно 75 миллионов долларов) в Kinetix AI, стартап на ранней стадии.

Kinetix AI — это не небольшой гаражный проект. Основанная в сентябре 2025 года, компания быстро выросла до почти 200 сотрудников. За быстрым ростом Kinetix AI стоит генеральный директор Юй Цзе, который ранее коммерциализировал автономные горнодобывающие грузовики Huawei.

В команду входят также Ло Пин, блестящий заместитель декана из HKU, и Чжэн Цюньюань, бывший руководитель отдела робототехники в XPeng. Эта группа обладает глубокими знаниями в сочетании академической теории, логики автономных транспортных средств и производственных возможностей.

Многие робототехнические компании экономят на качестве, однако Kinetix этого не приемлет. Компания твердо убеждена, что поскольку инфраструктура мира создана для людей, роботы должны выглядеть и двигаться точно так же, как мы, чтобы бесшовно интегрироваться.

Их флагманское творение, KAIBot, имеет высоту 1,73 метра и поразительные 115 степеней свободы. Он отличается высоким качеством и ультрареалистичностью. Хотя создание такого робота требует значительно больших первоначальных затрат, а цепочка поставок представляет собой настоящий кошмар, соучредитель Чжэн Цюньюань утверждает, что начало работы с дешевым, некачественным оборудованием — это просто глупость. Закрепляя истинный человеческий форм-фактор, они гарантируют, что их модели ИИ не выйдут из строя, как только будет обновлен какой-либо сустав.

Представьте себе робота, который не просто имитирует человеческий силуэт, а идеально соответствует данным о движении человека. Когда аппаратное обеспечение напрямую отражает нашу биологию, алгоритмическая работа передается без усилий.

Основная магия происходит благодаря привлеченному капиталу, который направлен на ускорение их замкнутой экосистемы. Это можно представить как трехголовое чудовище. Во-первых, это сбор мультимодальных, эгоцентрических данных. Затем эти необработанные данные подаются непосредственно в нативную фундаментальную модель, воплощенную в теле. Наконец, аппаратное обеспечение, такое как KAIBot и высокоманевренная рука KAI Hand, физически выполняет изученные действия.

Этот непрерывный цикл создает «маховик интеллекта». Поскольку робот собирает сенсорные данные из реального мира, модель ИИ становится умнее, мгновенно повышая возможности физического оборудования. Больше не нужно перестраивать физическую машину при каждом обновлении программного обеспечения.

Динамичность системы была продемонстрирована на Всемирных играх по робототехнике для людей в 2026 году, где их система играла в настольный теннис против чемпионки мира Динь Нин. Цель состоит в создании премиального класса роботов, готовых к сложным задачам в реальном мире.

Популярное