Light Origins открыла модель Light-O1-Preview 6B для управления всем телом
Подробнее
Pandaily
pandaily.com

Light Origins открыла модель Light-O1-Preview 6B для управления всем телом

Компания Light Origins сделала доступным в открытом доступе Light-O1-Preview, модель для действий всего тела, содержащую приблизительно 6 миллиардов параметров. Эта модель выпущена под лицензией Apache 2.0 на платформах Hugging Face и GitHub, согласно техническому блогу компании от 21 сентября и ее англоязычному освещению.

Предварительная версия этой модели представляет собой общедоступный сегмент Light-O1 — фундаментальной линии воплощенных систем от Light Origins. Данная линия сначала обучается на структурированных человеческих действиях, извлеченных из видеоматериалов, а затем адаптируется к различным робототехническим телам. Официальное брендирование компании — Light Origins; этот релиз отличается от более раннего навигационного модуля LightNav-0.

Light Origins описала рабочий процесс, который включает сегментацию людей в видео, реконструкцию трехмерного движения и токенизацию траектории корня, позы тела и состояния рук в дискретные токены действий. Эти токены чередуются с языковыми и визуальными данными для авторегрессионного предварительного обучения Трансформера.

Эксперименты по масштабированию, охватывающие от 3,75 миллиарда до 120 миллиардов мультимодальных токенов — что соответствует примерно 100 000 часам восстановленных человеческих действий при самом большом бюджете — демонстрируют снижение потерь следующего действия и ошибки позы всего тела после адаптации к данным человека с эгоцентрической точки зрения, а также к системам телеуправления Unitree G1 и собственным корпусам данных LightBot от Light Origins.

Демонстрации, упомянутые в материалах запуска, переносят этот предыдущий опыт на LightBot и Unitree G1 для выполнения таких действий, как приседание, балансирование, протирание и подбор предметов.

На странице Hugging Face предварительная версия показывает контрольную точку размером 6B в дереве моделей Qwen3.5-4B-Base. Модель принимает текстовую инструкцию, генерирует краткую трассировку рассуждений и выдает последовательности действий всего тела со скоростью 20 кадров в секунду. Формат выходных данных составляет 138 значений на кадр, покрывая движение корня, высоту таза, рыскание, 22 сустава и состояния открытости рук.

Для применения этих траекторий на реальном оборудовании все еще требуется отдельная модель поведения или низкоуровневый контроллер. Light Origins документирует пример пути для Unitree G1, который в настоящее время работает в симуляции с дополнительной контрольной точкой политики. Также сообщается о результатах симуляций кухни RoboCasa GR-1, проведенных самой компанией, которые достигли 79,3% успеха по макрометрике в 24 задачах, хотя это не является независимым публичным рейтингом.

Для команд, занимающихся робототехникой, Light-O1-Preview представляет собой загружаемый слой движения-приоритета под разрешительной лицензией, а не готовое операционная система для роботов. Открытые веса позволяют лабораториям проверять утверждения о предварительном обучении на видеочеловеческом контенте; однако качество локально-манипуляционных задач между разными телами по-прежнему зависит от данных адаптации и контроллеров, которые остаются частично проприетарными.

Похожие сюжеты

SenseTime выпустила SenseNova U1.5: модель с 8 млрд параметров для унифицированного зрения с открытым кодом обучения
Подробнее
pandaily.com

SenseTime выпустила SenseNova U1.5: модель с 8 млрд параметров для унифицированного зрения с открытым кодом обучения

Компания SenseTime представила SenseNova U1.5 — модель с восемью миллиардами параметров, которая объединяет понимание, рассуждение и генерацию в пространстве пикселей в единую нативную мультимодальную систему.

В отличие от существующих конвейеров, которые используют кодировщик зрения для восприятия и отдельный вариационный автокодировщик для синтеза, U1.5 отображает пиксели и текст в общий каркас без этих внешних модулей. Это соответствует линии NEO-unify компании, при этом улучшена пространственная реконструкция для достижения более высокой точности при производственных разрешениях.

Архитектурное изменение заключается в замене независимого декодирования MLP патчей на легковесный пространственный декодер. Визуальные токены преобразуются в двумерное поле признаков, а затем восстанавливаются с помощью стадий Pixel Shuffle и локальных сверток, что позволяет соседним областям обмениваться информацией перед финализацией пикселей.

SenseTime сообщила, что интерфейс по-прежнему отображает каждую область размером 32 на 32 на один визуальный токен, однако он поддерживает нативную генерацию до 4K с меньшим количеством разрывов швов и текстурных неоднородностей по сравнению с предыдущей версией U1. Это стало возможным благодаря шумовому кондиционированию, учитывающему разрешение, в более широких соотношениях сторон.

Процесс после обучения следует рецепту специализации, а затем унификации. Специалисты по обучению с подкреплением фокусируются на визуальной эстетике, билингвальном рендеринге текста, макетировании инфографики и редактировании изображений. Затем многоэкспертная дистилляция по политике объединяет эти навыки в одного студента вдоль его собственных траекторий генерации.

SenseTime утверждает, что результаты U1.5 превосходят U1 в наборах данных для генерации и редактирования изображений, включая конкурентный билингвальный рендеринг текста и многореференсное редактирование, при этом сохраняя в целом высокие показатели мультимодального понимания на стандартных бенчмарках STEM, VQA и OCR.

Наряду с техническим отчетом, опубликованным на arXiv и Hugging Face Papers, SenseTime делает открытым код обучения, который охватывает контролируемую тонкую настройку, обучение с подкреплением и дистилляцию по политике. Активы модели доступны в коллекциях SenseNova и Hugging Face под организацией OpenSenseNova. Этот релиз представляет собой полный продукт U1.5, а не раннюю версию U1.5-Lite-Preview, и предназначен для разработчиков, желающих получить компактную нативную унифицированную модель зрения, которую можно исследовать, настраивать и переобучать полностью.

Shanghai AI Lab выпустила предварительную версию модели Atria Dawn, основанной на архитектуре MoE с 744 миллиардами параметров
Подробнее
pandaily.com

Shanghai AI Lab выпустила предварительную версию модели Atria Dawn, основанной на архитектуре MoE с 744 миллиардами параметров

Shanghai Artificial Intelligence Laboratory представила Atria Dawn Preview — агентскую языковую модель, разработанную для поддержки сложных исследовательских и инженерных процессов, а не только для демонстрационных чатов. Эта предварительная версия базируется на фундаменте Mixture-of-Experts (MoE) с 744 миллиардами параметров, который идентифицирован как GLM-5.2.

Модель обладает окном контекста размером 256K и распространяется под лицензией MIT. Чекпоинты, как стандартные инструкционные, так и квантованные в формате FP8-instruct, доступны на платформах Hugging Face и ModelScope. Кроме того, предоставляется доступ к API для пользователей в международных и китайских регионах.

Согласно документации модели и сопроводительной статье на arXiv, система обучалась с использованием Конвейера Проверяемого Опыта (Verifiable Experience Pipeline). Этот конвейер связывает рассуждения, опосредованные инструментами, с исполняемыми средами и внешне проверяемыми результатами. Основная концепция заключается в полном цикле выполнения: анализ проблемы, проектирование решения, вызов инструментов, выполнение кода и экспериментов, проверка результатов и восстановление после сбоев в рамках непрерывной обратной связи от среды, а не просто получение единичного ответа.

Лаборатория сгруппировала возможности модели для сценариев, охватывающих открытие, создание, доставку и кибербезопасность. Эти сценарии включают глубокие исследования, разработку программного обеспечения, подготовку структурированных офисных материалов и авторизованную проверку безопасности.

При оценке по 16 бенчмаркам, представленным лабораторией, Atria Dawn Preview продемонстрировала наивысший показатель по пяти задачам. Среди них — AutomationBench с результатом 53.8, BrowseComp с 92.5, DeepSearchQA с 96.0, BFCL v4 с 77.0 и CyberGym с 86.5. Остальные показатели остаются конкурентоспособными, но не являются доминирующими по сравнению с передовыми базовыми моделями агентов.

Этот релиз отличается от предыдущих разработок Shanghai AI Lab, таких как Intern W0 и связанные работы NCP. Dawn позиционируется как открытый агентский партнер для многоэтапных научных и инженерных проектов, и вместе с выпуском весов были предоставлены публичные активы на GitHub и специальный сайт проекта Atria.

Разработчики могут загрузить веса для локального использования через такие фреймворки, как SGLang и vLLM, либо использовать региональные консоли API. Клиенты в стиле Codex могут взаимодействовать с Responses API, используя настройки только текстового режима. Тем не менее, командам рекомендуется самостоятельно воспроизводить результаты AutomationBench и цепочки инструментов для долгосрочных задач, а также проверять условия лицензирования и развертывания. Важно воспринимать метку «preview» серьезно, поскольку надежность агента вне опубликованных наборов данных остается открытым вопросом, пока лаборатории продвигаются от помощников по задачам к совместной работе над проектами.

Популярное