Компания Light Origins сделала доступным в открытом доступе Light-O1-Preview, модель для действий всего тела, содержащую приблизительно 6 миллиардов параметров. Эта модель выпущена под лицензией Apache 2.0 на платформах Hugging Face и GitHub, согласно техническому блогу компании от 21 сентября и ее англоязычному освещению.
Предварительная версия этой модели представляет собой общедоступный сегмент Light-O1 — фундаментальной линии воплощенных систем от Light Origins. Данная линия сначала обучается на структурированных человеческих действиях, извлеченных из видеоматериалов, а затем адаптируется к различным робототехническим телам. Официальное брендирование компании — Light Origins; этот релиз отличается от более раннего навигационного модуля LightNav-0.
Light Origins описала рабочий процесс, который включает сегментацию людей в видео, реконструкцию трехмерного движения и токенизацию траектории корня, позы тела и состояния рук в дискретные токены действий. Эти токены чередуются с языковыми и визуальными данными для авторегрессионного предварительного обучения Трансформера.
Эксперименты по масштабированию, охватывающие от 3,75 миллиарда до 120 миллиардов мультимодальных токенов — что соответствует примерно 100 000 часам восстановленных человеческих действий при самом большом бюджете — демонстрируют снижение потерь следующего действия и ошибки позы всего тела после адаптации к данным человека с эгоцентрической точки зрения, а также к системам телеуправления Unitree G1 и собственным корпусам данных LightBot от Light Origins.
Демонстрации, упомянутые в материалах запуска, переносят этот предыдущий опыт на LightBot и Unitree G1 для выполнения таких действий, как приседание, балансирование, протирание и подбор предметов.
На странице Hugging Face предварительная версия показывает контрольную точку размером 6B в дереве моделей Qwen3.5-4B-Base. Модель принимает текстовую инструкцию, генерирует краткую трассировку рассуждений и выдает последовательности действий всего тела со скоростью 20 кадров в секунду. Формат выходных данных составляет 138 значений на кадр, покрывая движение корня, высоту таза, рыскание, 22 сустава и состояния открытости рук.
Для применения этих траекторий на реальном оборудовании все еще требуется отдельная модель поведения или низкоуровневый контроллер. Light Origins документирует пример пути для Unitree G1, который в настоящее время работает в симуляции с дополнительной контрольной точкой политики. Также сообщается о результатах симуляций кухни RoboCasa GR-1, проведенных самой компанией, которые достигли 79,3% успеха по макрометрике в 24 задачах, хотя это не является независимым публичным рейтингом.
Для команд, занимающихся робототехникой, Light-O1-Preview представляет собой загружаемый слой движения-приоритета под разрешительной лицензией, а не готовое операционная система для роботов. Открытые веса позволяют лабораториям проверять утверждения о предварительном обучении на видеочеловеческом контенте; однако качество локально-манипуляционных задач между разными телами по-прежнему зависит от данных адаптации и контроллеров, которые остаются частично проприетарными.


