Xiaomi открыла модель воплощенного мирового фундамента и набор для обучения Robotics-U0
Подробнее
Pandaily
pandaily.com

Xiaomi открыла модель воплощенного мирового фундамента и набор для обучения Robotics-U0

Компания Xiaomi сделала доступным для общественности свой продукт Xiaomi-Robotics-U0 — авторегрессивную фундаментальную модель воплощенного мира. Эта модель рассматривает синтез, ориентированный на роботов, не просто как узкоспециализированный процесс генерации траекторий, а как продолжение генерации изображений и видео на основе фундаментальных моделей.

Согласно официальным материалам, основная линия модели содержит около 38 миллиардов параметров и постоянно обучается для достижения воплощенного интеллекта. Дополнительные публичные веса, включая варианты Xiaomi-Robotics-U0-4B и FlashAR, доступны на платформах Hugging Face и ModelScope, а также предоставляется код для инференса, демонстрации через Gradio и релизы обучения FSDP, датированные началом сентября.

В рамках одного фреймворка следующего токена данная модель объединяет несколько функций: генерацию изображений из текста, редактирование изображений из любого источника, создание многовидовых сцен, воплощенный контролируемый трансфер и генерацию воплощенного видео. Xiaomi утверждает, что этот стек сохраняет фундаментальную визуальную семантику, одновременно добавляя способность к рассуждению, ориентированному на роботов, посредством стадий обучения — как одношаговых, так и последовательных. Эти стадии включают потоки подзадач-целей, чередующиеся друг с другом, а также воплощенное видео с частотой 1, 3 и 5 кадров в секунду.

Архитектурные заметки указывают на использование токенизации изображений IBQ и мультимодального словаря, который поддерживает авторегрессивное масштабирование между различными модальностями. Эта архитектура построена на компонентах, происходящих от линий Qwen3-32B и EMU3.5.

Вторым важным аспектом является эффективность инференса. Технология FlashAR+ заменяет последовательное декодирование токенов изображения на антидиагональную параллельную генерацию и используется совместно с пакетной обработкой vLLM. Xiaomi сообщает о возможном ускорении генерации изображений размером 1024x1024 до почти 83 раз быстрее, что снижает задержку для одного образца с примерно 450,8 секунд до 5,44 секунд на заявленном оборудовании.

Страницы возможностей заявляют, что показатели побед в многовидовых сценах и трансфере превосходят GPT-Image-2 при внутреннем разделении данных на сложные и простые. Кроме того, UNIS (Xiaomi-Robotics-U0) занимает первое место среди более чем 100 моделей на WorldArena с показателем EWMScore_P, равным 73,64.

В области применения, данные для переноса стиля из модели смешиваются с реальными демонстрационными наборами для последующего обучения политики. Xiaomi сообщает об увеличении прогресса по задачам вмешательства с приблизительно 36,9% до 63,2% при использовании фонов и освещения, которые не использовались в обучении, при этом снижение по сравнению с базовым лабораторным уровнем было меньшим.

Хотя контрольные точки для генерации видео все еще догоняют релизы изображений и трансфера, команды должны проверить условия лицензирования, выбор движка FlashAR и воспроизводимость WorldArena сторонних разработчиков, прежде чем использовать открытые веса как готовый завод по данным для производственных роботов.

Популярное