Li Auto представила трилогию воплощенного ИИ: ME-Brain-1.0, ME-U0 и Edge ME-VLM
Подробнее
Pandaily
pandaily.com

Li Auto представила трилогию воплощенного ИИ: ME-Brain-1.0, ME-U0 и Edge ME-VLM

Команда по фундаментальным моделям Li Auto 22 сентября обнародовала трилогию воплощенного искусственного интеллекта, состоящую из системы ME-Brain-1.0, унифицированной модели понимания и генерации действий в мире MachEmbodied-U0 (ME-U0) и когнитивных моделей MachEmbodied-VLM (ME-VLM). Официальное английское наименование этих разработок — Li Auto / MachEmbodied. Основной акцент в данном обзоре сделан на архитектуре системы и моделей — памяти, познании и действии, а не на маркетинге продуктов для электромобилей.

Согласно техническому блогу ME-Brain-1.0, данная система объединяет Эволюционную Память (Evolvable Memory), Когнитивное Ядро (Cognitive Core) и Модель Действия, управляемую событиями, в цикл, включающий исполнение, фиксацию опыта и обновление навыков. Когнитивное Ядро доступно в варианте MoE с 35B-A3B параметров и в компактном варианте для периферийных устройств (edge) с 4B параметров. В лабораторных испытаниях крупное ядро показало средний результат около 70.9 по наборам данных, связанным с воплощенными системами, и 72.5 по наборам данных агентов, при этом версия с 4B параметрами заняла второе место в сравнении с другими компаниями.

Эволюционная Память и связанные с ней модули функционируют на периферийном SoC M100 от Li Auto для генерации и извлечения памяти непосредственно на устройстве. ME-VLM представляет собой путь Когнитивного Ядра, где за счет квантования W4A8 и сжатия токенов время предварительной загрузки (Prefill latency) на M100 было сокращено примерно с 400 мс до 188 мс.

Модель ME-U0 была предварительно обучена на приблизительно 4200 часах данных, отобранных из более крупных наборов данных роботов и данных от первого лица. Согласно метрикам компании, модель достигает среднего успеха 99.1% на стандартном LIBERO, 81.8% на LIBERO-Plus без специальной адаптации и показатель процесса 17.66 на RoboDojo-Sim среди участвующих моделей действий в мире. Архитектура использует двухэкспертных модуля для понимания и генерации с многоскоростным вращательным кодированием позиции, что обеспечивает временное согласование латентных представлений зрения и токенов действий.

В сторонних публикациях, включая освещение от Robot Forward, переизданное Phoenix Tech, отмечаются видимые паузы захвата, периодические ошибки при захвате и незавершенные задачи в открытых сценариях, даже там, где скриптованные сцены проходят успешно. Эти замечания являются полезными дополнениями к лабораторным таблицам лидеров. Пока что бенчмарки остаются данными, предоставленными Li Auto, до тех пор, пока внешние лаборатории не воспроизведут их результаты. Краткосрочный сигнал заключается в наличии упакованного стека памяти-познание-действие с документированным путем на периферийном SoC, а не в презентации единого шасси.

Похожие сюжеты

Xiaomi открыла модель воплощенного мирового фундамента и набор для обучения Robotics-U0
Подробнее
pandaily.com

Xiaomi открыла модель воплощенного мирового фундамента и набор для обучения Robotics-U0

Компания Xiaomi сделала доступным для общественности свой продукт Xiaomi-Robotics-U0 — авторегрессивную фундаментальную модель воплощенного мира. Эта модель рассматривает синтез, ориентированный на роботов, не просто как узкоспециализированный процесс генерации траекторий, а как продолжение генерации изображений и видео на основе фундаментальных моделей.

Согласно официальным материалам, основная линия модели содержит около 38 миллиардов параметров и постоянно обучается для достижения воплощенного интеллекта. Дополнительные публичные веса, включая варианты Xiaomi-Robotics-U0-4B и FlashAR, доступны на платформах Hugging Face и ModelScope, а также предоставляется код для инференса, демонстрации через Gradio и релизы обучения FSDP, датированные началом сентября.

В рамках одного фреймворка следующего токена данная модель объединяет несколько функций: генерацию изображений из текста, редактирование изображений из любого источника, создание многовидовых сцен, воплощенный контролируемый трансфер и генерацию воплощенного видео. Xiaomi утверждает, что этот стек сохраняет фундаментальную визуальную семантику, одновременно добавляя способность к рассуждению, ориентированному на роботов, посредством стадий обучения — как одношаговых, так и последовательных. Эти стадии включают потоки подзадач-целей, чередующиеся друг с другом, а также воплощенное видео с частотой 1, 3 и 5 кадров в секунду.

Архитектурные заметки указывают на использование токенизации изображений IBQ и мультимодального словаря, который поддерживает авторегрессивное масштабирование между различными модальностями. Эта архитектура построена на компонентах, происходящих от линий Qwen3-32B и EMU3.5.

Вторым важным аспектом является эффективность инференса. Технология FlashAR+ заменяет последовательное декодирование токенов изображения на антидиагональную параллельную генерацию и используется совместно с пакетной обработкой vLLM. Xiaomi сообщает о возможном ускорении генерации изображений размером 1024x1024 до почти 83 раз быстрее, что снижает задержку для одного образца с примерно 450,8 секунд до 5,44 секунд на заявленном оборудовании.

Страницы возможностей заявляют, что показатели побед в многовидовых сценах и трансфере превосходят GPT-Image-2 при внутреннем разделении данных на сложные и простые. Кроме того, UNIS (Xiaomi-Robotics-U0) занимает первое место среди более чем 100 моделей на WorldArena с показателем EWMScore_P, равным 73,64.

В области применения, данные для переноса стиля из модели смешиваются с реальными демонстрационными наборами для последующего обучения политики. Xiaomi сообщает об увеличении прогресса по задачам вмешательства с приблизительно 36,9% до 63,2% при использовании фонов и освещения, которые не использовались в обучении, при этом снижение по сравнению с базовым лабораторным уровнем было меньшим.

Хотя контрольные точки для генерации видео все еще догоняют релизы изображений и трансфера, команды должны проверить условия лицензирования, выбор движка FlashAR и воспроизводимость WorldArena сторонних разработчиков, прежде чем использовать открытые веса как готовый завод по данным для производственных роботов.

Стартап EBKernel представил модель Cog-WM 1.0, вдохновленную мозгом, для когнитивного моделирования мира
Подробнее
pandaily.com

Стартап EBKernel представил модель Cog-WM 1.0, вдохновленную мозгом, для когнитивного моделирования мира

Шанхайский стартап EBKernel представил Cog-WM 1.0 на сессии по воплощенному интеллекту, вдохновленному мозгом, в рамках Форума инноваций Пуцян в 2026 году. Компания позиционирует этот релиз как когнитивную модель мира, построенную на прогнозировании в латентном пространстве, а не на воспроизведении пикселей.

Согласно заявлению компании, данная архитектура заимствует организационные концепции из человеческих когнитивных карт, такие как избирательное обновление памяти, кодирование, обусловленное целью, и прогнозирование на нескольких горизонтах. Эти идеи сочетаются с целевой функцией совместного встраивания в стиле JEPA, позволяя роботам планировать, используя абстрактные пространственные и состоятельные признаки, вместо реконструкции сырых кадров.

В части навигации, модель Cog-WM Nav 1.0 была протестирована без использования предварительно созданной карты. На подмножестве HM3D-ObjectNav EBKernel сообщила об увеличении показателя успеха с 78,50% до 86,89% по сравнению с базовой линией BSC-Nav, опубликованной в Nature Communications. Это представляет собой абсолютный прирост в 8,39 пункта (примерно 10,7% относительно), а показатель SPL увеличился с 47,70 до 48,35.

Навигационный компонент сохраняет явную пространственную память и прогнозирует подцели для исследования в латентном пространстве. Затем он балансирует между семантикой цели и стоимостью пути, что особенно полезно, когда цель находится вне текущего поля зрения, и роботу необходимо решить, куда смотреть дальше.

Манипуляционная ветвь, Cog-WM Manip 1.0, обучает многомасштабное прогнозирование состояния и опыт, модулированный значением, обеспечивая связь между эффектами действий на коротком горизонте и прогрессом задачи на более длительном отрезке. При использовании единого протокола воспроизведения EBKernel утверждает, что модель превосходит массово предварительно обученные базовые модели типа pi0.5 примерно на 16% по трем основным наборам данных для манипуляций, включая более сложные настройки RoboTwin 2.0.

Анализ влияния компонентов на LIBERO-Plus показал аддитивный эффект: политика сама по себе достигла почти 80%, локальное прогнозирование — 81,6%, многогоризонтное прогнозирование — 82,0%, а полная система — 84,6%.

Компания заявляет о возможностях развертывания, которые охватывают гуманоидов на колесах и четвероногих для навигации без карт, планирования маршрута, извлечения пространственно-временной памяти, пространственного ответа на вопросы (QA) и поиска объектов. Манипуляция была проверена на гуманоидных телах на колесах, а навигация четвероногих отмечена на клиентских объектах для инспекции или патрулирования.

EBKernel, основанная в середине 2025 года, продвигает тезис о продукте, заключающийся в обучении в течение всей жизни с низкой потребностью в данных и высокой обобщающей способностью. Однако независимые показатели долговечности на открытом воздухе и результаты в поле на длинных горизонтах пока остаются ограниченными рамками внутренних бенчмарков компании, поэтому лабораториям рекомендуется рассматривать опубликованные показатели SR и изменения в манипуляции как основной набор для сравнения до появления работ третьих сторон.

Популярное