Команда по фундаментальным моделям Li Auto 22 сентября обнародовала трилогию воплощенного искусственного интеллекта, состоящую из системы ME-Brain-1.0, унифицированной модели понимания и генерации действий в мире MachEmbodied-U0 (ME-U0) и когнитивных моделей MachEmbodied-VLM (ME-VLM). Официальное английское наименование этих разработок — Li Auto / MachEmbodied. Основной акцент в данном обзоре сделан на архитектуре системы и моделей — памяти, познании и действии, а не на маркетинге продуктов для электромобилей.
Согласно техническому блогу ME-Brain-1.0, данная система объединяет Эволюционную Память (Evolvable Memory), Когнитивное Ядро (Cognitive Core) и Модель Действия, управляемую событиями, в цикл, включающий исполнение, фиксацию опыта и обновление навыков. Когнитивное Ядро доступно в варианте MoE с 35B-A3B параметров и в компактном варианте для периферийных устройств (edge) с 4B параметров. В лабораторных испытаниях крупное ядро показало средний результат около 70.9 по наборам данных, связанным с воплощенными системами, и 72.5 по наборам данных агентов, при этом версия с 4B параметрами заняла второе место в сравнении с другими компаниями.
Эволюционная Память и связанные с ней модули функционируют на периферийном SoC M100 от Li Auto для генерации и извлечения памяти непосредственно на устройстве. ME-VLM представляет собой путь Когнитивного Ядра, где за счет квантования W4A8 и сжатия токенов время предварительной загрузки (Prefill latency) на M100 было сокращено примерно с 400 мс до 188 мс.
Модель ME-U0 была предварительно обучена на приблизительно 4200 часах данных, отобранных из более крупных наборов данных роботов и данных от первого лица. Согласно метрикам компании, модель достигает среднего успеха 99.1% на стандартном LIBERO, 81.8% на LIBERO-Plus без специальной адаптации и показатель процесса 17.66 на RoboDojo-Sim среди участвующих моделей действий в мире. Архитектура использует двухэкспертных модуля для понимания и генерации с многоскоростным вращательным кодированием позиции, что обеспечивает временное согласование латентных представлений зрения и токенов действий.
В сторонних публикациях, включая освещение от Robot Forward, переизданное Phoenix Tech, отмечаются видимые паузы захвата, периодические ошибки при захвате и незавершенные задачи в открытых сценариях, даже там, где скриптованные сцены проходят успешно. Эти замечания являются полезными дополнениями к лабораторным таблицам лидеров. Пока что бенчмарки остаются данными, предоставленными Li Auto, до тех пор, пока внешние лаборатории не воспроизведут их результаты. Краткосрочный сигнал заключается в наличии упакованного стека памяти-познание-действие с документированным путем на периферийном SoC, а не в презентации единого шасси.


