Компания Unitree 10 сентября представила UnifoLM-WLA-1.0, которая является генеративной фундаментальной моделью для гуманоидных роботов нового поколения, обладающей приблизительно 6 миллиардами параметров. Согласно заявлению компании, один контрольный файл, обученный на данных реального робота продолжительностью около 2500 часов, способен координировать 64 задачи, охватывающие 10 манипуляций всего тела и 54 манипуляции на столе, а также работать как с двухпалыми захватами, так и с несколькими ловкими пятипалыми руками.
Этот релиз отличается от предыдущей демонстрации Unitree UnifoLM-X2 sparring; UnifoLM-WLA-1.0 представляет собой более широкий стек «видение-язык-действие» для выполнения повседневных домашних и настольных работ, а не демонстрацию, ориентированную на боевые действия.
Архитектурно UnifoLM-WLA-1.0 базируется на моделировании мира, ориентированном на взаимодействие, дополненном экспертом действий MMDiT. Эта стадия воплощенного рассуждения, получившая название UnifoLM-ER-1, построена на основе Qwen3-VL-4B и была обучена более чем на 5 миллионах воплощенных образцов. Эти образцы покрывают такие аспекты, как прогнозирование точек, обнаружение объектов, многоизобразичное рассуждение, 2D-траектории, 3D-обнаружение и ответы на пространственные вопросы, что усиливает пространственное восприятие, одновременно совместно обучаясь с общими данными изображений и текста для сохранения широких навыков «видение-язык».
Далее, прогнозирование динамических областей использует оптический поток для извлечения будущих изменений сцены, сжимает их с помощью VQ-VAE в токены маски фиксированной длины и обучает модель «видение-язык» предсказывать, какие области начнут двигаться после начала взаимодействия. Дискретное обучение действий через остаточное квантование векторов разделяет унифицированное пространство действий на позы конечных эффекторов, суставы рук и суставы нижней части тела, выравнивает эти токены по общим временным шагам и подает их в UnifoLM-ER-Flow. Модель WLA, которую они выпустили, включает эксперта MMDiT для декодирования непрерывных действий робота из этого мультимодального каркаса.
На тестах пространственного и воплощенного рассуждения, проведенных на 16 мультимодальных наборах, Unitree сообщает, что UnifoLM-ER-1-4B опережает открытые модели в семи испытаниях. Кроме того, на пересекающихся пространственных наборах она превосходит локально проприетарную GPT-6 Astra по таким показателям, как Where2Place, подзадачи BLINK spatial, CV-Bench и EmbSpatial. Обучение опирается на Unitree Open Datasets и BitRobot-HIW-500, а также на другие источники данных реальных роботов. Видео оценки демонстрируются на оборудовании Unitree G1 для выполнения таких задач, как складывание полотенец, упаковка телефонов, заправка кроватей, сортировка обуви и уборка ванных комнат — задач, требующих скоординированного движения рук, конечных эффекторов и нижней части тела в рамках одной политики.
Важно отметить, что страница проекта доступна для разработчиков, однако код, модели и наборы данных пока отмечены как «Скоро». Unitree объявила о своем намерении сделать проект открытым исходным кодом и опубликовала документацию по архитектуре и матрице задач, но веса и корпуса данных еще недоступны для скачивания. До появления этих ресурсов практическим сигналом для исследователей и интеграторов служит раскрытая дорожная карта общей гуманоидной основы и таблица бенчмарков, а не готовый к запуску контрольный файл для сторонних роботов.
