Модель VPP2 от Robotera заняла первое место в RoboDojo и показала 58,5% успеха в задачах на реальных манипуляторах ALOHA
Подробнее
Pandaily
pandaily.com

Модель VPP2 от Robotera заняла первое место в RoboDojo и показала 58,5% успеха в задачах на реальных манипуляторах ALOHA

Компания Robotera, которая имеет поддержку Университета Цинхуа, объявила, что ее модель мирового действия VPP2 теперь занимает первое место в RoboDojo. Этот симуляционный бенчмарк курируется MMLab из Университета Гонконга и включает почти 20 академических учреждений.

Согласно данным QbitAI, VPP2 продемонстрировала средний процент успешности на уровне 32,26% и средний балл 39,26 в рамках 42 задач с двумя манипуляторами RoboDojo. Эти задачи проверяют такие аспекты, как обобщение, точное манипулирование, задачи с длинным горизонтом, память и инструкции с открытым словарным запасом. Модель также заняла первое место в категориях обобщения, точности и памяти.

Robotera подчеркивает, что достижение этих показателей было реализовано без использования дополнительных обучающих данных или надстроек, таких как рекурсивное самосовершенствование на основе агентов, используя исключительно стандартный набор данных. Наиболее сильная контрольная модель, упомянутая в их исследовании — GPT-6-Astra после дополнительного обучения — показала результаты 22,48% и 28,97. Рейтинг соответствует цифрам, представленным в научной работе. Ранее компания Simate заявляла о своем успехе с системой Simate-beta в RoboDojo.

Модель VPP2 направлена на устранение известной слабости моделей мирового действия: если видеопрогноз оказывается неверным, действие следует этому прогнозу. Процесс обучения в Robotera разделен на три этапа. Первый этап — предварительное обучение видео на уровне событий, основанное на открытом источнике Wan2.1-I2V-14B от Alibaba. Он обучает модель предсказывать весь процесс манипуляции от начала до конца, используя детально аннотированные клипы от роботов, людей и общих видеоматериалов.

Далее, прогноз сокращается до фиксированных восьмисекундных отрезков и дистиллируется в один шаг, который занимает около 0,12 секунды. Третий этап включает использование Action DiT с 0,9 миллиарда параметров, который учится преобразовывать прогнозы в движение, в то время как видеомодель остается замороженной и адаптируется только через LoRA. Общая задержка для блока действия составляет примерно 0,22 секунды.

При тестировании на реальном двухманипуляторном роботе ALOHA, VPP2 показала в среднем 58,5% по 10 типам задач без предварительного обучения, включая подбор, размещение, штабелирование, складывание и наливание. Это выше, чем 40% у pi0.5 от Physical Intelligence, и модель была лучшей в девяти из этих задач. Она набрала 45,0% на LIBERO-Pro и 63,9% на LIBERO-OOD. Добавление модели зрения и языка в качестве высокоуровневого планировщика повысило результаты выбранных задач с длинным горизонтом RoboDojo с 27,6% до 57,6%.

Robotera уже использует роботов в более чем 10 логистических центрах в пяти провинциях и городах в партнерстве с такими компаниями, как China Post и SF Express, хотя это не означает полномасштабного внедрения VPP2. Код модели доступен в открытом доступе на GitHub.

Похожие сюжеты

Тестовая площадка VA-Bench от Dalian University of Technology показала, что лучшие мультимодальные модели выполняют лишь половину задач робототехники
Подробнее
pandaily.com

Тестовая площадка VA-Bench от Dalian University of Technology показала, что лучшие мультимодальные модели выполняют лишь половину задач робототехники

Исследовательская группа из Dalian University of Technology представила VA-Bench — новый бенчмарк, предназначенный для проверки способности универсальных мультимодальных больших языковых моделей преобразовывать визуальную информацию в успешные действия роботизированной руки.

Среди двенадцати протестированных конфигураций лучшая модель, Qwen3.8-max от Alibaba, смогла выполнить в среднем 53,93% задач. Это указывает на то, что модели, способные «понимать» сцену, все еще сталкиваются с трудностями при надежном выполнении соответствующих действий.

Описание бенчмарка опубликовано в статье на arXiv (2609.19554) и в китайском издании Sina Tech. VA-Bench оценивает полный цикл процесса: наблюдение, рассуждение, действие и корректировка. Перед началом каждого испытания модель просматривает видео успешной демонстрации, однако ей не предоставляются координаты объектов, траектории экспертов или точные параметры действий.

Во время тестирования модель самостоятельно может менять ракурсы камеры, что увеличивает количество шагов взаимодействия, и должна выдавать конкретные команды: смещения в миллиметрах по каждой оси, углы поворота и указания на открытие или закрытие захвата. Фиксированный контроллер выполняет исключительно те инструкции, которые предоставляет модель.

Объем и структура тестирования

Бенчмарк охватывает 14 типов манипуляционных задач, включая 11 задач с одной рукой и три задачи с двумя руками. Каждая задача включает 20 физически проверенных сцен в симуляции физики, что составляет 280 базовых сцен. Кроме того, были добавлены варианты геометрии и планировки, а также трек с пятью объектами, требующий длительного выполнения. Каждая конфигурация модели была запущена трижды.

Ведущие модели достигли 100% точности при локализации целей и 99,6%–100% при понимании требуемого манипулирования, однако общий успех всего задания остался около половины. Модели Opus-5 и GPT-5.6-sol, представленные за рубежом, следовали за Qwen3.8-max, показав результаты 52,86% и 51,55% соответственно. Авторы отмечают, что три лидера находятся в пределах 2,38 процентных пункта, и не делают заявлений о надежном ранжировании. Процент завершения подзадач составил от 65,9% до 68,6%, что свидетельствует о том, что многие сбои происходят после частичного прогресса. Все остальные условия показали результат 23,10% или ниже.

Основные выявленные проблемы

Были обнаружены два ключевых пробела. Qwen3.8-max смог заметить ошибки в 73,6% случаев, но исправил их онлайн только в 46,7% случаев. Его успешность составляла 65,61% в задачах с одной рукой, но всего 11,11% в задачах с двумя руками, которые требуют распределения объектов между каждой рукой и координации их взаимного расположения.

Активное наблюдение оказалось более значимым фактором, чем наличие дополнительных камер. В сравнительном анализе Qwen3.8-max достиг успеха в 57,50% из 280 сцен, когда сам выбирал точки обзора, по сравнению с 27,86%, когда ему предоставлялось пять фиксированных видов. При этом все четыре протестированные модели отказались от участия в тесте без активного наблюдения.

Изменение формы объектов, контейнеров или планировки при сохранении той же задачи снизило успех одной из эталонных моделей более чем на 30 пунктов — с 80,00% до 47,86%. В то же время Qwen3.8-max снизил свой показатель с 77,86% до 67,86%. В треке с длительным выполнением Qwen3.8-max разместил 61 из 100 объектов, но ни одна модель не завершила ни одного строгого эпизода.

Этот бенчмарк отличается от рейтинга «embodied brain» SuperCLUE, опубликованного на этой неделе, поскольку VA-Bench измеряет, приводят ли суждения о восприятии, рассуждении и планировании к успешному физическому действию, в отличие от SuperCLUE, который оценивает сами эти аспекты.

Популярное