Метод Zeva от Tsinghua AIR повысил успех воплощенного манипулирования с 26% до 73% без дополнительного обучения
Подробнее
Pandaily
pandaily.com

Метод Zeva от Tsinghua AIR повысил успех воплощенного манипулирования с 26% до 73% без дополнительного обучения

Институт исследований индустрии ИИ (AIR) Университета Цинхуа, сотрудничая с Domain Transform, представил метод воплощенного манипулирования под названием Zeva. Этот метод сохраняет веса основной модели замороженными и улучшается во время развертывания исключительно посредством причинно-следственной памяти в контексте.

На ряде проверенных бенчмарков для воплощенного манипулирования совокупный процент успеха увеличился примерно с 26% до 73%, что представляет собой прирост в 47 пунктов без необходимости проходить стандартный цикл сбора данных, разметки и тонкой настройки. В статье, озаглавленной «Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation», используется модель Cosmos3 в качестве основы, а среди авторов упоминаются Лю Юньсинь и Цао Тин из Tsinghua AIR.

Суть подхода заключается не в более масштабной тонкой настройке моделей зрения, языка и действий, а в добавлении слоя памяти, который обучает фиксированную модель тому, как ее собственные действия изменили сцену. Zeva состоит из трех основных компонентов.

Причинно-следственный трансферный кодировщик связывает каждое действие с последующим изменением состояния, формируя исходный материал для последующих запросов. Затем причинная память работает в двух временных масштабах: короткая траектория взаимодействия для текущей попытки и более долгая постоянная память взаимодействия, которая накапливает отфильтрованный опыт между попытками. Целенаправленное разделение этих хранилищ предотвращает немедленное загрязнение долгосрочной памяти из-за шума неудач, при этом продолжая подавать следующую команду в рамках того же эпизода.

Наконец, внедрение политики в контексте вставляет причинные подсказки во входную часть замороженной модели, при этом во время развертывания не происходит обновлений градиента. Это означает, что адаптация к среде превращается из проблемы операционной настройки обучения в проблему инженерии контекста.

На платформе RoboCasa365-Atomic5 средний показатель успеха достиг 76,8%. Более показательные результаты были получены на ChemLab-Evo, наборе задач для химической лаборатории: подбор пробирки, перемещенной с 65% до 100%, размещение стакана с 25% до 70% и наливание воды с 30% до 80%. Увеличение было более значительным там, где базовые показатели были слабее, что соответствует идее о том, что частые сбои генерируют более полезные причинно-следственные пары.

Одно человеческое демонстрационное действие добавило около 20 пунктов к размещению стакана и примерно 15 пунктов к наливанию — прирост, который авторы связывают с внедрением памяти, а не с изменением параметров. Это является привлекательным моментом, когда бюджеты на разметку ограничены.

Химическая тематика была выбрана потому, что такие изменения состояния, как уровень жидкости и поза сосуда, являются относительно чистыми, благодаря чему пары кодировщика остаются с низким уровнем шума; однако в статье отмечается, что задачи с деформируемыми объектами, подобные стирке, могут оказаться сложнее. Практически, Zeva обменивает недели специфической для площадки тонкой настройки на более длинные контексты и более высокую стоимость вывода на шаг, которая улучшается с использованием. Площадки, которые редко меняются, все еще могут предпочесть классическую тонкую настройку по экономическим причинам. Поскольку независимые робототехнические платформы за пределами настроенной системы Cosmos3 не входили в раскрытый пакет, заявления о переносе остаются теоретическими до тех пор, пока другие лаборатории не воспроизведут стек памяти на различном оборудовании и таксономиях задач.

Популярное