ACE Robotics и NTU открыли мультимодельную мировую модель Puffin-World с открытым исходным кодом
Подробнее
Pandaily
pandaily.com

ACE Robotics и NTU открыли мультимодельную мировую модель Puffin-World с открытым исходным кодом

ACE Robotics совместно с S-Lab из Nanyang Technological University, при участии Beijing Jiaotong University и University of Michigan, сделали общедоступным Puffin-World. Эта унифицированная мультимодальная мировая модель рассматривает физику, геометрию и внешний вид как неотъемлемые трехмерные состояния мира.

Выпущенный пакет включает код, модели и набор данных Puffin-16M. Целью разработки является обеспечение восприятия и симуляции, готовых для роботов, а не просто прогнозирование следующего кадра на основе RGB-изображений.

Большинство генеративных мировых моделей фокусируются на прогнозировании будущих пикселей. Однако Puffin-World объединяет моделирование гравитационно-осведомленного физического состояния, которое включает указатели широты, состояние геометрии, восстановленное с помощью глубины, и состояние внешнего вида, представленное в формате RGB. Все эти элементы связаны через представление Omni-Camera, которое объединяет абсолютные и относительные кадры камеры.

Абсолютные ориентиры закрепляют наблюдения относительно реальной гравитации и ориентации, тогда как относительная геометрия лучей поддерживает непрерывное изменение точки обзора и составные движения. Модель способна оценивать абсолютный крен, тангаж и вертикальное поле зрения по одному изображению, а также синтезировать траектории с произвольной точкой обзора, восстанавливать плотную геометрию и проводить замкнутое исследование, корректируя дрейф по гравитации и положению при движении камеры в сгенерированной сцене, используя текстовые или визуальные данные.

Масштаб обучения обеспечивается набором данных Puffin-16M, который содержит около 15 миллионов триплетов «видение-язык-камера» в Puffin-Cam-15M и 1 миллион сложных траекторий в Puffin-Traj-1M. Эти траектории охватывают тангаж, рыскание, крен и составные движения в различных средах: внутренних, наружных, синтетических и дорожных сценах.

Команда также использовала Puffin-World для добавления меток абсолютного положения камеры к 28 публичным наборам данных, покрывающим примерно 44,5 миллиона изображений, доступных для дальнейших исследований. Этот вклад в данные призван восполнить пробел в абсолютном положении, который существует в корпусах камер, основанных только на относительных данных, поскольку они не могут обучить выравниванию по гравитации.

На четырех публичных бенчмарках, сравнивающих камеру с миром — Stanford2D3D, MegaDepth, TartanAir и LaMAR — Puffin-World демонстрирует лучшие в своем классе медианные ошибки. На Stanford2D3D медианные ошибки по крену, тангажу и вертикальному полю зрения снижаются до 0,29°, 0,53° и 1,62° соответственно. Кроме того, модель показывает наименьший крен в пределах градуса на MegaDepth (0,28°), TartanAir (0,31°) и LaMAR (0,26°).

Проектные материалы также указывают на ведущие показатели PSNR и LPIPS при многоракурсном моделировании RealEstate10K и низкие угловые ошибки на испытательных стендах для управления камерой с произвольной точкой обзора. Архитектура объединяет энкодер зрения, согласованный с геометрией, языковую модель, диффузионный генератор и легковесный коннектор. Это позволяет пониманию, генерации и реконструкции использовать единую структуру без внешних модулей геометрии, специфичных для задачи.

Для систем воплощенного интеллекта (embodied stacks) открытый релиз предоставляет единую контрольную точку, которая может воспринимать абсолютную физику камеры, симулировать управляемые точки обзора и воссоздавать связные трехмерные миры. Это представляет собой переход от простого прогнозирования кадров к моделированию того, как существует физическая сцена и как ее можно исследовать.

Популярное