Light Origins открыла модель LightNav-0 — универсальный навигационный мозг с открытым исходным кодом
Подробнее
Pandaily
pandaily.com

Light Origins открыла модель LightNav-0 — универсальный навигационный мозг с открытым исходным кодом

Компания Light Origins сделала свою модель LightNav-0 общедоступной. Эта компактная универсальная навигационная модель построена на основе бэкбона Qwen3-VL-4B и была выпущена вместе с весами, кодом, техническим отчетом и комплектом оценки INSIGHT-Bench.

Компания представляет эту модель как навигационный мозг, который использует единый токен-интерфейс для выполнения задач следования инструкциям, навигации по объектам с открытым словарём и визуального отслеживания, при этом не требуя специализированных выходных слоев для каждой задачи.

Основу работы составляет процесс Real2Sim2Real в заявленном масштабе. Специализированный движок данных преобразует более 2000 реальных сцен, собранных из интернета, в повторно используемые симуляторы. Затем синтезируется более 4000 часов согласованного опыта взаимодействия зрения, языка и действий.

Процесс обучения проходит в три этапа: сначала происходит обучение с учетом воплощенного рассуждения для формирования пространственных представлений; затем следует воплощенная контролируемая тонкая настройка на согласованных траекториях; и, наконец, используется онлайн-обучение с подкреплением, позволяющее политике улучшаться на основе собственных ошибок.

Для обеспечения разнообразия, высота камеры, поле зрения и угол наклона рандомизируются, чтобы одни и те же сцены охватывали множество точек обзора перед тем, как начнется любая тонкая настройка на реальных роботах.

При оценке Light Origins сообщает, что монокулярный RGB LightNav-0, снятый от первого лица, демонстрирует высокие результаты в десяти различных навигационных сценариях. Эти сценарии включают VLN-CE, навигацию по объектам Matterport3D/HM3D, HM3D-OVON и отслеживание EVT-Bench.

Модель занимает первое место среди методов с одной камерой и остается конкурентоспособной даже при включении панорамных систем. Двухканальные токены указания выражают пространственные намерения в пространстве изображений. Далее, трехуровневый токенизатор действий с остаточным векторным квантованием декодирует чанк из 10 шагов с ошибкой реконструкции в сантиметрах, согласно данным команды.

Демонстрации с нулевым знанием позволяют применять одну и ту же контрольную точку на гуманоидных, четвероногих, колесных и воздушных платформах в ранее не виденных внутренних и внешних сценах, включая отслеживание в многолюдных улицах.

Все артефакты доступны публично на GitHub по адресу lightorigins/LightNav-0 и на Hugging Face как LightOriginsHQ/LightNav-0 под лицензией Apache 2.0. Для команд, занимающихся робототехникой, наиболее ценным аспектом является не просто очередной показатель VLN, а воспроизводимый цикл согласования — от реальных сцен к симуляции, а затем обратно к гетерогенным телам — что направлено на уменьшение сбора данных для навигации, сильно зависящего от телеоперации, при сохранении единого интерфейса RGB и языка.

Популярное