A Light Origins tornou seu modelo LightNav-0 público. Este modelo de navegação compacto e universal é construído com base no backbone Qwen3-VL-4B e foi lançado juntamente com pesos, código, relatório técnico e o conjunto de avaliação INSIGHT-Bench.
A empresa apresenta este modelo como um cérebro de navegação que utiliza uma interface de token unificada para executar tarefas de seguimento de instruções, navegação em objetos com vocabulário aberto e rastreamento visual, sem exigir camadas de saída especializadas para cada tarefa.
O cerne do trabalho é o processo Real2Sim2Real na escala declarada. Um motor de dados especializado converte mais de 2000 cenas reais coletadas da internet em simuladores reutilizáveis. Em seguida, são sintetizadas mais de 4000 horas de experiência coordenada de visão, linguagem e ação.
O processo de treinamento ocorre em três estágios: primeiro, há treinamento com raciocínio incorporado para formar representações espaciais; em seguida, segue-se o ajuste fino controlado incorporado em trajetórias coordenadas; e, finalmente, é usado aprendizado por reforço online, permitindo que a política melhore com base em seus próprios erros.
Para garantir diversidade, a altura da câmera, o campo de visão e o ângulo de inclinação são randomizados para que as mesmas cenas cubram múltiplos pontos de vista antes que qualquer ajuste fino seja iniciado em robôs reais.
Ao avaliar, a Light Origins relata que o LightNav-0 monocameral RGB, capturado em primeira pessoa, demonstra altos resultados em dez cenários de navegação diferentes. Esses cenários incluem VLN-CE, navegação em objetos Matterport3D/HM3D, HM3D-OVON e rastreamento EVT-Bench.
O modelo ocupa o primeiro lugar entre os métodos de câmera única e permanece competitivo mesmo com sistemas panorâmicos ativados. Tokens de direção bicanais expressam intenções espaciais no espaço de imagens. Em seguida, um tokenizador de ações de três níveis com quantização vetorial residual decodifica um bloco de 10 passos com erro de reconstrução em centímetros, de acordo com os dados da equipe.
As demonstrações de conhecimento zero permitem aplicar o mesmo ponto de controle em plataformas humanoides, quadrúpedes, com rodas e aéreas em cenas internas e externas nunca vistas anteriormente, incluindo rastreamento em ruas movimentadas.
Todos os artefatos estão disponíveis publicamente no GitHub em lightorigins/LightNav-0 e no Hugging Face como LightOriginsHQ/LightNav-0 sob a licença Apache 2.0. Para equipes de robótica, o aspecto mais valioso não é apenas mais uma métrica VLN, mas sim o ciclo de coordenação reprodutível — de cenas reais para simulação e depois de volta a corpos heterogêneos — visando reduzir a coleta de dados para navegação, altamente dependente de teleoperação, mantendo uma interface RGB e de linguagem unificada.
