A Xiaomi disponibilizou ao público seu produto Xiaomi-Robotics-U0 — um modelo fundamental autorregressivo do mundo incorporado. Este modelo considera a síntese orientada para robôs não apenas como um processo especializado de geração de trajetórias, mas como uma extensão da geração de imagens e vídeos baseada em modelos fundamentais.
De acordo com materiais oficiais, a linha principal do modelo contém cerca de 38 bilhões de parâmetros e está em constante treinamento para alcançar inteligência incorporada. Pesos públicos adicionais, incluindo as variantes Xiaomi-Robotics-U0-4B e FlashAR, estão disponíveis nas plataformas Hugging Face e ModelScope, e o código para inferência, demonstração via Gradio e os lançamentos de treinamento FSDP, datados do início de setembro, também são fornecidos.
Dentro de um único framework de próximo token, este modelo combina várias funções: geração de imagens a partir de texto, edição de imagens de qualquer fonte, criação de cenas multimodais, transferência controlada incorporada e geração de vídeo incorporado. A Xiaomi afirma que este conjunto mantém a semântica visual fundamental, ao mesmo tempo que adiciona a capacidade de raciocínio orientado para robôs através de estágios de treinamento — tanto de estágio único quanto sequenciais. Estas fases incluem fluxos de subtarefas-objetivos alternados, bem como vídeo incorporado com taxas de 1, 3 e 5 quadros por segundo.
As notas arquitetônicas indicam o uso de tokenização de imagens IBQ e um vocabulário multimodal que suporta escalonamento autorregressivo entre diferentes modalidades. Esta arquitetura é construída sobre componentes derivados das linhas Qwen3-32B e EMU3.5.
Um segundo aspecto importante é a eficiência da inferência. A tecnologia FlashAR+ substitui a decodificação sequencial de tokens de imagem pela geração paralela antidiagonal e é usada em conjunto com o processamento em lote vLLM. A Xiaomi relata um potencial aumento na velocidade de geração de imagens de 1024x1024 para quase 83 vezes mais rápido, reduzindo a latência para uma única amostra de aproximadamente 450,8 segundos para 5,44 segundos no hardware declarado.
As páginas de capacidades afirmam que os índices de vitória em cenas multimodais e transferência superam o GPT-Image-2 em divisão interna de dados em complexos e simples. Além disso, UNIS (Xiaomi-Robotics-U0) ocupa o primeiro lugar entre mais de 100 modelos no WorldArena com um EWMScore_P de 73,64.
Em termos de aplicação, os dados de transferência de estilo do modelo são misturados com conjuntos de demonstração reais para o treinamento subsequente da política. A Xiaomi relata um aumento no progresso em tarefas de intervenção de aproximadamente 36,9% para 63,2% ao usar fundos e iluminação não utilizados no treinamento, com uma redução menor em comparação com o nível laboratorial base.
Embora os checkpoints para geração de vídeo ainda estejam alcançando os lançamentos de imagens e transferência, as equipes devem verificar as condições de licenciamento, a escolha do motor FlashAR e a reprodutibilidade do WorldArena por desenvolvedores terceirizados antes de usar os pesos abertos como um kit de fábrica pronto para dados para robótica de produção.

