Método Zeva da Tsinghua AIR aumenta o sucesso da manipulação incorporada de 26% para 73% sem treinamento adicional
Leia mais
Pandaily
pandaily.com

Método Zeva da Tsinghua AIR aumenta o sucesso da manipulação incorporada de 26% para 73% sem treinamento adicional

O Instituto de Pesquisa de Indústria de IA (AIR) da Universidade Tsinghua, em colaboração com a Domain Transform, apresentou um método de manipulação incorporada chamado Zeva. Este método mantém os pesos do modelo principal congelados e melhora durante a implantação exclusivamente por meio de memória causal no contexto.

Em vários benchmarks testados para manipulação incorporada, a porcentagem total de sucesso aumentou de aproximadamente 26% para 73%, representando um ganho de 47 pontos sem a necessidade de passar pelo ciclo padrão de coleta de dados, rotulagem e ajuste fino. No artigo intitulado «Zeva: Aprendizado Causal In-Contexto para Manipulação Generalizável Incorporada», o modelo Cosmos3 é usado como base, e entre os autores estão Liu Yunxin e Zhao Ting do Tsinghua AIR.

A essência da abordagem não reside em um ajuste fino mais amplo dos modelos de visão, linguagem e ação, mas sim na adição de uma camada de memória que ensina um modelo fixo como suas próprias ações alteraram a cena. O Zeva consiste em três componentes principais.

Um codificador de transferência causal liga cada ação à subsequente mudança de estado, formando o material de origem para consultas posteriores. Em seguida, a memória causal opera em duas escalas de tempo: uma trajetória de interação curta para a tentativa atual e uma memória de interação persistente mais longa que acumula experiência filtrada entre as tentativas. A separação intencional desses armazenamentos previne a contaminação imediata da memória de longo prazo devido ao ruído dos fracassos, enquanto continua a alimentar o próximo comando dentro do mesmo episódio.

Finalmente, a implementação de política no contexto insere dicas causais na entrada do modelo congelado, sem atualizações de gradiente durante a implantação. Isso significa que a adaptação ao ambiente se transforma de um problema de configuração operacional de treinamento em um problema de engenharia de contexto.

Na plataforma RoboCasa365-Atomic5, a média de sucesso atingiu 76,8%. Resultados mais notáveis foram obtidos no ChemLab-Evo, um conjunto de tarefas para laboratório químico: seleção de tubo de ensaio, movido de 65% para 100%; colocação de copo, de 25% para 70%; e despejar água, de 30% para 80%. O aumento foi mais significativo onde as métricas básicas eram mais fracas, o que corresponde à ideia de que falhas frequentes geram pares causais mais úteis.

Uma única ação demonstrativa humana adicionou cerca de 20 pontos à colocação de copo e cerca de 15 pontos ao despejo — um ganho que os autores atribuem à implementação da memória, e não à alteração dos parâmetros. Este é um ponto atraente quando os orçamentos de rotulagem são limitados.

O tema químico foi escolhido porque mudanças de estado, como nível de líquido e postura do recipiente, são relativamente limpas, fazendo com que os pares do codificador permaneçam com baixo nível de ruído; no entanto, o artigo observa que tarefas com objetos deformáveis, como lavanderia, podem ser mais difíceis. Praticamente, o Zeva troca semanas de ajuste fino específico do local por contextos mais longos e um custo de inferência por passo mais alto, que melhora com o uso. Locais que mudam raramente ainda podem preferir o ajuste fino clássico por razões econômicas. Como as plataformas robóticas independentes fora do sistema configurado Cosmos3 não estavam incluídas no pacote divulgado, as alegações de portabilidade permanecem teóricas até que outros laboratórios reproduzam a pilha de memória em hardware e taxonomias de tarefas diferentes.

Histórias semelhantes

Shengshu Technology apresenta Motus2 — um modelo mundial auto-desenvolvível para manipulações de alta precisão
Leia mais
pandaily.com

Shengshu Technology apresenta Motus2 — um modelo mundial auto-desenvolvível para manipulações de alta precisão

A Shengshu Technology lançou o Motus2, que é um modelo mundial geral auto-desenvolvível, desenvolvido especificamente para executar manipulações robóticas complexas. O cofundador e CEO Luo Yihang demonstrou este sistema no Fórum Bund em 2026.

Os autores do projeto Motus2 incluem a identidade de pesquisa da Shengshu — GensPI, bem como a Universidade Tsinghua, e o artigo técnico foi publicado no arXiv sob o número 2608.30237. Diferentemente de muitos sistemas que conectam um módulo de ação a um simulador de mundo separado, o Motus2 integra política, simulação e avaliação em uma única rede de vídeo-ação com parâmetros compartilhados.

Esta rede fornece três interfaces de controle. O modelo mundo-ação oferece blocos de ações executáveis. O modelo mundo condicionado à ação prevê os resultados visuais desses blocos. E o modelo de valor avalia os resultados previstos para seleção e aprendizado. Durante o teste, o planejamento Best-of-N analisa várias opções, imagina seu futuro e executa o ramo com maior valor antes que o robô observe novamente a cena real e replaneje.

Após o treinamento, o aprendizado por reforço baseado em modelo transforma o mesmo sinal de valor em atualizações de política, mantendo os pesos de previsão e avaliação congelados para que o feedback não apague a dinâmica aprendida. Além disso, uma máscara de informação orientada à ação impede que a política olhe para tokens de vídeo futuros antes de tomar uma decisão de ação — isso previne uma falha que a equipe associa a métodos mais simples anteriores que combinam vídeo e controle.

Ao realizar tarefas de posicionamento de telefone e operações multiponto em robôs reais, a política base alcançava sucesso em cerca de 65%. O planejamento autônomo mostrou cerca de 67,5%; o aprendizado por reforço baseado em modelo — cerca de 72,5%; a combinação de ambos os métodos garantiu sucesso em cerca de 75%. Um especialista tátil leve, que reutiliza características básicas para refinar subblocos curtos, aumentou a taxa de sucesso na extração de copos e rasgar papel de aproximadamente 60% para 72,5%.

Os dados de treinamento incluem uma pirâmide orientada ao ser humano, composta por cerca de 130.000 horas de gravações egocêntricas com vídeo monocular a estéreo sincronizado, bem como mais de 100 horas de trajetórias de robô e fusão humano-robô. A escalabilidade da imagem estéreo de 2.000 para 20.000 horas continuou a reduzir o erro de previsão de ações em testes adiados.

As demonstrações de hardware incluem plataformas de alto grau de liberdade, como Sharpa Wave e Wuji Hand 2, usadas para apertar lâmpadas, virar páginas e outros trabalhos de contato multiponto que exigem verificação tanto visual quanto tátil.

A equipe posiciona o Motus2 como um ciclo inicial de autoaperfeiçoamento recursivo dentro de tarefas limitadas — usando resultados simulados para corrigir a política, e não como aprendizado autônomo aberto em ambientes ilimitados. Para potenciais compradores envolvidos na implementação de tecnologias, o sinal chave é o ciclo fechado WAM, AC-WM e modelo de valor, bem como o ganho medido no trabalho com telefones e tarefas multiponto ricas em contato. A Shengshu vê este ciclo como progresso em direção ao seu modelo mundial geral de nível L3 para L4, sem declarar autonomia total em mundo aberto no momento.

Huawei MatePad Air aumenta o nível de produtividade ao nível de um PC graças aos recursos de inteligência artificial
Leia mais
www.khaleejtimes.com

Huawei MatePad Air aumenta o nível de produtividade ao nível de um PC graças aos recursos de inteligência artificial

O novo Huawei MatePad Air estabelece um novo padrão para produtividade no nível de um computador pessoal usando inteligência artificial, combinando desempenho profissional com ferramentas inteligentes em um corpo ultrafino e leve. Em vez de ser apenas mais um chatbot de IA, o MatePad Air integra a IA diretamente na experiência diária, tornando as tarefas mais intuitivas e rápidas para profissionais móveis e criadores jovens. O resultado é um tablet que reduz a lacuna entre dispositivos portáteis e capacidades de nível de PC.

O pacote de software de escritório WPS no nível de PC do MatePad Air foi significativamente aprimorado com recursos de IA. Todos os recursos do WPS AI estão integrados para garantir a execução perfeita das tarefas. Os usuários podem gerar tópicos, criar planos e melhorar o conteúdo com a ferramenta de IA para escrita de texto. O assistente de IA para planilhas permite realizar operações de dados, formatação, trabalho com linhas e colunas e uso de fórmulas por meio de comandos de voz. A ferramenta de IA para apresentações é capaz de extrair automaticamente pontos-chave de documentos e convertê-los em slides para criação acelerada de apresentações. Ao trabalhar com arquivos PDF volumosos, a IA pode resumir os pontos principais e até exibir estruturas, o que aumenta a eficiência da leitura. Além disso, agora é possível colaborar em projetos em tempo real com a sincronização de vários dispositivos WPS.

Até mesmo o aplicativo Huawei Notes oferece uma experiência mais inteligente com o novo recurso de conversão de fala em texto. Fazer anotações torna-se simples mesmo durante uma palestra ou reunião. Após o registro, ele converte rapidamente a fala em texto, registrando com precisão as discussões e gerando automaticamente notas estruturadas. O texto transcrito pode ser sincronizado com anotações manuscritas e destaques, simplificando o registro de pontos importantes e a adição de contexto adicional.

Para tarefas mais exigentes em trânsito, o MatePad Air pode ser complementado com o Smart Magnetic Keyboard, que pesa apenas 308 g. O teclado possui resistência a manchas em nível molecular, alta durabilidade e conforto incomparável. Graças à distância de curso das teclas de 1,5 mm e às teclas maiores, o teclado combina perfeitamente com o tablet, garantindo conexões mais rápidas e estáveis e menor latência de entrada. Ele também suporta uma ampla gama de combinações de teclas de acesso rápido para digitação no nível da área de trabalho, tornando quase todas as ferramentas necessárias ao criador acessíveis com um toque.

O MatePad Air é equipado com uma grande tela OLED PaperMatte de 12 polegadas, que é um dos melhores displays para tablets nesta faixa de preço. Em comparação com telas brilhantes tradicionais, o PaperMatte Display proporciona uma visualização mais confortável e uma sensação de escrita muito semelhante ao papel. Com resolução de 2.8K e brilho de pico de 1200 nits, ele oferece uma experiência de visualização premium, adequada tanto para trabalho quanto para entretenimento. O Huawei MatePad Air também suporta a tecnologia de taxa de atualização adaptativa na faixa de 30 Hz a 144 Hz.

Outro recurso notável do MatePad Air são as bordas praticamente invisíveis ao redor da tela. Nessas pequenas bordas de 4,69 mm, o tablet também acomodou uma câmera frontal de 12 MP, eliminando a necessidade de um recorte.

Vivendo à altura do seu nome, o MatePad Air é um tablet incrivelmente fino e leve, pesando apenas 509 g e com apenas 5,3 mm de espessura. Apesar do seu corpo fino e leve, o dispositivo não sacrifica a durabilidade. A carcaça metálica do tablet possui um acabamento premium que muda com a mudança de luz e ângulo. Este método utiliza tinta eletroforética solúvel em água ecologicamente correta e tratamento com água ultrapura de grau semicondutor para garantir uma aderência uniforme e confiável do revestimento à carcaça traseira metálica integrada. O resultado é um acabamento metálico limpo e sofisticado que melhora a aparência e quebra a monotonia dos revestimentos metálicos comuns.

Apesar do design fino e leve, o Huawei MatePad Air é equipado com uma grande bateria de 10.100 mAh, que fornece até 16 horas de reprodução de vídeo local em HDR e cerca de 10 horas de reprodução de vídeo online. Graças à tecnologia SuperCharge Turbo de 66 W, ele carrega até 42% em apenas 30 minutos e carrega completamente em 85 minutos.

Popular