Scalabot HERON-CRA da Songyan Dynamics inclui memória de contexto e mecanismo de aprendizado por reforço para controle incorporado
Leia mais
Pandaily
pandaily.com

Scalabot HERON-CRA da Songyan Dynamics inclui memória de contexto e mecanismo de aprendizado por reforço para controle incorporado

A Songyan Dynamics lançou o HERON-CRA (Context Reinforcement Action Model), que é o segundo modelo em sua série HERON, após o lançamento do HERON-World Model na semana passada. A empresa posiciona o HERON-CRA como um modelo fundamental que combina contexto, aprendizado por reforço e ações, projetado para ajudar robôs a memorizar o histórico de tarefas, corrigir erros e transferir habilidades entre diferentes robôs.

O lançamento é definido por três componentes principais. O Especialista em Contexto (Context Expert) codifica o histórico multimodal em tokens espaço-temporais 4D estruturados, permitindo que a política considere não apenas o quadro atual, mas também exibindo janelas de memória que excedem um minuto. O Mecanismo de Aprendizado por Reforço (RL Engine) funciona como um ator-crítico residual leve, reutilizando chaves e valores congelados do Especialista em Contexto, aprendendo ações corretivas quando a simulação começa a desviar por conta própria.

O pré-treinamento entre corpos (Cross-embodiment pretraining) combina teleoperação, simulação, dados no estilo UMI e vídeos de primeira pessoa coletados de vários manipuladores, plataformas com rodas, garras e mãos ágeis. Isso permite que, após o treinamento, o modelo seja aplicado a novas morfologias com menor necessidade de ajuste fino.

As demonstrações destacam o ganho de desempenho declarado. Na tarefa de dobrar meias com objeto macio, o Scalabot relata um aumento de sucesso de 38,5% ao usar apenas simulação para 97,8% após a ativação do RL Engine. Vídeos individuais mostram uma sequência de preparo de café de longo horizonte — desde moer até despejar leite — concluída em menos de 30 segundos. Além disso, foi demonstrada a transferência desse conjunto de habilidades entre o manipulador ARX e o humanóide com rodas Noetix M1. O modelo também é capaz de se recuperar se a xícara for movida durante a captura e continua alguns movimentos durante uma breve obstrução da visão.

Do ponto de vista técnico, o Especialista em Contexto e o Especialista em Ação são treinados como uma mistura de transformadores. O caminho de aprendizado por reforço adiciona um modelo de valor com restrições de diferença temporal e pode reproduzir trajetórias imaginárias através do HERON-World Model sem riscos de hardware adicionais. Embora equipes independentes possam querer replicar as métricas de dobrar meias e café em seu próprio equipamento, este lançamento fornece um algoritmo claro — memória, RL residual e pré-treinamento entre corpos — para executar manipulações domésticas de longo horizonte, que vão além das demonstrações de um único passo.

Histórias semelhantes

Cambricon adaptou o modelo DeepSeek-V4.1-Flash na pilha vLLM
Leia mais
pandaily.com

Cambricon adaptou o modelo DeepSeek-V4.1-Flash na pilha vLLM

A Cambricon anunciou a conclusão bem-sucedida da adaptação do modelo DeepSeek-V4.1-Flash no âmbito do programa Day-0, utilizando a pilha de inferência open-source vLLM. Isso significa que o modelo recém-lançado pode operar de forma estável nos aceleradores Cambricon no mesmo dia em que o DeepSeek publicou o checkpoint.

Este anúncio destaca a sinergia entre chip e software: disponibilidade simultânea do modelo e do chip, bem como a maturidade da abordagem da Cambricon, que combina NeuWare e vLLM. Não se trata de repetir informações sobre a disponibilidade geral do próprio modelo.

O DeepSeek-V4.1-Flash representa a versão mais leve da nova linha arquitetônica DeepSeek. É um modelo do tipo mixture-of-experts com 552 bilhões de parâmetros, que ativa cerca de 8 bilhões de parâmetros no lado de entrada e 16 bilhões no lado de saída, além de possuir compreensão integrada de visão multimodal. O DeepSeek destaca o uso da estrutura Causal-Encoder-Decoder e a compressão agressiva do cache KV, o que reduz a necessidade de HBM em aproximadamente um quarto e de SSD em um oitavo em comparação com a geração anterior, enquanto o tamanho do cache é centenas de vezes menor do que na primeira versão.

Essas economias de memória são criticamente importantes para os fabricantes de aceleradores que buscam controlar a latência de inferência, o volume de DRAM e os níveis de armazenamento em servidores densos que já estão sob pressão orçamentária de HBM.

Por sua vez, os engenheiros da Cambricon utilizaram a biblioteca de operadores unificados Torch-MLU-Ops para acelerar estruturas como Engram e Compressor, e escreveram kernels otimizados em BangC para pontos quentes de atenção esparsa e comprimida. Dentro do vLLM, a Cambricon declara suporte a paralelismo misto de cinco dimensões, abrangendo paralelismo tensorial, pipeline, sequencial, batch e especialista, com sobreposição de comunicação e computação, quantização de baixa precisão e separação de prefixo e decodificação para aumentar o throughput de ponta a ponta. Esta pilha opera na NeuWare, plataforma de software de longo prazo da empresa.

Alguns dias antes, a Cambricon juntou-se à PyTorch Foundation como membro platina, ocupando um assento no conselho de administração ao lado de outros grandes desenvolvedores de hardware e serviços em nuvem, sinalizando investimentos mais profundos no ecossistema de aprendizado e inferência abertos.

Agora, a Cambricon suporta inferência Day-0 para cinco principais linhas de modelos chineses: GLM, DeepSeek, Qwen, Kimi e MiniMax, representando Zhipu AI, DeepSeek, Alibaba, Moonshot AI e MiniMax, respectivamente. A publicação Caixin Global destacou especificamente a capacidade de incluir a Cambricon no mesmo dia como um sinal de redução dos ciclos internos de desenvolvimento de modelos e chips na China — uma transição de portos fechados de vários meses para prontidão em frameworks públicos que já são padronizados pelos operadores.

Para os operadores de cluster, a implicação prática é a disponibilidade conjunta: quando um modelo aberto avançado é lançado, os clientes da Cambricon podem usar a receita documentada do vLLM em vez de esperar por um fork fechado. O próximo teste para o ecossistema de software será a questão de saber se este esquema Day-0 se aplica às versões maiores do DeepSeek e às misturas de serviços multimodais.

Popular