A Songyan Dynamics lançou o HERON-CRA (Context Reinforcement Action Model), que é o segundo modelo em sua série HERON, após o lançamento do HERON-World Model na semana passada. A empresa posiciona o HERON-CRA como um modelo fundamental que combina contexto, aprendizado por reforço e ações, projetado para ajudar robôs a memorizar o histórico de tarefas, corrigir erros e transferir habilidades entre diferentes robôs.
O lançamento é definido por três componentes principais. O Especialista em Contexto (Context Expert) codifica o histórico multimodal em tokens espaço-temporais 4D estruturados, permitindo que a política considere não apenas o quadro atual, mas também exibindo janelas de memória que excedem um minuto. O Mecanismo de Aprendizado por Reforço (RL Engine) funciona como um ator-crítico residual leve, reutilizando chaves e valores congelados do Especialista em Contexto, aprendendo ações corretivas quando a simulação começa a desviar por conta própria.
O pré-treinamento entre corpos (Cross-embodiment pretraining) combina teleoperação, simulação, dados no estilo UMI e vídeos de primeira pessoa coletados de vários manipuladores, plataformas com rodas, garras e mãos ágeis. Isso permite que, após o treinamento, o modelo seja aplicado a novas morfologias com menor necessidade de ajuste fino.
As demonstrações destacam o ganho de desempenho declarado. Na tarefa de dobrar meias com objeto macio, o Scalabot relata um aumento de sucesso de 38,5% ao usar apenas simulação para 97,8% após a ativação do RL Engine. Vídeos individuais mostram uma sequência de preparo de café de longo horizonte — desde moer até despejar leite — concluída em menos de 30 segundos. Além disso, foi demonstrada a transferência desse conjunto de habilidades entre o manipulador ARX e o humanóide com rodas Noetix M1. O modelo também é capaz de se recuperar se a xícara for movida durante a captura e continua alguns movimentos durante uma breve obstrução da visão.
Do ponto de vista técnico, o Especialista em Contexto e o Especialista em Ação são treinados como uma mistura de transformadores. O caminho de aprendizado por reforço adiciona um modelo de valor com restrições de diferença temporal e pode reproduzir trajetórias imaginárias através do HERON-World Model sem riscos de hardware adicionais. Embora equipes independentes possam querer replicar as métricas de dobrar meias e café em seu próprio equipamento, este lançamento fornece um algoritmo claro — memória, RL residual e pré-treinamento entre corpos — para executar manipulações domésticas de longo horizonte, que vão além das demonstrações de um único passo.

