Plataforma openJiuwen da Huawei fornece interface de voz e vídeo full-duplex para trabalho em NPUs Ascend
Leia mais
Pandaily
pandaily.com

Plataforma openJiuwen da Huawei fornece interface de voz e vídeo full-duplex para trabalho em NPUs Ascend

OpenJiuwen, uma plataforma de código aberto para agentes de IA desenvolvida em colaboração com os laboratórios Huawei 2012, Huawei Cloud e equipes de dispositivos e computação da empresa, bem como universidades e outros desenvolvedores, implementou no WorkSwarm — sua área de trabalho aberta para tarefas de escritório e codificação — a capacidade de interação multimodal com comunicação full-duplex.

A atualização, anunciada em 1º de outubro, permite que os usuários se comuniquem com o agente como em uma chamada telefônica normal, enquanto outro agente continua a executar tarefas mais longas em segundo plano.

Princípio de funcionamento da interação full-duplex

Comunicação full-duplex significa que o assistente pode ouvir e falar simultaneamente. Diferentemente dos assistentes de voz tradicionais que operam sob o princípio de rádio, onde o usuário é forçado a esperar pelo término da resposta da IA, agora o usuário pode interromper a resposta no meio, por exemplo, pedindo para ignorar o fundo e passar para as conclusões.

Quando o WorkSwarm detecta um novo comando de voz real, ele interrompe a resposta atual e processa a nova instrução; ao mesmo tempo, o texto gerado anteriormente é salvo no registro da tarefa. Para minimizar interrupções falsas causadas por ruídos de fundo, são usadas funções de detecção de atividade de voz e supressão de ruído.

Arquitetura de divisão de tarefas

A estrutura divide o trabalho em dois fluxos. O modelo em tempo real monitora o fluxo de vídeo, reage rapidamente e responde, enquanto o Agente Principal cuida da decomposição de tarefas, chamada de ferramentas e avanço do processo. O usuário pode apontar a câmera para um produto, perguntar sobre sua marca e, em seguida, pedir ao WorkSwarm para realizar uma pesquisa e redigir um documento. A pesquisa é executada em segundo plano enquanto a conversa continua, e a interface exibe o status da tarefa, os registros de chamada de ferramentas, os resultados obtidos e os arquivos criados.

Após a conclusão da tarefa em segundo plano, o WorkSwarm primeiro publica um resumo escrito e aguarda o término do diálogo oral atual antes de vocalizar apenas os pontos chave. Solicitações subsequentes são colocadas em fila, e os usuários podem alterar a ordem das tarefas, mover uma para o topo ou pausar tarefas pendentes ou em execução. Interromper a conversa não cancela as tarefas instrumentais, que devem ser interrompidas separadamente, e fechar a sessão de áudio e vídeo não interrompe o trabalho já delegado ao Agente Principal. Os resultados são retornados ao diálogo original.

Atualmente, o WorkSwarm suporta dois protocolos de modelos: Qwen Omni em tempo real via WebSocket, que pode usar um endpoint oficial ou implantação local, e JoyAI, que conecta modelos individuais de reconhecimento de fala, linguagem e síntese de fala através de APIs oficiais ou outras plataformas. Modelos multimodais com comunicação full-duplex também podem ser implantados em NPUs Ascend através da plataforma ModelArts da Huawei Cloud usando o framework de inferência vLLM-Omni. O WorkSwarm oferece instaladores para Windows, Mac e HarmonyOS, bem como pacotes pip, e seu repositório no GitHub é licenciado sob Apache-2.0. O último lançamento marcado do projeto, v0.2.7 de 30 de setembro, adicionou o Serviço de Contexto Proativo e sessões interagentes.

Popular