A Huawei apresentou o X-Router, um roteador de modelos auto-desenvolvível que faz parte da plataforma openJiuwen. Esta plataforma, desenvolvida pelas equipes da Huawei Cloud, Laboratórios Huawei desde 2012, bem como por universidades e desenvolvedores empresariais, destina-se ao trabalho com agentes de IA.
Anunciado em 2 de outubro, o X-Router funciona entre o agente e os modelos que ele invoca. Sua tarefa é determinar, para cada solicitação recebida, qual modelo deve processá-la: tarefas simples são direcionadas a modelos leves e de baixo custo, enquanto as complexas são enviadas aos mais potentes.
A equipe observa que o sistema é amigável ao Ascend e, durante os testes, permitiu reduzir o consumo de tokens em mais de 50%.
Princípio de funcionamento e arquitetura
O X-Router representa um dos algoritmos no mecanismo de roteamento de modelos do openJiuwen. Ele possui um núcleo em Rust e uma extensão em Python, e seu código está disponível no GitHub e AtomGit sob a licença Apache-2.0.
O classificador Qwen3-0.6B, operando no processo host, analisa o diálogo e atribui-lhe um dos cinco níveis de complexidade: SIMPLE, MEDIUM, COMPLEX, RESEARCH ou REASONING. Solicitações que correspondam ao nível definido ou abaixo são processadas por um modelo local, enquanto as mais complexas são enviadas a um modelo em nuvem correspondente a esse nível.
Além disso, se o modelo de destino começar a funcionar incorretamente, o roteador muda automaticamente para usar um modelo local em vez de escalar o problema.
O mecanismo suporta perfis de capacidade para cada modelo, criados offline com base em dados históricos e atualizados em um minuto quando a versão ou o desempenho do modelo mudam. Em cada etapa, ele estuda a conversa recente e o progresso da invocação de ferramentas, levando em conta a última solicitação do usuário, e também pondera parâmetros de sistema como proximidade ao KV-cache, carga atual e o fato de ter havido um timeout ou limitação de velocidade recente do modelo.
Adicionalmente, um bandido contextual opcional é treinado com base nos resultados de solicitações passadas semelhantes e pode anular a decisão do classificador se outro nível mostrar um resultado claramente melhor, mantendo a escolha original se a base de evidências for fraca.
Como os algoritmos de roteamento são funções puras e a memória é armazenada em uma camada de estado separada, a perda desse estado apenas retorna o sistema ao roteamento frio, prevenindo falhas nas solicitações.
Resultados dos testes
A equipe integrou o X-Router no WorkSwarm, ambiente de trabalho de agentes openJiuwen, e realizou todas as 147 tarefas do PinchBench em 11 categorias. Ao enviar cada solicitação para o Kimi-K2-Thinking, foi alcançado um índice de 71,36% com um custo de modelo de US$ 11,11. O roteamento estático usando o X-Router mostrou 66,3% com custos de US$ 8,25.
Com a ativação do treinamento do bandido, o resultado melhorou para 70,70%, e o custo caiu para US$ 6,16, cerca de 44,6% menor que o nível base.
No Terminal-Bench através do LLMRouterBench, utilizando o pool de modelos Opus 4.8, Qwen3.5-122B e Qwen3.5-35B, a configuração orientada para economia atingiu 95,2% de sucesso com 51,4% menos custo em comparação com o Opus, e a configuração orientada para qualidade mostrou 98,6% com redução de custos de 15,7%.
O roteador também está integrado com a funcionalidade de colaboração multimodelo MoA no WorkSwarm, permitindo decidir quando vários modelos devem responder a uma pergunta complexa antes que seus resultados sejam combinados. A equipe planeja o desenvolvimento futuro de funcionalidades auto-desenvolvíveis, incluindo o treinamento de estratégias de roteamento usando aprendizado por reforço.
