IQuest Research lança o modelo IQuest-Q1: MoE de 320B com 15B de parâmetros ativos para codificação por agentes
Leia mais
Pandaily
pandaily.com

IQuest Research lança o modelo IQuest-Q1: MoE de 320B com 15B de parâmetros ativos para codificação por agentes

A IQuest Research divulgou publicamente o modelo IQuest-Q1, que é um modelo de linguagem esparso do tipo 'mixture-of-experts' (MoE), desenvolvido para tarefas de codificação, raciocínio e uso multietapa de ferramentas no contexto de agentes. O volume total de parâmetros do modelo é de cerca de 320 bilhões, sendo que aproximadamente 15 bilhões de parâmetros são ativados para cada token.

Os pesos e o cartão do modelo foram publicados na plataforma Hugging Face sob a organização IQuestLab em 28 de setembro, e o código para inferência está disponível no GitHub sob uma licença especial IQuest-Q1. A equipe posiciona o IQuest-Q1 como um modelo fundamental para sistemas de linha de comando de agentes.

Características técnicas e treinamento

De acordo com o cartão do modelo, o IQuest-Q1 possui 88 camadas Transformer, 256 especialistas, dos quais oito são ativados por token. O modelo utiliza um padrão híbrido de atenção, combinando três camadas de janela deslizante e uma camada de atenção completa, além de suportar uma janela de contexto de 524.288 tokens. Camadas para previsão de múltiplos tokens estão previstas para suportar decodificação especulativa.

A IQuest recomenda usar o modelo com SGLang ou vLLM em oito unidades de processamento gráfico (GPU) e executá-lo dentro de ambientes como Claude Code ou Codex. O processo de pré-treinamento e treinamento intermediário incluiu um desvio de dados em direção a código e disciplinas STEM, bem como a adição de trajetórias de agentes com contexto mais longo, seguido por três fases focadas em trabalho de agentes.

A IQuest sintetizou tarefas juntamente com seus ambientes, incluindo APIs reais, servidores MCP e repositórios executáveis, treinando uma única política em múltiplos ambientes. Métodos de aprendizado por reforço permitiram a criação de quatro modelos de especialistas para diferentes cenários — experiência do usuário do agente, operação em múltiplos ambientes, tarefas de longo horizonte e operação geral do agente. Esses modelos foram então unificados em um único estudante através de destilação de política multi-professor.

Resultados de teste

Ao ser testado em benchmarks publicados, o IQuest-Q1 demonstrou os seguintes resultados: 64.6 no DeepSWE v1.1, 63.0 no NL2Repo, 84.5 no CyberGym, 83.2 no Terminal-Bench 2.1, 55.7 no JobBench e 29.6 no Agents' Last Exam. Uma tabela comparativa mostra que o modelo supera o GLM-5.3 e o DeepSeek-V4-Pro no NL2Repo, mas fica atrás do DeepSeek-V4.1-Flash nos testes DeepSWE e CyberGym. Os resultados de outros modelos estão disponíveis publicamente, quando possível.

A IQuest também enfatizou que o modelo foi desenvolvido sob controle humano. Em um caso descrito no blog da IQuest, o IQuest-Q1, operando no Claude Code, descobriu que a desaceleração da curva de recompensa foi causada por um espaço extra inserido durante a decodificação do texto, o que fez com que apenas o último passo das trajetórias multi-passo permanecesse na função de perda de treinamento. Após a correção desse erro, a recompensa média foi restaurada. Os pesquisadores mantiveram o controle sobre a direção da pesquisa, experimentos dispendiosos e seleção de versões para implementação. A equipe alerta que o modelo é textual, está em estágio inicial e requer monitoramento humano constante ao executar tarefas reais de linha de comando.

Popular