Meituan lança o modelo LongCat-2.5-Preview: agente multimodal com 1,6 trilhão de parâmetros e contexto de 1 milhão de tokens
Leia mais
Pandaily
pandaily.com

Meituan lança o modelo LongCat-2.5-Preview: agente multimodal com 1,6 trilhão de parâmetros e contexto de 1 milhão de tokens

A Meituan apresentou o LongCat-2.5-Preview em sua plataforma LongCat API em 25 de setembro de 2026. De acordo com informações da iFeng Tech, AI Tool Lab e publicações relacionadas ao produto, este lançamento é posicionado como um agente de modelo multimodal de longo prazo, e não apenas uma atualização das funções de chat. O nome oficial em inglês do produto é Meituan / LongCat.

Esta análise apresenta as especificações técnicas do produto Preview e o propósito pretendido do software de agentes. A Meituan não publicou benchmarks oficiais para este lançamento, portanto, as declarações sobre as capacidades devem ser consideradas com cautela.

Arquitetonicamente, o modelo mantém a abordagem Mixture-of-Experts utilizada no LongCat-2.0. O volume total de parâmetros é de cerca de 1,6 trilhão, sendo que aproximadamente 48 bilhões de parâmetros são ativados em cada etapa de inferência. O modelo possui uma janela de contexto integrada de um milhão de tokens, tornando-o adequado para processar documentos longos, repositórios, logs e ciclos de ferramentas de múltiplos passos.

A principal diferença em relação à versão 2.0 é a implementação da capacidade multimodal nativa diretamente no modelo base. Isso inclui o parsing de imagens para perguntas e respostas entre modalidades, bem como raciocínio visual e sumarização. Além disso, houve uma transição clara da codificação puramente baseada em agentes para o gerenciamento autônomo de fluxos de trabalho em terminais, navegadores, interfaces gráficas de usuário, planilhas e ferramentas de design.

O acesso ao modelo é fornecido em dois formatos: via API (com endpoints compatíveis com OpenAI e Anthropic, descritos em análises) e através de uma interface web em longcat.chat. O comprimento máximo do texto de saída foi definido em 128 mil tokens.

As notas de integração mencionam ferramentas como Codex, OpenCode, OpenClaw, CatPaw, Claude Code, Hermes e Kilo Code, permitindo que sistemas de agentes existentes acessem diretamente a versão Preview. Relatórios secundários citam preços promocionais, indicando um uso de entrada limitado por tempo a cerca de US$ 0,30 e de saída a cerca de US$ 1,20 por milhão de tokens, com um nível adicional de entrada com cache e tokens gratuitos para usuários atuais; os termos comerciais devem ser considerados como ofertas temporárias de Preview.

Como o LongCat-2.5-Preview não vem acompanhado de classificação pública neste ciclo, recomenda-se aos leitores que considerem as melhorias no software de agentes como uma declaração de posicionamento aguardando avaliação independente. Para desenvolvedores que acompanham agentes multimodais na China, a informação chave é que a Meituan lançou um modelo 1.6T / ~48B MoE com contexto nativo de 1M, focado em longas cadeias de operações de software, e não em históricos financeiros ou mudanças de classificação.

Histórias semelhantes

StepFun lança versão preliminar do modelo Step 5: agente com 600 bilhões de parâmetros e pesos abertos previstos para 15 de outubro
Leia mais
pandaily.com

StepFun lança versão preliminar do modelo Step 5: agente com 600 bilhões de parâmetros e pesos abertos previstos para 15 de outubro

A StepFun apresentou a versão preliminar do Step 5 em 20 de setembro de 2026 como seu próximo modelo base principal, projetado para operar agentes de longo alcance, de acordo com informações da Tencent Tech, cartões de modelos DataLearner e materiais da empresa disponíveis em stepfun.com. O nome oficial em inglês do modelo é StepFun / Step 5.

É importante notar que, embora o identificador do modelo step-5-preview já esteja disponível através da API do produto e da plataforma aberta StepFun, os pesos abertos no formato BF16 estão programados apenas para 15 de outubro de 2026 e não estavam disponíveis no momento do lançamento. Portanto, a disponibilidade via API e a abertura dos pesos devem ser consideradas como pontos separados.

A arquitetura do modelo consiste em uma mistura esparsa de especialistas (MoE) com um total de cerca de 600 bilhões de parâmetros. Aproximadamente 27 bilhões de parâmetros são ativados para cada token dentro de um Transformer de 92 camadas do tipo 'estreito e profundo'. A escolha da profundidade é determinada pelas necessidades dos agentes, pois caminhos de informação mais longos através das camadas contribuem para melhorar o raciocínio implícito de múltiplas etapas e o processamento de resultados longos de ferramentas.

O modelo suporta uma janela de contexto de um milhão de tokens, aceitando entrada de texto e gráfica (embora a entrada de vídeo seja mencionada em cartões de terceiros). Ele é orientado para aplicações em codificação de IA, desenvolvimento de software, análise financeira e uso de agentes profissionais. Para manter a praticidade da atenção de um milhão de tokens, foi aplicado GQA esparso em combinação com agrupamento de tokens em blocos, o que reduz o custo do indexador e da seleção top-k em aproximadamente um oitavo.

Durante o treinamento, especial atenção foi dada ao alinhamento de nível de bits entre treinamento e inferência para garantir a estabilidade do roteamento MoE, e foram utilizados agendamento baseado em carga, decodificação especulativa e caminhos FP8. A StepFun afirma que esses métodos aceleram o processo de aprendizado por reforço (RL) de longo alcance em mais de três vezes no geral.

De acordo com dados, o índice composto de inteligência artificial da Artificial Analysis é de 44 pontos. A empresa posiciona esta avaliação entre os principais modelos orientados para acesso aberto. Os cartões agregadores também indicam preços de API: cerca de US$ 1,00 por token de entrada e US$ 2,70 por token de saída por milhão de tokens, mas as comparações de métricas e custos devem ser vistas como declarações de terceiros ou fornecedores.

Até a data de 15 de outubro, o Step 5 Preview deve ser visto principalmente como uma API funcional para agentes de longo alcance, com apenas um compromisso planejado para pesos abertos, e não como um lançamento de pesos no Hugging Face ou como um produto intercambiável com Meituan LongCat, MiniMax Code Flash ou NaiveAI OSS MoE.

MiniMax integrou o modelo M3.1-Flash-Preview para codificação no produto MiniMax Code
Leia mais
pandaily.com

MiniMax integrou o modelo M3.1-Flash-Preview para codificação no produto MiniMax Code

A empresa MiniMax anunciou em 27 de setembro de 2026 que o modelo M3.1-Flash-Preview agora está disponível dentro do seu produto para auxiliar na escrita de código no MiniMax Code. Esta informação foi confirmada por fontes, incluindo IT Home, Startup Fortune e outras análises para desenvolvedores. O nome oficial em inglês do produto é MiniMax / MiniMax Code.

O foco principal desta análise é o modelo de codificação dentro do produto e os elementos de controle de raciocínio. No entanto, a MiniMax ainda não publicou uma especificação pública completa dos parâmetros ou uma API aberta para o M3.1-Flash-Preview, portanto, esses detalhes não podem ser confirmados.

A mensagem de marketing da empresa apresenta este modelo Preview como um modelo de texto ultrarrápido, projetado para desenvolvimento diário. Ele é adequado para tarefas como correção de erros, criação de trechos de funções, tratamento de limites, testes de regressão e verificação de impacto de mudanças, e não como um novo modelo principal para bate-papo geral.

As análises descrevem um ciclo fechado de trabalho dentro do MiniMax Code, que abrange a localização do problema e sua implementação, bem como a verificação por meio de testes e entrega subsequente. Desenvolvedores que notaram o modelo na lista de produtos um dia antes do anúncio oficial já o consideravam um SKU para cargas de trabalho de codificação, coexistindo com as versões mais antigas M3 e M2.7 em uma única interface.

A diferença prática observada nos relatórios de produto em inglês é um controle deslizante de recurso de raciocínio com cinco níveis, que se estende de um nível baixo ao novo nível máximo. Este controle deslizante permite que os usuários equilibrem a profundidade do cálculo e a latência ao executar tarefas rotineiras ou mais complexas de codificação. Este controle está dentro do MiniMax Code; o endpoint Preview é descrito como limitado à própria ferramenta da empresa, e não como uma API pública amplamente documentada neste lançamento.

As ações paralelas incluem um reset do Plano de Tokens e uma campanha de verificação de 28 de setembro a 7 de outubro, que oferece pontos duplos aplicáveis a modelos de código, incluindo o M3.1-Flash-Preview. Os usuários devem lembrar que a arquitetura M3 e as métricas do SWE-bench referem-se ao modelo principal anterior M3, e não automaticamente ao Flash-Preview, até que a MiniMax lance um cartão especial.

Para os usuários de ferramentas de codificação, a notícia principal é que o MiniMax Code recebeu o modelo de codificação Flash-Preview com um controle explícito de esforço de raciocínio — um componente integrado ao ambiente de desenvolvimento (IDE), e não um lançamento de pesos abertos.

Laboratório de IA de Xangai lança versão preliminar do modelo Atria Dawn, baseado na arquitetura MoE com 744 bilhões de parâmetros
Leia mais
pandaily.com

Laboratório de IA de Xangai lança versão preliminar do modelo Atria Dawn, baseado na arquitetura MoE com 744 bilhões de parâmetros

O Laboratório de Inteligência Artificial de Xangai apresentou o Atria Dawn Preview — um modelo de linguagem agente desenvolvido para apoiar processos complexos de pesquisa e engenharia, e não apenas para chats demonstrativos. Esta versão preliminar é baseada na fundação Mixture-of-Experts (MoE) com 744 bilhões de parâmetros, identificada como GLM-5.2.

O modelo possui uma janela de contexto de 256K e é distribuído sob a licença MIT. Checkpoints, tanto os padrão de instrução quanto os quantizados no formato FP8-instruct, estão disponíveis nas plataformas Hugging Face e ModelScope. Além disso, há acesso à API para usuários em regiões internacionais e chinesas.

De acordo com a documentação do modelo e o artigo de acompanhamento no arXiv, o sistema foi treinado usando o Verifiable Experience Pipeline (Pipeline de Experiência Verificável). Este pipeline conecta raciocínios mediados por ferramentas a ambientes executáveis e resultados verificáveis externamente. O conceito principal é o ciclo de execução completo: análise do problema, projeto da solução, chamada de ferramentas, execução de código e experimentos, verificação dos resultados e recuperação de falhas dentro de um feedback contínuo do ambiente, em vez de apenas obter uma resposta única.

O laboratório agrupou as capacidades do modelo para cenários que abrangem descoberta, criação, entrega e segurança cibernética. Esses cenários incluem pesquisa profunda, desenvolvimento de software, preparação de materiais de escritório estruturados e verificação de segurança autorizada.

Na avaliação por 16 benchmarks apresentados pelo laboratório, o Atria Dawn Preview demonstrou o desempenho mais alto em cinco tarefas. Entre elas, AutomationBench com resultado de 53.8, BrowseComp com 92.5, DeepSearchQA com 96.0, BFCL v4 com 77.0 e CyberGym com 86.5. Os outros indicadores permanecem competitivos, mas não são dominantes em comparação com modelos agentes básicos avançados.

Este lançamento difere dos desenvolvimentos anteriores do Laboratório de IA de Xangai, como Intern W0 e trabalhos relacionados ao NCP. Dawn é posicionado como um parceiro agente aberto para projetos científicos e de engenharia multifásicos, e juntamente com o lançamento dos pesos, ativos públicos foram fornecidos no GitHub e no site especial do projeto Atria.

Os desenvolvedores podem baixar os pesos para uso local através de frameworks como SGLang e vLLM, ou usar consoles de API regionais. Clientes no estilo Codex podem interagir com a Responses API usando configurações apenas de modo de texto. No entanto, recomenda-se às equipes reproduzir independentemente os resultados do AutomationBench e das cadeias de ferramentas para tarefas de longo prazo, bem como verificar as condições de licenciamento e implantação. É importante levar em consideração o rótulo 'preview', pois a confiabilidade do agente fora dos conjuntos de dados publicados permanece uma questão em aberto enquanto o laboratório avança de assistentes de tarefas para colaboração em projetos.

Popular