O Shanghai Artificial Intelligence Laboratory (Shanghai AI Lab) disponibilizou o Intern-Decision, uma família de modelos compactos para tomada de decisões. Esses modelos foram lançados em 28 de setembro em três tamanhos de parâmetros: 0.8B, 2B e 4B. Em vez de gerar longos trechos de texto, o Intern-Decision foi projetado para fornecer diretamente um julgamento estruturado juntamente com probabilidades para cada resposta possível.
O conceito de design é baseado no princípio de 'decisão, não string'. O Intern-Decision suporta três tipos de perguntas. A pergunta de escolha exige que o modelo selecione a melhor opção de uma lista predefinida e atribua uma probabilidade a cada opção. A pergunta de avaliação solicita uma classificação em uma escala definida pelo usuário. E a pergunta de sim/não retorna uma resposta binária com a probabilidade correspondente. Além disso, uma única solicitação pode combinar vários tipos de perguntas sobre o mesmo estado, e todos são processados em uma única passagem para frente.
Integração da percepção visual
De acordo com o repositório do projeto no GitHub, os modelos são ajustados finamente no núcleo de linguagem Qwen3.5, enquanto a torre de visão e o projetor permanecem congelados. Isso permite que o Intern-Decision aceite imagens como parte dos dados de entrada, fazendo com que a percepção visual influencie diretamente a fase de tomada de decisão. A equipe demonstrou essa capacidade em tarefas relacionadas a jogos e interfaces: o modelo analisa quadros brutos de jogos, incluindo mapas de grade bidimensionais e níveis com rolagem lateral, e seleciona autonomamente a próxima ação. Outras demonstrações abrangem controle do mouse e uso de navegador.
Resultados de teste e desempenho
O laboratório relata que o modelo de 4B atinge uma precisão média de 90,02% em sete conjuntos de teste, o que é 1,28 pontos percentuais superior aos 88,74% do modelo comercial de tomada de decisões Jev, usado como principal referência. Esses conjuntos de teste incluem tipos de decisões, chamada de ferramentas, classificação de notícias e detecção de invasões, totalizando mais de 10.000 linhas de teste. O repositório também indica uma latência média de solicitação local de cerca de 44 milissegundos ao usar uma única placa de vídeo de consumidor RTX 4090, e fornece resultados de calibração em um benchmark com distribuição de 96 casos. Deve-se notar que esses indicadores são auto-relatórios dos desenvolvedores, e o repositório enfatiza que os protocolos e escopos de avaliação diferem entre os modelos.
O lançamento inclui código de treinamento, dois backends para inferência, ferramentas para contagem de resultados de benchmarks, pré-ajustes de calibração de temperatura e uma versão demo do navegador; no entanto, os dados de treinamento e alguns registros fechados de validação não estão incluídos. Os pesos dos modelos foram publicados no Hugging Face.
O fabricante local de GPUs, MetaX, anunciou que concluiu a adaptação Day-0, portanto, o Intern-Decision funciona em seu hardware desde o lançamento. A MetaX afirma que, a partir de dezembro de 2025, ela fornecerá suporte Day-0 para 40 modelos principais de ponta, e seu stack de software MXMACA suporta mais de 40 frameworks de IA e mais de 1000 modelos.
Para desenvolvedores que criam agentes, roteadores e filtros de conteúdo, pequenos modelos que fornecem probabilidades calibradas em vez de texto livre podem tornar as decisões automatizadas mais econômicas, rápidas e fáceis de auditar.
