A StepFun apresentou a versão preliminar do modelo Step 5, que é um modelo base com arquitetura Mixture-of-Experts (MoE) esparsa e possui cerca de 600 bilhões de parâmetros totais, sendo que aproximadamente 27 bilhões são ativados para cada token. Este lançamento é voltado para cargas de trabalho de agentes de longo alcance, incluindo desenvolvimento de código por IA, engenharia de software, análise financeira e trabalho profissional com conhecimento. O modelo suporta uma janela de contexto de um milhão de tokens e aceita entradas tanto textuais quanto gráficas. A StepFun informou que o acesso via API já está aberto, e os pesos do modelo serão disponibilizados publicamente em 15 de outubro.
Em vez de expandir a rede, o Step 5 Preview utiliza uma arquitetura Transformer estreita e profunda, composta por 92 camadas. A empresa afirma que pilhas mais profundas fornecem caminhos de transmissão de informação mais longos para raciocínio implícito de múltiplas etapas durante o preenchimento inicial prolongado, quando os agentes realizam buscas, executam código e processam resultados de uso de ferramentas. Para manter a praticidade das sessões de um milhão de tokens, o modelo inclui atenção esparsa com agrupamento de consultas (Sparse Grouped-Query Attention) com agregação de tokens em blocos. Segundo a StepFun, isso reduz o custo de seleção do indexador e top-k em cerca de um oitavo em comparação com um modelo base mais denso, ao mesmo tempo que agrupa seleções vizinhas sobrepostas.
Durante o treinamento, o foco foi no aprendizado por reforço com horizonte de longo prazo baseado em política (on-policy long-horizon reinforcement learning), bem como no alinhamento do treinamento e inferência em nível de bits na roteamento MoE. Além disso, métodos como agendamento consciente da carga (load-aware scheduling), decodificação especulativa MTP-3, MoE FP8 e descarregamento de cache KV são aplicados. A StepFun relata um aumento de mais de três vezes na aceleração do processo ponta a ponta de RL para horizonte de longo prazo e uma taxa de perda de registro de amostras abaixo de um por cento. Este modelo também é usado dentro de um pipeline de dados gerenciado por humanos, que gera tarefas complexas verificáveis em escala de milhões, abrangendo ciência, desenvolvimento de software e pesquisa em aprendizado de máquina.
No que diz respeito à análise de inteligência artificial, o Step 5 Preview alcança cerca de 44 pontos no índice de inteligência, que a StepFun classifica entre os melhores modelos de pesos abertos neste sistema de classificação. O custo da API, de acordo com os preços publicados, é de cerca de US$ 1 por milhão de tokens de entrada e US$ 2,7 por milhão de tokens de saída, com uma velocidade de saída de cerca de 100 tokens por segundo. O foco principal do modelo é a arquitetura e a eficiência do agente, o que o diferencia das versões anteriores Step 3.5 Flash e Step 3.7 Flash, enfatizando a profundidade, o contexto longo esparso e o uso confiável de ferramentas em múltiplas etapas antes que os pesos estejam disponíveis em outubro.



