A MiniMax apresentou os pesos do modelo H3-Base de código aberto na plataforma HuggingFace. Este modelo é um Omni-Transformer monolítico denso com 33 bilhões de parâmetros, equipado com VAE com compressão espacial de 16x e temporal de 4x. Além disso, o custo de uso via API é um terço do preço do Seedance 2.0.
O modelo H3 é um sistema universal de geração de todas as modalidades, ao contrário dos modelos projetados apenas para conversão de texto em vídeo ou imagem em vídeo. Ele é capaz de entender contextos de texto, imagens, vídeos e áudio e, em seguida, gerar vídeo com som estéreo nativo. Arquitetonicamente, o H3 não é uma conexão sequencial de modelos de vídeo e áudio.
A rede principal, H3-Omni-Transformer, é implementada como um Transformer monolítico denso com 33 bilhões de parâmetros, sendo que cerca de 13 bilhões de parâmetros estão no ramo AdaLN, cujos resultados de modulação podem ser pré-calculados e salvos para inferência mais leve. O codificador de texto é realizado pelo H3-Encoder, os dados visuais pelo H3-Encoder e H3-VisualVAE, e o áudio pelo H3-AudioVAE; todos esses elementos são integrados em uma única sequência que é predita conjuntamente para latentes de vídeo e áudio.
A MiniMax aprimorou o H3-VisualVAE, implementando compressão espacial de 16x e compressão temporal de 4x. Após um patch adicional, a redução efetiva de resolução espacial dos tokens de vídeo que entram no Transformer atinge um nível de 32x, o que reduz os custos computacionais na geração de vídeo de alta resolução. A composição completa da MiniMax H3 inclui três componentes: H3-Context-IR, H3-Base e H3-Regenerate-2K. O H3-Context-IR interpreta o texto, imagens, vídeos e áudios fornecidos pelo usuário, estruturando instruções multimodais complexas em representações intermediárias adequadas para modelos generativos. O H3-Base é responsável pela geração real de vídeo e áudio com saída primária em resolução 768P. O componente H3-Regenerate-2K utiliza regeneração em contexto para obter uma versão 2K a partir do resultado 768P, mantendo o contexto original. Atualmente, o componente H3-Base possui pesos abertos.
A política de preços torna o H3 um fator significativo de mudança de mercado: a geração em resolução 2K custa 0,8 yuan por segundo, e em 768P é mais barato, sendo a entrada de áudio gratuita e até cinco imagens fornecidas gratuitamente. Em termos de desempenho, o H3 demonstra competitividade em comparação com o Seedance 2.0 da ByteDance por um terço do custo, e a implantação local em duas placas RTX 5090 ou uma RTX 6000 zera os custos. Graças aos recursos de ponta, preço vantajoso e pesos abertos, a iniciativa de criação de vídeo se torna acessível a qualquer desenvolvedor.
O lançamento deste modelo intensifica a concorrência no mercado de geração de vídeo por inteligência artificial. O Seedance 2.0 dominava anteriormente graças à geração conjunta unificada de áudio e vídeo, e o MiniMax H3 reivindica diretamente essa posição, oferecendo funcionalidade comparável com custos significativamente menores. Para criadores de conteúdo e desenvolvedores, o H3 oferece flexibilidade indisponível em plataformas fechadas, incluindo a possibilidade de implantação local para fluxos de trabalho sensíveis a dados, ajuste fino personalizado e integração com pipelines de produção existentes. A estratégia de pesos abertos está alinhada com a tendência global de empresas chinesas de IA usarem código aberto e precificação agressiva para resistir a ecossistemas fechados. Assim, o H3 revisita a economia da geração de vídeo por IA, contestando a suposição de que modelos de vídeo avançados devem ser serviços em nuvem caros, e potencialmente acelerando a adoção em publicidade, comércio eletrônico, produção cinematográfica e criação de conteúdo, onde antes o uso era limitado pela sensibilidade ao custo.

