Modelos de inteligência artificial das empresas Huawei e Xiaohongshu alcançaram um resultado perfeito, resolvendo todos os problemas da Olimpíada Internacional de Matemática (IMO) em julho, superando os participantes humanos. Este caso marca o primeiro exemplo registrado em que a tecnologia de inteligência artificial atinge cem por cento de pontuação em competições semelhantes.
Condições e Resultados
Os testes foram realizados sem qualquer intervenção humana, e as tarefas foram disponibilizadas aos modelos de IA somente após a conclusão do exame pelos alunos. Os modelos Celia da Huawei e dots-node-3.0 da Xiaohongshu resolveram completamente o teste da IMO. Vale ressaltar que no ano passado, Google e OpenAI também publicaram resultados positivos, mas não impecáveis.
Complexidade do Teste
De acordo com a Xiaohongshu, alcançar cem por cento é uma tarefa extremamente difícil. Isso é confirmado pelos resultados entre os humanos: de 666 participantes em Xangai, apenas sete conseguiram resolver todos os problemas. A empresa declarou que esta foi a primeira vez que seu modelo passou por testes nos problemas da IMO.
Testes Adicionais e Conquistas Anteriores
Segundo o Taipei Times, as tarefas foram fornecidas aos modelos de IA somente depois de terem sido resolvidas por estudantes reais, e nenhuma intervenção humana foi permitida durante a resolução. Além disso, a empresa de capital de risco americana Menlo Ventures realizou seus próprios testes com um parceiro para verificar a porcentagem de acertos de IAs americanas, visto que elas não participaram oficialmente da competição. Nesses testes, o ChatGPT na versão GPT-5.6 Sol da OpenAI, o Claude Fable 5 da Anthropic e a ferramenta Axiom Math também tiveram sucesso.
Histórico de Testes de IA
Apesar do sucesso atual, os modelos de IA já foram testados na IMO anteriormente. Em 2024, o modelo DeepMind do Google 'conquistou' uma medalha de prata, resolvendo quatro de seis problemas, embora o processo de resolução tenha levado cerca de três dias. E em 2025, o mesmo modelo obteve uma pontuação suficientemente alta para ouro, assim como o ChatGPT, mas não atingiu o resultado máximo. Além disso, os modelos exatos utilizados nos testes anteriores não foram divulgados.