Anthropic lança Claude Fable 5.1 e Claude Mythos 5.1 com características aprimoradas e restrições reduzidas
Leia mais
Olhar Digital
olhardigital.com.br

Anthropic lança Claude Fable 5.1 e Claude Mythos 5.1 com características aprimoradas e restrições reduzidas

A Anthropic apresentou nesta terça-feira (dia 1) novas versões de sua linha avançada de modelos de inteligência artificial — Claude Fable 5.1 e Claude Mythos 5.1. Estas atualizações combinam aumento de desempenho com mudanças que reduzem o custo de uso e o número de acionamentos dos mecanismos de segurança do Fable.

O modelo Fable 5.1 é destinado ao público em geral e está disponível através da API da Anthropic, bem como em plataformas de computação em nuvem. Enquanto isso, o Mythos 5.1, que utiliza a mesma base de modelo, permanece disponível apenas para parceiros selecionados da Anthropic envolvidos em pesquisas em cibersegurança e ciências da vida.

Novos avanços em desempenho

A empresa afirma que os novos modelos estabelecem um novo padrão de desempenho em tarefas relacionadas a programação e processamento de conhecimento. De acordo com testes publicados pela própria Anthropic, o Fable 5.1 obteve um resultado de 52,6% no teste Terminal-Bench-Science 0.1, destinado a pesquisas científicas realizadas por agentes de IA, o que é significativamente superior ao resultado do Fable 5, que foi de 24,7%.

No teste Terminal-Bench 4.0, focado em programação via terminal, o Fable 5.1 alcançou 55,8%, em comparação com 42% do Fable 5. O Mythos 5.1, por sua vez, demonstrou um resultado ainda maior — 60,9% no mesmo teste. Além disso, o novo modelo obteve 77,9% no modo parcial do teste OSWorld 2.0 e 41,7% na versão mais rigorosa deste teste. No exame Humanity’s Last Exam, o Fable 5.1 obteve 60,9% sem o uso de ferramentas e 65% com o seu uso.

Melhoria nos mecanismos de segurança e privacidade

Uma mudança importante foram os mecanismos de segurança. Anteriormente, o Fable 5 era criticado por bloquear solicitações legítimas quando os sistemas detectavam uma possível conexão com áreas de alto risco, especialmente no campo da cibersegurança. A Anthropic declara que, com o Fable 5.1, essas funções de proteção foram aprimoradas para minimizar falsos positivos.

A empresa explica que o Fable 5.1 e o Mythos 5.1 são essencialmente o mesmo modelo, e parte das diferenças nos testes anteriores estava relacionada à intervenção dos sistemas de segurança. A Anthropic aponta que, com a intervenção dessas proteções em certos testes, as tarefas de cibersegurança são redirecionadas para o Claude Opus 4.8, e as biológicas para o Claude Opus 5, o que poderia ter diminuído o desempenho registrado do Fable em algumas avaliações.

Além disso, houve uma modificação significativa na política de privacidade: a Anthropic começou a oferecer a opção Zero Data Retention. Isso permite que os clientes utilizem os modelos em sua própria infraestrutura, garantindo que os dados não saiam desses ambientes. Embora o sistema continue monitorando possíveis abusos por parte de usuários ou agentes, os clientes ganham maior controle sobre como esse monitoramento é realizado. A Anthropic também enfatizou que nunca treinou seus modelos com dados corporativos sem permissão explícita e não planeja fazer isso no futuro.

Resultados de usuários iniciais

Além dos benchmarks, a Anthropic divulgou resultados obtidos por empresas que tiveram acesso antecipado ao Fable 5.1. Por exemplo, a firma de investimentos Millennium relatou que o modelo conseguiu descobrir a causa de uma falha extremamente rara em seus sistemas internos, que permaneceu inexplicável para engenheiros por anos. O modelo analisou uma biblioteca externa, comparou o código com um dump de kernel e identificou o problema nessa biblioteca como a fonte da falha.

A MongoDB observou que o Fable 5.1 é capaz de investigar o código e a documentação de seus serviços, desenvolver um protótipo complexo e operar por horas sem supervisão, utilizando ciclos de autoavaliação para avaliar seu trabalho. A Anthropic também afirmou que os modelos demonstraram resultados científicos antes do lançamento oficial, incluindo a criação de um mapa de alta resolução de Vênus com base em fotografias existentes e otimização individual de GPU.

Apesar do progresso, a documentação interna de segurança da Anthropic observa que o Mythos 5.1 demonstra uma pequena deterioração em comparação com o Opus 5 em certos cenários de divergência. De acordo com o documento, o modelo aceita ligeiramente mais solicitações relacionadas a uso indevido e alegações de autorização que não podem ser verificadas, embora seja menos propenso a ignorar restrições explícitas, inventar dados de entrada ou afirmar falsamente a conclusão de uma tarefa em comparação com modelos anteriores.

Popular