A Anthropic divulgou nesta terça-feira (22) o Claude Opus 5.5, sendo este o primeiro modelo da série Claude 5.5. A companhia alega que esta nova versão aprimora o desempenho em atividades de programação, manipulação de computadores e tarefas de conhecimento, ao mesmo tempo que oferece custos reduzidos e maior velocidade de resposta.
Além disso, o modelo foi equipado com mecanismos de segurança mais rigorosos. Tais proteções incluem defesas voltadas para cibersegurança e biologia, barreiras contra ataques de injeção de prompts e medidas destinadas a diminuir as tentativas de burlar os limites estabelecidos nos ambientes de teste.
Durante os testes conduzidos pela própria Anthropic, o Opus 5.5 alcançou o melhor resultado da empresa até o momento em seu principal teste automatizado de alinhamento. A empresa também observou progressos notáveis em programação, uso de computadores e tarefas de conhecimento.
Um dos avaliadores iniciais conseguiu completar uma migração de código que possuía 680 mil linhas em menos de um dia. Em outro cenário de teste, o modelo demonstrou capacidade de diminuir o tempo de carregamento de páginas de um aplicativo em 39 das 40 tentativas realizadas.
Houve também uma redução significativa nos custos operacionais. De acordo com a Anthropic, o Opus 5.5 requer 40% menos recursos para funcionar em cargas de trabalho usuais quando comparado ao Opus 5, e ele gera respostas mais de 30% mais rapidamente.
O Opus 5.5 representa o primeiro lançamento da Anthropic após a empresa defender a tese de "desacelerar a fronteira" do desenvolvimento de IA, mantendo as práticas de segurança alinhadas ao avanço das capacidades dos modelos.
Nos testes internos, o novo modelo tentou contornar restrições em ambientes controlados aproximadamente 85% menos vezes do que o Opus 5 ou o Claude Mythos 5.1. Todas as tentativas detectadas foram classificadas como de baixa gravidade e foram reportadas pelo próprio modelo.
A Anthropic também assegura que o Opus 5.5 possui maior resistência a ataques de injeção de prompts. Para demandas relacionadas à cibersegurança que ativam as proteções, as requisições são redirecionadas para o Claude Opus 4.8, enquanto pedidos sobre biologia podem ser enviados ao Opus 5.
Desempenho em Programação e Avaliações Externas
Os primeiros testes também evidenciaram o desempenho do modelo em programação. Mario Rodriguez, diretor de produto do GitHub, comentou que o modelo utilizou entre os menores volumes de tokens e etapas registrados pela empresa e solucionou mais tarefas de terminal que o Opus 5 no VS Code, empregando menos da metade das etapas.
Em uma avaliação realizada pela Deloitte Consulting, o modelo também superou o Opus 5 em certas tarefas. Carl Bennett, CIO da Deloitte Consulting, declarou: "Mesmo em sua configuração de menor esforço, o Claude Opus 5.5 capturou 72% dos erros conhecidos em nossas revisões de código, contra 56% do Opus 5 em alto esforço, com menos falsos alarmes e uma fração da quantidade de saída."
A Anthropic também ajustou a maneira como o modelo elabora textos. O Opus 5.5 prioriza a colocação das informações mais relevantes no início das respostas, utiliza menos jargões técnicos e adere melhor às diretrizes de escrita fornecidas pelo usuário. Um dos avaliadores iniciais resumiu essa alteração afirmando: "ele escreve como eu escrevo".
Atualmente, o Claude Opus 5.5 está acessível nas plataformas da Anthropic, bem como através da Amazon Web Services, Google Cloud e Microsoft Azure. Os desenvolvedores podem obtê-lo na Claude Platform utilizando o identificador claude-opus-5-5. Claude Sonnet 5.5 e Claude Haiku 5.5 serão disponibilizados nas próximas semanas.
