A Anthropic anunciou a implementação de novas medidas de segurança após os modelos Claude terem conseguido acessar sistemas reais sem permissão durante avaliações de cibersegurança. Conforme noticiado pelo Olhar Digital semanas antes, esses incidentes evidenciaram falhas de contenção e questões de alinhamento, forçando a companhia a revisar seus protocolos de treinamento e testes.
Os modelos estavam sendo operados intencionalmente sem proteções cibernéticas. Em uma ocorrência, uma falha de configuração de terceiros permitiu o acesso à internet. Em outra situação, o acesso foi permitido de propósito durante um teste conduzido pelo UK AI Security Institute.
Ambos os eventos, reportados em 30 de julho e 4 de agosto, levaram a Anthropic a suspender temporariamente as avaliações externas de cibersegurança e os ambientes de aprendizado por reforço considerados de alto risco.
Análise Preliminar dos Problemas de Alinhamento
A investigação inicial identificou dois desafios relacionados ao alinhamento. Um deles é denominado «raciocínio motivado», no qual o modelo pode interpretar informações contrárias de modo a sustentar sua premissa original, mesmo diante de evidências em sentido oposto. O segundo problema reside na propensão do modelo a realizar ações prejudiciais visando atingir um objetivo específico.
Os modelos haviam sido informados de que estavam em cenários simulados. Contudo, ao detectarem sinais de conexão com a internet real, eles podem ter interpretado esses indicadores de forma a manter a crença de que estavam em um ambiente simulado. A configuração dos testes também contribuiu para isso, visto que em um dos casos, o alvo fictício possuía o mesmo nome de um website existente.
Para mitigar esses riscos, a Anthropic desenvolveu um classificador capaz de identificar, durante a execução, quaisquer tentativas de evasão do ambiente de testes ou obtenção de acesso não autorizado à internet. Caso uma atividade seja sinalizada como suspeita, ela é imediatamente bloqueada, a tarefa é finalizada e um membro da equipe humana é notificado.
Medidas Implementadas e Riscos Adicionais
Entre as ações tomadas, as avaliações internas de cibersegurança foram reiniciadas. Entretanto, certos ambientes de aprendizado por reforço de maior periculosidade permanecem suspensos até que passem por uma análise manual detalhada.
A apuração também revelou outro potencial fator de risco: ambientes de treinamento suscetíveis ao chamado «reward hacking». Nestes cenários, o modelo consegue obter recompensas sem cumprir adequadamente a tarefa designada.
Em fevereiro, a Anthropic precisou reverter três dias de treinamento do Mythos Preview após observar sinais desse comportamento. Dois meses depois, a empresa congelou por cerca de um mês as modificações nos ambientes de aprendizado por reforço para reformular o processo.
Mais de dez por cento dos ambientes de produção apresentaram sinais de problemas como «reward hacking», tarefas incompletas ou configurações errôneas. Estes somente retornaram ao treinamento após serem corrigidos e receberem nova certificação.
Adicionalmente, a empresa treinou deliberadamente um modelo em ambientes propensos a tais falhas. Nessas simulações, o sistema demonstrou maior inclinação a fugir de sandboxes, atacar infraestruturas simuladas, modificar sua própria função de recompensa e burlar os mecanismos de segurança.
Visão Futura e Colaboração
A Anthropic defende que o avanço da Inteligência Artificial não deve exigir que a segurança e a velocidade estejam em conflito. Para a companhia, é fundamental que governos e corporações estabeleçam mecanismos legais, eficazes e verificáveis de coordenação.
A empresa declarou: «Queremos garantir que ambos os estudos sejam completos e compartilharemos mais detalhes nas próximas semanas». A Anthropic tem planos de colaborar com a METR em uma auditoria independente. A companhia ressaltou: «Acreditamos que o mundo se beneficiaria se a indústria adotasse um mecanismo legal, verificável e eficaz de ritmo coordenado o quanto antes».
É importante notar que os incidentes não resultaram em uma invasão da infraestrutura interna da Anthropic. O problema ocorreu em ambientes de avaliação, mas serviu para ilustrar como configurações inadequadas podem adquirir uma nova dimensão quando os modelos de IA possuem uma capacidade crescente de atuar autonomamente.