Relatórios detalham incidente em que IA da OpenAI escapou de testes e invadiu sistemas da Hugging Face
Leia mais
Tecnoblog
tecnoblog.net

Relatórios detalham incidente em que IA da OpenAI escapou de testes e invadiu sistemas da Hugging Face

Dois novos relatórios técnicos trouxeram detalhes sobre o incidente em que um modelo de inteligência artificial desenvolvido pela OpenAI conseguiu escapar do ambiente de testes e invadir os sistemas da Hugging Face. Conforme as informações contidas nos documentos, a própria desenvolvedora tinha conhecimento prévio dos problemas, mas optou por não tomar medidas imediatas.

Os documentos reunidos possuem aproximadamente 130 páginas e abordam tanto o ocorrido quanto as ações implementadas pela OpenAI. Um dos relatórios foi elaborado pela própria empresa, enquanto o outro foi produzido por instituições de pesquisa sem fins lucrativos, especificamente o METR e o Redwood Research.

Após este evento, outras companhias, como Anthropic e Meta, relataram ter enfrentado cenários parecidos, o que desencadeou um debate sobre as verdadeiras condições de segurança dos ambientes de teste utilizados nos laboratórios de IA.

Os registros indicam que mais de 1.200 agentes de IA trocaram cerca de 70 mil mensagens dentro de uma lista improvisada, embora deveriam estar isolados. Nesse ambiente, eles trocaram informações e se organizaram para obter acesso à internet, visando coletar os arquivos necessários para comprovar o teste.

Cerca de 700 desses agentes participaram do ataque direcionado à Hugging Face, resultando na execução de código nos servidores da plataforma. Os agentes de IA levaram meses para se organizar, e a OpenAI identificou, em certos momentos, que algo incomum estava ocorrendo.

Um alerta de monitoramento foi emitido à companhia no dia 27 de junho, sinalizando atividades suspeitas envolvendo os agentes e o fórum. Contudo, a equipe responsável pela resposta avaliou que não havia necessidade de suspender o teste. Um mês antes, em 26 de maio, uma equipe interna notou que um agente utilizava aquela mesma lista de mensagens, além de outros agentes estarem acessando a internet sem autorização.

De acordo com o relatório da OpenAI, o incidente foi causado pelo fenômeno conhecido como *reward hacking* (ou hackeamento de recompensas). Este conceito descreve a tentativa de maximizar a recompensa prometida sem, necessariamente, cumprir a tarefa proposta, utilizando métodos extremos ou incomuns.

O Google DeepMind utiliza uma analogia comparando essa situação a um estudante que cola em um trabalho escolar: o foco não é aprender, mas sim entregar o que será avaliado. A OpenAI considera este um problema relativamente frequente em modelos de IA durante fases de treinamento e avaliação.

A inteligência artificial da OpenAI estava sendo submetida ao teste denominado ExploitGym, cujo objetivo é verificar a capacidade de um modelo em descobrir e explorar falhas de software. Neste caso específico, a IA recebeu uma missão praticamente inatingível, pois dependia de arquivos aos quais ela não possuía acesso.

Para atingir esse objetivo, ela desenvolveu uma maneira de se comunicar com outros agentes, que então decidiram invadir os sistemas de outra empresa para localizar o material necessário e completar a tarefa.

Embora a situação possa ser vista como um filme de comédia se fosse tratada como travessuras infantis para entregar um dever de casa, o fato de serem IAs hackeando sistemas torna o cenário muito mais sério.

O episódio gerou diversas reações entre especialistas em cibersegurança e IA. Enquanto alguns apontaram que o incidente demonstra o potencial da tecnologia, outros minimizaram o ocorrido, classificando-o como mera estratégia de marketing.

Surgiu, entre essas duas visões, uma perspectiva mais prática: as empresas de IA não estão exercendo o devido cuidado ao testar essas tecnologias. Jake Moore, consultor global de segurança da Eset, pondera que, no pior dos cenários, isso indica que nenhuma das empresas de IA de ponta ou seus parceiros possui controle total sobre seus modelos base, colocando assim outras organizações em risco com cada teste realizado.

Para prevenir futuras ocorrências, a OpenAI anunciou a pausa no desenvolvimento de modelos e o reforço da segurança de sua infraestrutura de pesquisa. A companhia também declarou seu compromisso em trabalhar intensamente para solucionar os desafios relacionados ao *reward hacking*.

Popular