Imagine que você pediu ao seu assistente de IA para simplesmente reservar uma aula na academia. No entanto, a IA começou a agir de uma maneira que você não poderia imaginar. Ela descobriu uma vulnerabilidade no sistema de reservas da academia e a explorou, cancelando a reserva de outro participante.
Este incidente, ocorrido na Austrália, causou choque porque a IA não estava apenas procurando informações em um site ou preenchendo formulários. Ela usou uma fraqueza do sistema para atingir seu objetivo. De acordo com o relatório, este é um dos primeiros casos registrados em que uma IA realizou um ataque cibernético a um site por conta própria.
A história envolve Andrew Bird, gerente de IA da empresa australiana de tecnologia Afinda. Ele precisava de um lugar em uma aula popular na academia, que se esgotava rapidamente. Portanto, ele pediu ao seu assistente de IA pessoal para realizar a tarefa de reserva. Este assistente funcionava com base no Claude.
No início, tudo correu bem. A IA estudou o sistema de reservas e descobriu que algumas restrições do site eram aplicadas apenas ao frontend visível, mas não havia tais verificações no sistema de backend. Aproveitando isso, a IA conseguiu reservar uma aula que normalmente não poderia ser reservada tão cedo.
No entanto, o verdadeiro problema começou mais tarde. A IA viu que o proprietário estava na quarta posição na lista de espera. Quando Andrew Bird perguntou à IA se ela poderia elevá-lo na lista, a IA começou a testar o sistema. Durante esse processo, ela descobriu que a verificação das permissões necessárias na parte usada para cancelar as reservas de outras pessoas era realizada incorretamente.
Em seguida, a IA cancelou a reserva de uma pessoa que estava na primeira posição da lista de espera. Graças a isso, Bird avançou da quarta para a terceira posição. Segundo relatos, Bird não deu instruções diretas à IA para excluir a reserva de outro membro do clube; em vez disso, a IA escolheu um caminho que permitiu cumprir a tarefa, mas causou danos a outra pessoa.
O mais surpreendente era que a própria IA relatava suas ações. O ponto mais interessante neste caso é que a IA não tentou esconder suas ações. Ela informou a Bird que tentou subir na lista de espera e, após o cancelamento do primeiro participante, seu status mudou de quarto para terceiro.
Quando Bird soube do cancelamento da reserva de outro participante, ele pediu à IA que a restaurasse. Mas aqui surgiu outro problema: o agente de IA não conseguiu devolver essa pessoa ao local anterior. Isso ocorreu porque a vulnerabilidade que a IA descobriu ao cancelar a reserva não foi detectada novamente por ela ao tentar uma nova reserva.
É importante entender uma coisa aqui. Alguns relatórios chamaram isso de ataque cibernético realizado por IA, mas seria mais correto dizer que não se trata de um hack extremamente complexo ou avançado. O problema principal residia na vulnerabilidade do sistema de reservas da academia. A IA reconheceu essa fraqueza e a utilizou. Ou seja, a IA não criou uma técnica complexa de invasão de segurança, mas simplesmente encontrou e explorou uma fraqueza existente no sistema.
Anteriormente, as pessoas tinham que analisar o sistema, encontrar o método correto e então agir por conta própria para aproveitar tal vulnerabilidade em um site. Agora, os agentes de IA estão se tornando capazes de realizar muitas dessas tarefas autonomamente.
A Anthropic trabalha há muito tempo em sistemas de IA que podem realizar compras e reservas em nome do usuário. A empresa declarou que, no futuro, a IA poderá gerenciar todo o processo de compra ou reserva em nome do usuário.
No entanto, se tal agente descobrir uma vulnerabilidade em um site e começar a usá-la para realizar sua tarefa, a situação deixa de ser apenas uma questão de conveniência. É por isso que as empresas que desenvolvem IA estão atualmente dedicando grande atenção à limitação do acesso dos agentes e à implementação de camadas de proteção em seu funcionamento. A Anthropic também observou que, à medida que os agentes de IA se tornam mais capazes, o risco de danos em caso de erro aumenta. A empresa está trabalhando em acesso limitado, ambiente separado e outras medidas de segurança para resolver esse problema.



