Pesquisa no Brasil revela falhas em sistemas existentes de reconhecimento facial
Leia mais
Super Abril
super.abril.com.br

Pesquisa no Brasil revela falhas em sistemas existentes de reconhecimento facial

Uma pesquisadora, que é diretora executiva do Instituto da Hora (IDH) e pesquisadora da Universidade Estadual de Campinas (Unicamp), apresentou os resultados de um estudo sobre as tecnologias de reconhecimento facial utilizadas em metrôs, estádios, aeroportos e sistemas de segurança pública em todo o Brasil.

O trabalho, que serviu de base para sua dissertação de mestrado defendida em maio de 2026 no Instituto de Tecnologia Computacional da Unicamp, bem como para o artigo 'Frankenstein in the Pipeline', publicado nos anais da ACM FAccT, a principal conferência internacional sobre justiça e responsabilidade em sistemas algorítmicos, foi apresentado neste texto.

A autora explica suas descobertas e chama esse fenômeno de 'epistemicídio computacional'. Ela observa que o sistema de reconhecimento facial não 'vê' as pessoas, mas executa uma sequência fixa de operações que a ciência da computação chama de pipeline, ou linha de produção, onde cada etapa transforma os dados recebidos.

Este processo inclui a detecção facial, que determina a presença de um rosto classificável na imagem; o recorte, que isola essa área; o alinhamento, que corrige a área recortada de acordo com um modelo padronizado com a posição esperada dos olhos, nariz e boca; e, finalmente, a vetorização, que transforma o resultado em um vetor — uma lista de centenas de números representando a pessoa no sistema.

Duas consequências dessa estrutura fundamentaram a pesquisa. Tudo depende da primeira etapa: um rosto que não é detectado deixa de existir para o sistema. Além disso, o alinhamento exige a existência de um padrão, o que implica o estabelecimento de uma norma.

Para que qualquer imagem facial possa ser encaixada nas posições esperadas, o sistema precisou aprender o que é um 'rosto típico', com base em milhões de imagens analisadas durante o treinamento. A autora chama essa norma implícita de 'rosto canônico'. Sua pesquisa começou com a pergunta: rostos que se desviam dessa norma são processados com o mesmo grau de confiabilidade?

A existência de diferenças raciais nessas tecnologias não é uma hipótese nova. Em 2018, o estudo Gender Shades, realizado por Joy Buolamwini e Timnit Gebru, mostrou que sistemas comerciais de análise facial cometiam erros significativamente mais frequentemente em relação a mulheres negras do que a homens brancos. No ano seguinte, o NIST, o Instituto Nacional de Padrões e Tecnologia dos EUA, analisou centenas de algoritmos e documentou diferenças de desempenho entre grupos demográficos na maioria deles.

A reação da indústria a essas descobertas geralmente se resume a uma conclusão: as disparidades são limitações de modelos obsoletos que podem ser corrigidas com arquiteturas mais modernas e maiores conjuntos de treinamento. Embora essa suposição seja razoável e passível de verificação, era necessário realizar um teste controlado, comparando diferentes famílias de modelos em condições idênticas, para verificar se as disparidades desaparecem com o progresso técnico. Foi isso que a autora decidiu fazer.

Três modelos de famílias tecnológicas diferentes foram escolhidos. Os dois primeiros pertencem à linha YOLO, que significa 'you only look once' (você olha apenas uma vez) — modelos de detecção de objetos amplamente utilizados em câmeras e sistemas de vigilância devido à sua velocidade para operação em tempo real. O YOLOv11 utiliza redes neurais convolucionais inspiradas no sistema visual humano, que escaneiam a imagem com pequenos filtros em busca de bordas, texturas e formas, dominando a visão computacional na última década. O YOLOv12 complementa essa base com mecanismos de atenção, permitindo que o modelo dê maior peso às áreas da imagem consideradas importantes.

O terceiro modelo, RT-DETRv2, pertence à família Transformer — uma arquitetura que processa a imagem simultaneamente, conectando todas as suas partes, e serve de base para sistemas como o ChatGPT, sendo frequentemente apresentado como o 'estado da arte' nessa tecnologia.

Os três modelos foram avaliados no mesmo conjunto de dados, Casual Conversations v2, criado pela Meta para avaliar a justiça. São 26.467 vídeos com 5.567 participantes remunerados que consentiram em usar imagens de seus rostos em pesquisas de justiça algorítmica, gravados em sete países, incluindo o Brasil. Os participantes indicaram autonomamente atributos como idade e sexo. Os anotadores treinados classificaram o tom de pele visível usando escalas padronizadas, e as condições de filmagem, incluindo variações de iluminação, foram documentadas. Essa abordagem permitiu medir as taxas de erro de detecção separadamente para cada grupo, em vez de tirá-las uma média geral.

O resultado central é o seguinte: todas as três arquiteturas demonstram padrões de disparidade semelhantes quanto ao tom de pele, errando consistentemente em relação aos mesmos grupos. Se três máquinas com anatomias diferentes erram nos mesmos rostos, o problema não pertence a nenhuma delas individualmente. Pertence ao que elas têm em comum: o método de produção, seus dados, seus padrões e a definição implícita de rosto. Assim, a promessa de que a próxima geração de modelos resolverá os problemas de desigualdade não encontra apoio nos dados coletados pela autora.

Até agora, a conclusão é empírica. O próximo passo da dissertação é conceitual: qual nome dar a esse fenômeno? O léxico aceito fala em 'viés algorítmico', sugerindo um desvio técnico que pode ser corrigido por calibração. A autora argumenta que tal quadro descreve o erro, mas oculta o mecanismo que o gera e o que ele faz com as pessoas afetadas. A escolha das palavras também tem implicações institucionais: ao ser vista como um bug, o problema permanece sob a jurisdição exclusiva dos fabricantes de sistemas.

A alternativa da autora baseia-se no conceito de epistemicídio, desenvolvido pela filósofa brasileira Sueli Carneiro em sua tese de doutorado para designar a desqualificação sistemática de conhecimentos e modos de existência de grupos racializados como parte do racismo, e não como um acaso dele. Em sua tese, a autora expande esse conceito para o campo técnico. 'Epistemicídio computacional' é o processo pelo qual o sistema cria uma norma de rosto, impõe essa norma como critério de reconhecimento e nega a existência computacional daqueles que não correspondem a ela, sob o pretexto de objetividade matemática.

Frankenstein, criado por Mary Shelley, assim deixa de ser uma ilustração e passa a ser um método de leitura. O romance forneceu uma estrutura analítica que a métrica de precisão não capta: um ser composto de partes cortadas, dotado de autoridade, mas sem responsável por ele.

O pipeline dos sistemas de reconhecimento facial reproduz essa estrutura. Ele desmembra o rosto em fragmentos, reconstrói um substituto numérico e começa a agir com autoridade prática sobre vidas, sem auditoria externa, sem reprodutibilidade pública e sem canal de contestação para aqueles que são classificados.

A pesquisa da autora não pede o abandono de toda a visão computacional nem avalia as intenções de ninguém. O que ela apoia com base nos dados é mais específico. Quando o dano reside no método, a calibração do resultado não o elimina: um sistema de identificação facial de alta precisão implementado em um sistema de segurança pública que já foca em abordagens a populações negras e periféricas apenas acelera e dificulta a contestação dessa concentração.

Portanto, a autora defende o que ela chama de 'recusa precisa': a recusa de certas operações, como o reconhecimento facial na segurança pública, cujo dano não depende da arquitetura, e o investimento no que ela chama de 'correção computacional': princípios para sistemas auditáveis e contestáveis, criados com a participação de populações que até agora só entraram nos bancos de dados como matéria-prima.

O ser imaginado por Mary Shelley há mais de dois séculos tornou-se monstruoso não por causa do material de que foi feito, mas porque ninguém quis assumir a responsabilidade por ele. A disseminação e a proposição de soluções para os erros cometidos por seres digitais que criamos e instalamos em nossas cidades — com o poder de julgar e influenciar os destinos das pessoas — é um trabalho que começa aqui.

_

Histórias semelhantes

Meta registra patente para óculos inteligentes com reconhecimento facial e gravação automática
Leia mais
olhardigital.com.br

Meta registra patente para óculos inteligentes com reconhecimento facial e gravação automática

A Meta protocolou um pedido de patente nos Estados Unidos para um sistema de câmeras equipado com reconhecimento facial, capaz de identificar indivíduos e registrar automaticamente suas atividades em formato de vídeo. Este pedido, enviado em fevereiro e divulgado recentemente, detalha a aplicação dessa tecnologia em dispositivos vestíveis, como óculos inteligentes.

A concepção da empresa prevê o uso de inteligência artificial (IA) para organizar os registros e criar pequenos clipes focados em momentos específicos de cada pessoa. Contudo, essa inovação reacende debates importantes sobre a vigilância contínua e a violação da privacidade em ambientes públicos.

A documentação técnica, que abrange dezenas de páginas com ilustrações e explicações detalhadas, demonstra como uma câmera integrada a um aparelho pode analisar o cenário em tempo real. O processo inicia-se com a captura de imagens pela câmera dos óculos ou de um equipamento conectado, seguida pela análise do ambiente pela IA e aplicação do reconhecimento facial, permitindo ao software saber quem está no campo de visão do usuário.

Adicionalmente ao reconhecimento facial, a tecnologia consegue detectar movimentos corporais e comportamentos. Por exemplo, o sistema identifica quando alguém pega um item, entra em um local ou se une a um grupo. Com base nessas detecções, o programa gera arquivos de vídeo rotulados com o nome da pessoa, a ação realizada e o momento exato.

Esses segmentos de vídeo são então transmitidos para o celular, óculos ou headset do usuário. O propósito deste recurso é eliminar a necessidade de o usuário vasculhar manualmente gravações extensas; em vez disso, ele recebe um resumo organizado das atividades capturadas.

A divulgação desta patente ocorre em um período sensível para a companhia de Mark Zuckerberg. Recentemente, pesquisadores descobriram códigos ocultos de reconhecimento facial no aplicativo associado aos óculos inteligentes da Meta, o que gerou uma reação negativa e levou a empresa a remover tal funcionalidade do sistema imediatamente.

Em uma declaração enviada ao Olhar Digital em meados de julho, a Meta afirmou: «Estamos desenvolvendo produtos que ajudam milhões de pessoas a se conectar e melhorar suas vidas. Embora escutemos com frequência sobre o interesse nesse tipo de recurso – e alguns produtos já existam no mercado – ainda estamos avaliando as opções e adotaremos uma abordagem cuidadosa se e antes de lançarmos qualquer coisa. Uma decisão que podemos deixar clara – não estamos construindo um banco de dados facial.»

Especialistas consultados pelo Olhar Digital alertam sobre os riscos inerentes a este tipo de monitoramento, destacando que a maior preocupação reside no rastreamento de pessoas em áreas públicas sem o seu consentimento. A capacidade de gravar ou identificar terceiros sem um sinal visual explícito, como uma luz indicadora acesa, eleva os perigos à intimidade.

No Brasil, a Lei Geral de Proteção de Dados (LGPD) estabelece diretrizes para a coleta de dados pessoais. Embora fotografar casualmente na rua seja permitido, converter o rosto de um desconhecido em um dado biométrico para identificação automática requer fundamentos legais bem definidos, e as empresas desenvolvedoras desses sistemas devem aderir a rigorosas normas de transparência.

Devido a essas ameaças à privacidade, o uso de óculos inteligentes pode enfrentar restrições em vários locais. Estabelecimentos comerciais, cinemas e órgãos governamentais, por exemplo, têm amparo legal para impedir a entrada de pessoas utilizando tais aparelhos, sendo esperada um aumento na fiscalização à medida que estas tecnologias chegam ao mercado.

Popular