Anthropic detalha como o Claude usará marca d'água invisível para identificar textos gerados por IA
Leia mais
Tecnoblog
tecnoblog.net

Anthropic detalha como o Claude usará marca d'água invisível para identificar textos gerados por IA

A Anthropic esclareceu o funcionamento de uma marca d'água invisível destinada a textos produzidos pelo Claude. Esta tecnologia utiliza o SynthID-Text, desenvolvido pelo Google DeepMind, e será integrada durante o processo de geração das respostas.

O objetivo principal desta iniciativa é estabelecer um método de verificação para conteúdos gerados pela própria plataforma, alinhando-se às diretrizes da Lei de Inteligência Artificial da União Europeia. Este regulamento europeu entrou em vigor em 2 de agosto, exigindo que conteúdos criados por ferramentas de IA sejam rastreáveis, o que sugere a adoção de tecnologias similares em outros modelos.

Embora o SynthID já seja conhecido por aplicar marcas d'água em mídias como vídeo, imagem e áudio, introduzindo modificações sutis imperceptíveis ao olho humano, o SynthID-Text opera alterando o padrão das palavras selecionadas pelo modelo, sem comprometer a qualidade textual.

Como a marca funciona?

Em um comunicado oficial, a Anthropic descreveu que a identificação é construída sequencialmente com base nas palavras geradas pelo assistente. Os modelos de linguagem constroem o texto calculando a probabilidade estatística de cada palavra, considerando o contexto anterior, e é nesse ponto que a marca d'água entra em ação.

Para ilustrar, em uma frase como “O tempo hoje estava frio e…”, a IA avaliaria que a continuação improvável seria “açucarado”, mas poderia ser “nublado” ou “cinzento”. Nos momentos em que existem múltiplas opções de sinônimos, o modelo toma uma decisão aleatória sobre qual palavra usar. Com a implementação da marca d'água, uma chave criptográfica passa a guiar essa seleção.

Posteriormente, o Claude analisará se o padrão encontrado é consistente com um texto que foi gerado por ele mesmo. A empresa ressalta que isso não implica que o Claude começará a inserir termos inadequados no meio do texto, pois testes internos e estudos do SynthID-Text, conduzidos pelo Google DeepMind, indicaram que a técnica não afeta o conteúdo final.

Onde a detecção pode falhar?

Devido à forma como a marca é aplicada no padrão de escrita, a Anthropic aponta que modificações simples no texto podem prejudicar a análise, e alterações substanciais na estrutura do conteúdo tendem a eliminar a marcação.

Além disso, existem outras circunstâncias em que a detecção pode apresentar falhas, tais como quando os trechos são muito breves, quando a resposta se fundamenta em um dado factual e preciso, em operações matemáticas, em códigos de programação, ou em textos escritos por seres humanos, mas posteriormente revisados pelo assistente.

Por fim, a Anthropic anunciou que disponibilizará em breve uma API de detecção, permitindo que desenvolvedores, instituições e plataformas possam verificar a provável origem de um texto gerado pelo Claude.

Histórias semelhantes

Anthropic implementará identificação de conteúdo gerado pelo Claude com marcas d'água e metadados
Leia mais
tecnoblog.net

Anthropic implementará identificação de conteúdo gerado pelo Claude com marcas d'água e metadados

A Anthropic iniciará a identificação de materiais criados pelo Claude, abrangendo textos, imagens e outros arquivos de mídia, utilizando marcas d'água digitais e metadados que não são perceptíveis ao olho humano.

Esta alteração é uma resposta direta às diretrizes de transparência estabelecidas pelo Regulamento de Inteligência Artificial da União Europeia. As normas entraram em vigor em 2 de agosto e impõem a adoção de mecanismos claros para sinalizar quando um conteúdo foi gerado por inteligência artificial.

Apesar de a exigência ser europeia, a Anthropic planeja aplicar essa modificação em escala global, cobrindo diversos pontos de acesso ao Claude, como APIs, aplicações comerciais e interações em nuvem com parceiros como AWS, Google Cloud e Microsoft Foundry.

A empresa definirá dois métodos distintos de identificação conforme o tipo de material gerado. Para os textos, o Claude passará a incorporar uma marca d'água na estrutura das respostas, seguindo um modelo similar ao SynthID utilizado pelo Google em suas imagens geradas via Gemini.

Essas marcas não são visíveis no conteúdo final, diferentemente do logotipo do Gemini em imagens do Google ou do texto “Meta AI” em edições do sistema da empresa de Mark Zuckerberg. Embora a Anthropic não tenha nomeado sua marca, ela não deve modificar o conteúdo e deve permanecer vinculada ao texto mesmo após cópia e transferência para outro software.

Já para imagens e recursos visuais, a identificação será realizada por meio de metadados de procedência assinados digitalmente, utilizando o padrão C2PA, um protocolo aberto já empregado por companhias como Adobe, OpenAI e Google.

É relevante mencionar que a Anthropic ainda não dispõe de modelos nativos para criação de imagens, mas consegue produzir arquivos de texto em formatos como PNG, JPG ou SVG.

A aplicação dessas medidas começa com os modelos lançados a partir da data em que as obrigações europeias foram ativadas, ou seja, sistemas disponibilizados após 2 de agosto devem possuir a identificação ativa.

Para modelos e produtos desenvolvidos antes desse prazo, a Anthropic declarou que ainda está trabalhando para implementar o suporte necessário. Segundo informações do The Verge, a legislação europeia concede um período de tolerância de quatro meses para este tipo de ajuste.

Adicionalmente, a companhia comunicou sua intenção de disponibilizar documentação técnica e ferramentas próprias, permitindo que terceiros e plataformas online possam verificar futuramente a origem do conteúdo gerado pelo Claude.

Contudo, a Anthropic alerta que esses sistemas de identificação de IA não são infalíveis. Por exemplo, metadados no padrão C2PA podem ser perdidos ao serem enviados a certas redes sociais ou convertidos para outros formatos. A própria Anthropic avisa sobre a possibilidade de a marca d'água ser perdida se o conteúdo for reescrito, traduzido ou se for excessivamente breve.

Outro ponto notável é que a maioria das plataformas ainda não destaca significativamente o uso de IA; o YouTube e o Instagram, por exemplo, inserem apenas uma pequena indicação de possível uso em áreas discretas de suas interfaces, e isso se aplica somente a imagens e vídeos.

Popular