A nova marca d’água invisível do Claude mal havia sido detalhada pela Anthropic quando começaram a surgir formas de contorná-la.
Desenvolvedores passaram a divulgar ferramentas e métodos capazes de enfraquecer ou remover o sinal. As técnicas incluem reescrita por outros modelos de inteligência artificial, mudanças na estrutura das frases, substituição de palavras e até tradução para outro idioma antes de voltar ao texto original.
Entre as primeiras iniciativas está o projeto Watermarks Remover, criado pelo desenvolvedor Guillaume Meyer e publicado no GitHub. A ferramenta usa outros modelos de linguagem para reescrever o texto, trocar palavras e reorganizar trechos.
Essas mudanças alteram o padrão estatístico deixado pelo Claude e podem dificultar a detecção.
Meyer afirmou à WIRED que apoia a identificação de conteúdos gerados por IA, mas critica o uso de marcas d’água invisíveis. Segundo ele, sistemas de detecção podem levar a falsos positivos e prejudicar quem usa IA apenas para revisar ou aprimorar textos.
Outros desenvolvedores testaram caminhos semelhantes. O engenheiro de software Erik Hughes disse ter criado em cerca de 15 minutos uma ferramenta que combina mudanças na estrutura das frases com manipulação de caracteres.
Já o pesquisador Leon Chlon mostrou que a tradução também pode enfraquecer o sinal. A técnica consiste em passar o texto para um idioma com estrutura diferente, como o árabe, e depois traduzi-lo de volta.
Como funciona a marca d’água do Claude.
O sistema interfere de forma sutil nas palavras escolhidas pelo modelo, criando uma espécie de assinatura estatística que pode ser reconhecida posteriormente por ferramentas de detecção.
A tecnologia usada pela Anthropic se chama SynthID e foi desenvolvida pelo Google DeepMind.
A adoção do recurso ocorre junto às novas exigências do AI Act da União Europeia. Desde 2 de agosto de 2026, novas regras de transparência determinam que alguns conteúdos gerados ou manipulados por inteligência artificial possam ser identificados por sistemas automatizados.
Todos os métodos utilizados para burlar exploram o mesmo ponto: a marca d’água não funciona como um código escondido no arquivo. Ela depende das escolhas de palavras feitas pelo modelo.
Quando outro sistema reescreve o conteúdo de forma suficiente, o padrão pode perder força.
Fontes
Informação baseada em material público de InfoMoney, reescrito pela redação ULTRA NOTÍCIAS.