Pesquisa da ETH e da Anthropic: LLMs revelam contas anônimas por apenas US$ 1

Hacker NewsAnthropicDesanonimização por LLMPrivacidade e segurançaAnonimato onlineKYC
há 1 horaFonte: blockweeks.com
Pesquisa da ETH e da Anthropic: LLMs revelam contas anônimas por apenas US$ 1

Pesquisadores da ETH Zurich, da organização de pesquisa em segurança de IA MATS e da Anthropic desenvolveram um pipeline automatizado de LLM capaz de vincular postagens anônimas a identidades do mundo real. O pipeline identificou as identidades reais de centenas de usuários do Hacker News a um custo tão baixo quanto US$ 1 por pessoa e com 90% de precisão.

Este artigo, publicado em fevereiro, tornou-se viral novamente esta semana no X e no Reddit.

O artigo intitula-se "Desanonimização online em larga escala com LLMs" e foi publicado pela primeira vez no arXiv em 18 de fevereiro, sendo depois incluído nos anais do 35º Simpósio de Segurança da USENIX.

Os autores são Simon Lermen, Daniel Paleka, Joshua Swanson, Michael Aerni, Nicholas Carlini e Florian Tramèr. Carlini trabalha na Anthropic, desenvolvedora do Claude, e os demais autores são afiliados à ETH Zurich e à MATS, respectivamente.

Quatro etapas: reduzindo 89.000 candidatos a uma lista restrita

Todo o processo não envolve roubo de dados nem invasão de servidores. O agente lê conteúdo público que qualquer pessoa já pode ver e, em seguida, trabalha como um investigador extremamente paciente — só que mais barato e mais rápido.

Os pesquisadores dividiram o ataque em quatro etapas, denominadas Extrair, Buscar, Raciocinar e Calibrar. Primeiro, o modelo de linguagem extrai pistas de identidade de postagens brutas, como vestígios de uma profissão, localização ou algum hábito distinto de fraseado.

Em seguida, embeddings semânticos reduzem um grande conjunto de até 89.000 candidatos a uma lista restrita. O modelo de raciocínio pontua as melhores correspondências e determina se duas contas pertencem à mesma pessoa.

A etapa Calibrar permite que todo o pipeline opte por se abster quando estiver em dúvida, reduzindo assim os falsos positivos.

O pipeline funciona com ferramentas prontas para uso: busca na web, modelos de embedding e grandes modelos como o GPT-5.2. Ataques anteriores de desanonimização, como a reidentificação de 2008 dos dados anônimos de avaliação da Netflix, baseavam-se em dados estruturados.

Identificando 226 de 338 usuários do Hacker News com 90% de precisão

Para avaliar o método sem colocar em risco pessoas reais, a equipe selecionou 338 usuários do Hacker News cujos perfis apontavam para páginas do LinkedIn, cada um com uma identidade real conhecida como resposta.

Dado apenas o conteúdo de comentários e postagens, o agente identificou corretamente 226 pessoas, uma taxa de acerto de cerca de 67% com 90% de precisão. Fez 25 identificações incorretas e optou por se abster em 86 contas.

Nos testes de correspondência em maior escala do artigo, os métodos tradicionais de linha de base sem LLM tiveram precisão próxima de zero. O custo total de todos os experimentos foi inferior a US$ 2.000, o que equivale a apenas US$ 1 a US$ 4 por perfil.

Dois outros conjuntos de dados foram usados para validação: um que combinava usuários do Reddit em duas comunidades de filmes diferentes, e outro que dividia o histórico de um único usuário do Reddit em dois períodos de tempo e depois tentava reuni-lo. Em todos os testes, o método LLM superou as técnicas mais antigas por uma margem ampla.

Os autores listam cenários de risco para esse tipo de capacidade: governos visando jornalistas ou ativistas; empresas construindo perfis publicitários cada vez mais precisos; golpistas fabricando perfis pessoais para roteiros de engenharia social.

"A combinação dessas informações frequentemente constitui uma impressão digital única", escreveu Lermen em uma postagem de blog em 24 de fevereiro. Ele acrescentou que, se uma equipe de investigadores astutos consegue identificar alguém apenas a partir de postagens, então agentes LLM provavelmente também conseguem, e o custo só continuará caindo.

Os pesquisadores não divulgaram o código, os prompts nem revelaram qualquer uma das identidades reais que o sistema descobriu. O estudo foi revisado pelo comitê de ética da ETH Zurich antes da publicação.

O artigo conclui: "A 'obscuridade prática' que protege usuários anônimos online não existe mais."

Um dia antes de o artigo reacender a discussão, a comissária da SEC, Hester Peirce, havia acabado de alertar contra a coleta em larga escala de dados de KYC. Peirce disse que essa prática equivale a "construir palheiros de dados cada vez maiores".

Violações de dados recentes na Revolut e em um fornecedor relacionado à fabricante de carteiras de hardware Trezor intensificaram as preocupações com "ataques de chave inglesa" — nos quais alguém descobre quem detém criptomoedas e depois aparece pessoalmente para fazer ameaças físicas.