ETH und Anthropic-Studie: LLMs decken anonyme Konten für 1 US-Dollar auf

Hacker NewsAnthropicLLM-DeanonymisierungDatenschutz und SicherheitOnline-AnonymitätKYC
vor 1 StundeQuelle: blockweeks.com
ETH und Anthropic-Studie: LLMs decken anonyme Konten für 1 US-Dollar auf

Forscher der ETH Zürich, der KI-Sicherheitsforschungsorganisation MATS und Anthropic haben eine automatisierte LLM-Pipeline entwickelt, die anonyme Beiträge mit realen Identitäten verknüpfen kann. Die Pipeline identifizierte die realen Identitäten von Hunderten von Hacker News-Nutzern zu Kosten von nur 1 US-Dollar pro Person und mit 90 % Präzision.

Dieses im Februar veröffentlichte Paper ging diese Woche auf X und Reddit erneut viral.

Das Paper trägt den Titel „Large-scale online deanonymization with LLMs“ und wurde erstmals am 18. Februar auf arXiv veröffentlicht und später in die Proceedings des 35. USENIX Security Symposiums aufgenommen.

Die Autoren sind Simon Lermen, Daniel Paleka, Joshua Swanson, Michael Aerni, Nicholas Carlini und Florian Tramèr. Carlini arbeitet bei Anthropic, dem Entwickler von Claude, und die übrigen Autoren sind jeweils mit der ETH Zürich und MATS verbunden.

Vier Phasen: Eingrenzung von 89.000 Kandidaten auf eine Auswahlliste

Der gesamte Prozess beinhaltet keinen Datendiebstahl und keinen Server-Einbruch. Der Agent liest öffentliche Inhalte, die jeder bereits sehen kann, und arbeitet dann wie ein extrem geduldiger Ermittler – nur billiger und schneller.

Die Forscher unterteilten den Angriff in vier Phasen, die sie Extract, Search, Reason und Calibrate nannten. Zunächst extrahiert das Sprachmodell Identitätshinweise aus Rohbeiträgen, wie Spuren eines Berufs, eines Standorts oder einer bestimmten charakteristischen Formulierungsgewohnheit.

Dann reduziert semantisches Embedding einen großen Pool von bis zu 89.000 Kandidaten auf eine Auswahlliste. Das Reasoning-Modell bewertet die besten Übereinstimmungen und bestimmt, ob zwei Konten derselben Person gehören.

Der Calibrate-Schritt ermöglicht es der gesamten Pipeline, sich bei Unsicherheit zu enthalten, wodurch falsch positive Ergebnisse reduziert werden.

Die Pipeline läuft auf handelsüblichen Werkzeugen: Websuche, Embedding-Modelle und große Modelle wie GPT-5.2. Frühere Deanonymisierungs-Angriffe, wie die Re-Identifizierung der anonymen Bewertungsdaten von Netflix im Jahr 2008, stützten sich auf strukturierte Daten.

Identifizierung von 226 von 338 Hacker-News-Nutzern mit 90 % Präzision

Um die Methode zu evaluieren, ohne reale Personen zu gefährden, wählte das Team 338 Hacker-News-Nutzer aus, deren Profile auf LinkedIn-Seiten verwiesen, jeweils mit einer bekannten realen Identität als Antwort.

Nur mit Kommentaren und Beitragsinhalten identifizierte der Agent korrekt 226 Personen, eine Trefferquote von etwa 67 % bei 90 % Präzision. Er machte 25 falsche Identifizierungen und enthielt sich bei 86 Konten.

In den größeren Matching-Tests des Papers hatten traditionelle Nicht-LLM-Basismethoden eine Genauigkeit nahe null. Die Gesamtkosten aller Experimente betrugen weniger als 2.000 US-Dollar, was nur 1 bis 4 US-Dollar pro Profil entspricht.

Zwei weitere Datensätze wurden zur Validierung verwendet: einer, der Reddit-Nutzer über zwei verschiedene Film-Communities hinweg abgleicht, und ein anderer, der die Historie eines einzelnen Reddit-Nutzers in zwei Zeiträume aufteilt und dann versucht, sie wieder zusammenzufügen. In jedem Test übertraf die LLM-Methode ältere Techniken bei Weitem.

Die Autoren listen Risikoszenarien für diese Art von Fähigkeit auf: Regierungen, die auf Journalisten oder Aktivisten abzielen; Unternehmen, die zunehmend präzisere Werbeprofile erstellen; Betrüger, die persönliche Profile für Social-Engineering-Skripte fabrizieren.

„Die Kombination dieser Informationen stellt oft einen einzigartigen Fingerabdruck dar“, schrieb Lermen in einem Blogbeitrag vom 24. Februar. Er fügte hinzu, dass, wenn ein Team kluger Ermittler jemanden allein anhand von Beiträgen identifizieren könnte, LLM-Agenten dies wahrscheinlich auch können, und die Kosten nur weiter sinken werden.

Die Forscher veröffentlichten weder den Code noch die Prompts und gaben keine der realen Identitäten preis, die das System aufdeckte. Die Studie wurde vor der Veröffentlichung von der Ethikkommission der ETH Zürich geprüft.

Das Paper kommt zu dem Schluss: „Die ‚praktische Obskurität‘, die anonyme Nutzer online schützt, existiert nicht mehr.“

Einen Tag bevor das Paper die Diskussion erneut entfachte, hatte SEC-Kommissarin Hester Peirce gerade vor der groß angelegten Sammlung von KYC-Daten gewarnt. Peirce sagte, diese Praxis komme dem „Aufbau immer größerer Datenheuhaufen“ gleich.

Jüngste Datenschutzverletzungen bei Revolut und bei einem Zulieferer des Hardware-Wallet-Herstellers Trezor haben die Besorgnis über „Wrench-Angriffe“ verstärkt – bei denen jemand erfährt, wer Kryptowährung besitzt, und dann persönlich auftaucht, um physischen Druck auszuüben.