Investigadores de ETH Zurich, la organización de investigación de seguridad de IA MATS y Anthropic han desarrollado un pipeline automatizado de LLM que puede vincular publicaciones anónimas con identidades del mundo real. El pipeline identificó las identidades reales de cientos de usuarios de Hacker News a un costo tan bajo como $1 por persona y con una precisión del 90%.
Este artículo, publicado en febrero, se volvió viral nuevamente esta semana en X y Reddit.
El artículo se titula "Desanonimización en línea a gran escala con LLM" y se publicó por primera vez en arXiv el 18 de febrero, luego se incluyó en las actas del 35º Simposio de Seguridad USENIX.
Los autores son Simon Lermen, Daniel Paleka, Joshua Swanson, Michael Aerni, Nicholas Carlini y Florian Tramèr. Carlini trabaja en Anthropic, el desarrollador de Claude, y los autores restantes están afiliados a ETH Zurich y MATS, respectivamente.
Cuatro etapas: reducir 89,000 candidatos a una lista corta
Todo el proceso no implica robo de datos ni intrusión en servidores. El agente lee contenido público que cualquiera ya puede ver, luego trabaja como un investigador extremadamente paciente, solo que más barato y rápido.
Los investigadores dividieron el ataque en cuatro etapas, denominadas Extraer, Buscar, Razonar y Calibrar. Primero, el modelo de lenguaje extrae pistas de identidad de las publicaciones sin procesar, como rastros de una profesión, ubicación o algún hábito distintivo de fraseo.
Luego, las incrustaciones semánticas reducen un gran grupo de hasta 89,000 candidatos a una lista corta. El modelo de razonamiento puntúa las mejores coincidencias y determina si dos cuentas pertenecen a la misma persona.
El paso Calibrar permite que todo el pipeline elija abstenerse cuando no está seguro, reduciendo así los falsos positivos.
El pipeline se ejecuta con herramientas estándar: búsqueda web, modelos de incrustación y modelos grandes como GPT-5.2. Ataques previos de desanonimización, como la reidentificación de 2008 de los datos de calificación anónimos de Netflix, dependían de datos estructurados.
Identificando 226 de 338 usuarios de Hacker News con 90% de precisión
Para evaluar el método sin poner en peligro a personas reales, el equipo seleccionó 338 usuarios de Hacker News cuyos perfiles apuntaban a páginas de LinkedIn, cada uno con una identidad real conocida como respuesta.
Dados solo los comentarios y el contenido de las publicaciones, el agente identificó correctamente a 226 personas, una tasa de acierto de aproximadamente 67% con 90% de precisión. Hizo 25 identificaciones incorrectas y eligió abstenerse en 86 cuentas.
En las pruebas de coincidencia a mayor escala del artículo, los métodos de referencia tradicionales no basados en LLM tuvieron una precisión cercana a cero. El costo total de todos los experimentos fue inferior a $2,000, lo que equivale a solo $1 a $4 por perfil.
Se utilizaron otros dos conjuntos de datos para validación: uno que emparejaba usuarios de Reddit en dos comunidades de películas diferentes, y otro que dividía el historial de un solo usuario de Reddit en dos períodos de tiempo y luego intentaba unirlo de nuevo. En cada prueba, el método LLM superó a las técnicas más antiguas por un amplio margen.
Los autores enumeran escenarios de riesgo para este tipo de capacidad: gobiernos que atacan a periodistas o activistas; empresas que crean perfiles publicitarios cada vez más precisos; estafadores que fabrican perfiles personales para guiones de ingeniería social.
"La combinación de esta información a menudo constituye una huella única", escribió Lermen en una publicación de blog el 24 de febrero. Añadió que si un equipo de investigadores astutos pudiera identificar a alguien solo a partir de publicaciones, entonces los agentes LLM probablemente también puedan hacerlo, y el costo solo seguirá bajando.
Los investigadores no publicaron el código, las indicaciones ni revelaron ninguna de las identidades reales que el sistema descubrió. El estudio fue revisado por el comité de ética de ETH Zurich antes de su publicación.
El artículo concluye: "La 'oscuridad práctica' que protege a los usuarios anónimos en línea ya no existe".
Un día antes de que el artículo reavivara la discusión, la comisionada de la SEC, Hester Peirce, acababa de advertir contra la recopilación a gran escala de datos de KYC. Peirce dijo que esta práctica equivale a "construir pilas de datos cada vez más grandes".
Las recientes filtraciones de datos en Revolut y en un proveedor relacionado con el fabricante de carteras de hardware Trezor han intensificado las preocupaciones sobre los "ataques con llave inglesa", en los que alguien averigua quién posee criptomonedas y luego se presenta en persona para hacer amenazas físicas.






