Дослідники з ETH Zurich, організації з дослідження безпеки ШІ MATS та Anthropic розробили автоматизований конвеєр LLM, який може пов'язувати анонімні публікації з реальними особами. Конвеєр ідентифікував справжні особи сотень користувачів Hacker News за ціною всього $1 на особу та з точністю 90%.
Ця стаття, опублікована в лютому, знову стала вірусною цього тижня на X та Reddit.
Стаття має назву «Large-scale online deanonymization with LLMs» і була вперше опублікована на arXiv 18 лютого, а згодом включена до матеріалів 35-го симпозіуму USENIX Security.
Авторами є Саймон Лермен, Деніел Палека, Джошуа Свенсон, Майкл Аерні, Ніколас Карліні та Флоріан Трамер. Карліні працює в Anthropic, розробнику Claude, а решта авторів пов'язані з ETH Zurich та MATS відповідно.
Чотири етапи: звуження 89 000 кандидатів до короткого списку
Весь процес не передбачає крадіжки даних або вторгнення на сервер. Агент читає публічний вміст, який може побачити будь-хто, а потім працює як надзвичайно терплячий слідчий — лише дешевше й швидше.
Дослідники розбили атаку на чотири етапи, названі Extract, Search, Reason та Calibrate. Спочатку мовна модель витягує підказки про особу з необроблених публікацій, такі як сліди професії, місцезнаходження або певна характерна звичка формулювання.
Потім семантичні вбудовування зменшують великий пул до 89 000 кандидатів до короткого списку. Модель міркування оцінює найкращі збіги та визначає, чи належать два акаунти одній особі.
Етап Calibrate дозволяє всьому конвеєру утриматися від відповіді, коли він не впевнений, тим самим зменшуючи хибнопозитивні результати.
Конвеєр працює на готових інструментах: веб-пошук, моделі вбудовування та великі моделі, такі як GPT-5.2. Попередні атаки деанонімізації, такі як повторна ідентифікація анонімних даних рейтингів Netflix у 2008 році, покладалися на структуровані дані.
Ідентифікація 226 з 338 користувачів Hacker News з точністю 90%
Щоб оцінити метод, не наражаючи на небезпеку реальних людей, команда вибрала 338 користувачів Hacker News, чиї профілі вказували на сторінки LinkedIn, кожен з відомою справжньою особою як відповіддю.
Маючи лише коментарі та вміст публікацій, агент правильно ідентифікував 226 осіб, що становить близько 67% влучень при 90% точності. Він зробив 25 неправильних ідентифікацій і вирішив утриматися щодо 86 акаунтів.
У більш масштабних тестах зіставлення, описаних у статті, традиційні не-LLM базові методи мали точність, близьку до нуля. Загальна вартість усіх експериментів становила менше $2 000, що становить лише $1 до $4 за профіль.
Для перевірки використано ще два набори даних: один зіставляв користувачів Reddit у двох різних кіноспільнотах, а інший розділяв історію одного користувача Reddit на два часові періоди, а потім намагався зшити її назад. У кожному тесті метод LLM значно перевершував старіші техніки.
Автори перелічують сценарії ризику для такої можливості: уряди, що переслідують журналістів або активістів; компанії, що створюють дедалі точніші рекламні профілі; шахраї, що фабрикують особисті профілі для сценаріїв соціальної інженерії.
«Поєднання цієї інформації часто становить унікальний відбиток», — написав Лермен у блозі 24 лютого. Він додав, що якщо команда кмітливих слідчих могла б ідентифікувати когось лише за публікаціями, то агенти LLM, ймовірно, також можуть це зробити, і вартість лише продовжуватиме падати.
Дослідники не оприлюднили код, підказки та не розкрили жодної з реальних осіб, які виявила система. Дослідження було перевірено комітетом з етики ETH Zurich перед публікацією.
У статті зроблено висновок: «„Практична невідомість“, яка захищає анонімних користувачів онлайн, більше не існує».
За день до того, як стаття знову викликала обговорення, комісар SEC Гестер Пірс щойно попереджала проти масштабного збору даних KYC. Пірс сказала, що ця практика рівнозначна «створенню дедалі більших стогів даних».
Нещодавні витоки даних у Revolut та в постачальника, пов'язаного з виробником апаратних гаманців Trezor, посилили занепокоєння щодо «атак з використанням фізичного примусу» — коли хтось дізнається, хто володіє криптовалютою, а потім з'являється особисто, щоб чинити фізичний тиск.






