Исследователи из ETH Zurich, организации по исследованию безопасности ИИ MATS и Anthropic разработали автоматизированный конвейер LLM, который может связывать анонимные публикации с реальными личностями. Конвейер идентифицировал реальные личности сотен пользователей Hacker News по цене всего 1 доллар за человека и с точностью 90%.
Эта статья, опубликованная в феврале, снова стала вирусной на этой неделе в X и Reddit.
Статья озаглавлена «Крупномасштабная онлайн-деанонимизация с помощью LLM» и была впервые опубликована на arXiv 18 февраля, а затем включена в материалы 35-го симпозиума USENIX Security.
Авторы — Саймон Лермен, Даниэль Палека, Джошуа Свонсон, Майкл Аэрни, Николас Карлини и Флориан Трамер. Карлини работает в Anthropic, разработчике Claude, а остальные авторы связаны с ETH Zurich и MATS соответственно.
Четыре этапа: сужение 89 000 кандидатов до шортлиста
Весь процесс не включает кражу данных или вторжение на сервер. Агент читает публичный контент, который может увидеть любой, а затем работает как чрезвычайно терпеливый следователь — только дешевле и быстрее.
Исследователи разбили атаку на четыре этапа, названные Extract, Search, Reason и Calibrate. Сначала языковая модель извлекает из необработанных публикаций подсказки о личности, такие как следы профессии, местоположения или какой-либо характерной речевой привычки.
Затем семантические эмбеддинги сокращают большой пул до 89 000 кандидатов до шортлиста. Модель рассуждений оценивает лучшие совпадения и определяет, принадлежат ли два аккаунта одному человеку.
Этап Calibrate позволяет всему конвейеру воздержаться от ответа в случае неуверенности, тем самым уменьшая количество ложных срабатываний.
Конвейер работает на готовых инструментах: веб-поиск, модели эмбеддингов и большие модели, такие как GPT-5.2. Предыдущие атаки деанонимизации, такие как повторная идентификация анонимных данных о рейтингах Netflix в 2008 году, полагались на структурированные данные.
Идентификация 226 из 338 пользователей Hacker News с точностью 90%
Чтобы оценить метод, не подвергая риску реальных людей, команда выбрала 338 пользователей Hacker News, чьи профили указывали на страницы LinkedIn, каждая с известной реальной личностью в качестве ответа.
Имея только комментарии и содержание публикаций, агент правильно идентифицировал 226 человек, что составляет около 67% попаданий при точности 90%. Он сделал 25 неверных идентификаций и предпочёл воздержаться по 86 аккаунтам.
В более масштабных тестах сопоставления, описанных в статье, традиционные базовые методы без LLM имели точность, близкую к нулю. Общая стоимость всех экспериментов составила менее 2000 долларов, что составляет всего от 1 до 4 долларов за профиль.
Для проверки использовались ещё два набора данных: один сопоставлял пользователей Reddit из двух разных сообществ о кино, а другой разделял историю одного пользователя Reddit на два временных периода, а затем пытался сшить её обратно. В каждом тесте метод LLM с большим отрывом превосходил старые методы.
Авторы перечисляют сценарии риска для такой возможности: правительства, нацеленные на журналистов или активистов; компании, создающие всё более точные рекламные профили; мошенники, фабрикующие личные профили для сценариев социальной инженерии.
«Сочетание этой информации часто составляет уникальный отпечаток», — написал Лермен в блоге 24 февраля. Он добавил, что если команда сообразительных следователей могла бы идентифицировать кого-то только по публикациям, то LLM-агенты, вероятно, тоже могут это сделать, и стоимость будет только падать.
Исследователи не выпустили код, подсказки и не раскрыли ни одной из реальных личностей, которые выявила система. Исследование было рассмотрено комитетом по этике ETH Zurich перед публикацией.
В статье делается вывод: «“Практическая неясность”, защищающая анонимных пользователей в интернете, больше не существует».
За день до того, как статья вновь вызвала обсуждение, комиссар SEC Хестер Пирс как раз предупреждала против крупномасштабного сбора данных KYC. Пирс сказала, что эта практика равносильна «созданию всё более огромных стогов сена из данных».
Недавние утечки данных в Revolut и у поставщика, связанного с производителем аппаратных кошельков Trezor, усилили опасения по поводу «атак с гаечным ключом» — когда кто-то узнаёт, кто владеет криптовалютой, а затем появляется лично, чтобы угрожать физически.






