ETH Zurich、AI 安全研究机构 MATS 与 Anthropic 的研究者开发出一套自动化 LLM 流程,能够把匿名发帖与真实世界身份关联起来。该流程以低至每人 1 美元的成本、90% 的精确度,识别出数百名 Hacker News 用户的真实身份。
这篇 2 月发表的论文本周在 X 和 Reddit 上再度走红。
论文题为《Large-scale online deanonymization with LLMs》,于 2 月 18 日首次发布在 arXiv,随后收录进第 35 届 USENIX Security Symposium 会议论文集。
作者为 Simon Lermen、Daniel Paleka、Joshua Swanson、Michael Aerni、Nicholas Carlini 和 Florian Tramèr。Carlini 就职于 Claude 的开发方 Anthropic,其余作者分别隶属于 ETH Zurich 和 MATS。
四个阶段:把 8.9 万名候选者缩小到一份短名单
整个过程不涉及窃取数据或入侵服务器。该智能体读取的是任何人都已经能看到的公开内容,然后像一名极有耐心的调查员一样工作——只是更便宜、更快速。
研究者把攻击拆解为四个阶段,分别命名为 Extract(提取)、Search(搜索)、Reason(推理)和 Calibrate(校准)。首先,语言模型从原始帖子中提取身份线索,例如职业的蛛丝马迹、所在地,或某种独特的措辞习惯。
随后,语义嵌入把最多 8.9 万名候选者的大池子缩减为一份短名单。推理模型对最匹配的对象进行评分,并判断两个账号是否属于同一个人。
Calibrate 步骤则让整个流程在不确定时选择弃权,从而减少误报。
该流程运行在现成工具之上:网络搜索、嵌入模型以及诸如 GPT-5.2 的大模型。此前的去匿名化攻击,例如 2008 年对 Netflix 匿名评分数据的再识别,依赖的是结构化数据。
以 90% 精确度识别出 338 名 Hacker News 用户中的 226 人
为了在不危及真实个体的前提下评估该方法,团队筛选出 338 名 Hacker News 用户,其个人简介指向 LinkedIn 页面,每个人都拥有已知的真实身份作为答案。
仅输入评论和发帖内容,该智能体正确指认了 226 人,在 90% 精确度下命中率约为 67%。它做出 25 次错误指认,并对 86 个账号选择放弃。
在论文更大规模的匹配测试中,传统的非 LLM 基线方法准确率接近于零。全部实验的总成本不到 2,000 美元,折算下来每个画像仅 1 至 4 美元。
另有两组数据集用于验证:一组跨两个不同的电影社区匹配 Reddit 用户,另一组把单个 Reddit 用户的历史记录拆分为两个时间段,再尝试将其重新拼接起来。在每一项测试中,LLM 方法都以大幅优势击败旧有技术。
作者列举了这类能力的风险场景:政府针对记者或活动人士;企业构建越来越精准的广告画像;骗子为社交工程话术炮制个人档案。
“这些信息的组合往往构成一个独一无二的指纹,”Lermen 在 2 月 24 日的一篇博客文章中写道。他补充说,如果一队聪明的调查员能够仅凭帖子识别出某个人,那么 LLM 智能体很可能也做得到,而且成本只会不断下降。
研究者没有公开代码、提示词,也没有披露系统挖出的任何真实身份。该研究在发布前经过了 ETH Zurich 伦理委员会的审查。
论文的结论是:“保护在线匿名用户的‘实际模糊性’已不复存在。”
这篇论文重新引发热议的一天前,SEC 委员 Hester Peirce 刚刚警告不要大规模收集 KYC 数据。Peirce 称,这种做法相当于“建造越来越大的数据干草堆”。
近期 Revolut 以及硬件钱包厂商 Trezor 相关供应商接连发生的数据泄露,加剧了人们对“扳手攻击”(wrench attack)的担忧——即有人得知谁持有加密货币后,直接上门实施人身威胁。






