如果你捡到一本陌生人的日记会作何感想?将ChatGPT导出文件上传至Proton新推出的免费工具“AI Paper Trail”后,这种被窥视的战栗感油然而生。

这款由Proton隐私软件工程师开发的工具,旨在分析用户从ChatGPT或Claude导出的聊天记录,精准量化无意中泄露的个人信息。该工具运行于Proton旗下专注隐私的大语言模型Lumo之上。与热衷数据收集的科技巨头不同,Lumo声称会在处理后立即删除用户数据,不留任何存根。

测试结果显示,生成的个人画像远超预期。除了职业焦虑、财务状况和旅行偏好等已知信息外,报告还精准捕捉到连亲属都未曾察觉的性格特质。在“财务背景”栏目中,许多未明确提及的敏感信息被详细列出;“健康限制”部分则追踪了数月来的健康状况变化及就医记录。尽管“家庭”部分存在大模型典型的“幻觉”虚构,但随着数据积累,其画像准确度只会日益提升。

更令人不安的是,报告不仅将用户评定为“容易画像”,还给出了一个四位数的美元“广告价值”,并列出了竞相争夺用户注意力的行业板块。

AI profiling:从海量交互中透视用户

几年前,构建此类档案尚需大量人工调研,如今仅需一次上传。用户在与聊天机器人互动中积累的上下文语境,成为了数据泄露的主要源头。

Proton工程总监Eamonn Maguire指出,即使用户从未直接披露,模型也能通过交互模式估算出大致年龄、收入阶层、教育水平或政治倾向。甚至写作风格和语气也会暴露社会经济背景、压力水平及情绪脆弱时刻。一旦数据离开平台,无论是用于广告、训练还是与其他数据集结合,个人数据便面临永久受损风险,用户几乎无力挽回。

主流平台隐私风险评级

Incogni发布的《2026年数据隐私排名》对13个AI平台进行了评估。Incogni高级公关经理Bogan Popescu表示,问题不在于哪个平台最注重隐私,而在于哪个平台对隐私的侵犯最小。

排名显示,Meta AI、Gemini和Copilot隐私风险最高。这些公司拥有庞杂的隐私政策,难以界定具体条款适用范围,且存在广泛的数据收集与共享行为。Mistral的Vibe等平台虽整体风险较低,但仍使用未披露来源的公开数据集进行训练,用户无从知晓数据构成及获取方式。

尽管ChatGPT被评为“对隐私侵犯最小”的平台之一,但此前调查显示,人类审核员仍在阅读用户提示词以优化模型,这使得所谓的安全感大打折扣。针对隐私政策的置评请求,相关公司并未回应。

自愿让渡:被低估的隐私代价

与其说是LLM提供商在“收割”数据,不如说是用户在自愿牺牲隐私。DuckDuckGo高级副总裁Zac Pappis指出,许多公司营造出“AI应应用于一切”的印象,配合对话式语音和专家般的外衣,让用户误以为获得了并不存在的安全性与匿名性。

DuckDuckGo的一项调查显示,超过三分之一的AI用户分享了连亲密朋友或医生都不知道的信息;超过半数受访者不确定对话是否被用于模型训练。Pappis强调,对大多数公司而言,让用户对数据去向保持无知符合其商业利益。

为何删除记录无济于事

删除聊天记录并非万能解药。前端界面的清除仅是表面功夫,副本仍存在于备份日志、灾难恢复系统、服务器日志及第三方处理器中。更为关键的是,如果对话在删除前已贡献于模型训练、嵌入向量或聚合分析,事后删除无法撤销模型已“学会”的信息。

此外,平台常因滥用调查、法律合规或操作延迟而保留数据。即便选择退出对话训练,平台仍可能长期保留账户信息和用法模式。Maguire解释,“对话未被用于训练”与“数据未被保留或处理”存在本质区别。目前,没有任何平台允许用户移除已用于训练的数据,退出机制仅具前瞻性而非追溯性。

如何更安全地使用AI

专家建议,用户应将每次交互视为可能被他人看到的公开行为,警惕对话的累积效应。切换到隐私保护更强的服务是更优选择。例如,Proton的Lumo声称不保留对话日志并使用零访问加密;开源工具xPrivo承诺不使用用户数据训练;Internxt则将聊天数据存储在本地设备。

若必须使用主流平台,Popescu建议优先使用浏览器而非移动应用,以减少设备数据泄露风险。长远来看,行业亟需建立可验证的“被遗忘权”标准。毕竟,没人希望自己的数字日记被随意翻阅。