💻 technology
By WNT
AI 阅读 OpenAI 的隐私政策,发现数据陷阱
OpenAI 的隐私政策看起来就像是无限 AI 训练的许可证明。隐藏在友好的语言中并分散在多个文档中的条款允许公司收集您的对话,无限期存储它们,并与未具名的第三方分享。真正令人震惊的是,退出几乎是不可能的。
根据您所居住的地区以及如何访问他们的产品,OpenAI 运营三种不同的隐私框架,形成一个分散的责任结构,任何监管律师都会对此感到不安。2024 年 4 月更新的欧盟隐私政策、一般服务条款以及数据控制和记忆功能的单独常见问题文档形成了一个重叠且有时相互矛盾的条文迷宫。这不是偶然的。通过将关键披露分隔在多个文件中,OpenAI 确保即便是最勤勉的用户也会错过关于其数据如何被武器化用于模型改进的关键细节。
欧盟隐私政策中有一个特别令人不安的部分关于“合法利益”,起到了一个包罗万象的数据处理理由。OpenAI 声称有合法利益使用您的对话来“开发、改进和提供我们的服务”,而未定义“改进”意味着什么或者这种利益会持续多久。在 GDPR(普通数据保护条例)第 6(1)(f) 条下,公司只能在个人隐私权未被凌驾的情况下基于合法利益处理数据。OpenAI 从未解释他们如何平衡这个方程。他们仅仅声称存在利益并推进。这种模糊的表述为打着持续模型开发幌子的无限期数据保留打开了方便之门,爱尔兰的隐私监管机构和欧洲数据保护委员会已经开始质疑这种做法。
数据控制常见问题通过其未言明的内容揭示了 OpenAI 数据野心的真正范围。用户据称可以关闭聊天历史以防止对话出现在侧边栏,但 OpenAI 明确表示,即使在禁用历史记录的情况下,他们会保留对话30天以“监控滥用”后再删除。这里是障眼法:30 天的窗口时间足以让 OpenAI 在原始聊天技术上被删除之前提取、匿名化并将您的提示整合到训练数据集中。常见问题提到禁用聊天记录意味着不会用于训练我们的模型,但对此声明提供了零技术验证。没有审计路径,没有加密证明,没有第三方验证。您应当信任 OpenAI 内部系统正确标记和排除选择退出的对话,不被训练管道使用。对于一个常规抓取整个互联网作为训练数据的公司而言,这种自我认证模式缺乏可信度。
记忆常见问题引入了一个更加具有入侵性的功能,它在对话中持久存在。ChatGPT 现在可以记住关于您、您的偏好和您的生活情况的细节,以提供“更相关”的回应。OpenAI 将此作为用户赋权,但技术实施揭示了一个永久的档案系统。除非您手动删除,否则记忆会被无限期存储,OpenAI 承认“记忆可能会被用来提高模型性能”。翻译:您的个人详细信息成为训练数据。公司未提供细粒度控制以决定 ChatGPT 可以记住哪种类型的信息。您不能告诉它记住工作偏好,但忘记医疗细节。这是全有或全无,默认设置是最大保留。
政策文件含有一个惊人的承认,关于第三方分享大多数用户将永远不会注意到。OpenAI 表示,他们可能会与“服务提供商”和“商业伙伴”分享个人数据而不具名这些实体或限制分享目的。对于欧盟用户来说,政策提到了用于国际传输的标准合同条款,但未透露哪些国家接收数据或在什么安全标准下接收。其实际效果是,您的 ChatGPT 对话可能会出现在隐私保护程度不同的几十个司法管辖区的服务器上,而您无权知晓哪些。即使通过密集法律语言技术合规,这种不透明性也违反了 GDPR 的透明度要求。
在将声明的政策与实际技术能力进行比较时出现关键漏洞:
- OpenAI 声称“匿名化”数据无法识别个人,但研究表明大型语言模型可以记住并输出训练实例。您所认为匿名化的提示可能会从模型输出中重建。
- 公司保留根据法律要求“保留数据”的权利,而未具体说明哪些法律或司法管辖区触发此保留。这张空白支票可证明无限期保留数据的合理性。
- 对于 API(应用编程接口)业务客户,OpenAI 承诺除非明确允许,否则不使用已提交的数据进行训练。消费者 ChatGPT 用户则没有这种保护,形成两级隐私系统,其中企业客户受到重视,而个人用户则被视为产品。
- 政策提到为业务用户提供数据处理附录,但未为消费者提供等效保护,尽管消费者生成了绝大多数训练数据。
- OpenAI 表示您可以根据 GDPR 要求删除数据,但记忆常见问题承认即使在删除后记忆“可能会在模型行为中持续存在”。如果您的信息仍嵌入在模型权重中,删除如何算得上完整?
OpenAI 策略构造的真正聪明之处在于,它将隐私保护的责任完全放在用户身上,同时几乎不可能有效退出。想要阻止您的数据用于训练模型?禁用聊天历史。想要停止记忆收集?关掉记忆。想要避免第三方分享?不要使用该服务。但他们没有告诉您的是,即使每个隐私切换都打开,OpenAI 仍然会处理您的提示来生成回应,而这种处理会创建元数据、使用模式以及行为信号,直接反馈到模型开发中。细则承认,不管您的设置如何,“匿名化汇总数据”仍然是公平游戏。由于 OpenAI 定义什么算“匿名化”,他们控制逃生舱口。
这些政策法律上最脆弱的方面是对交易的根本误认。OpenAI 提供 ChatGPT 为用户提供的服务,然而经济现实是用户为 OpenAI 提供训练数据作为无偿劳动。这种倒置很重要,因为全球消费者保护法律要求在交易涉及非货币赔偿时清楚披露。如果您的提示是服务的支付,那么 OpenAI 未能量化这数据的价值或提供替代方案构成不公平商业行为。OpenAI 总部位于加州的集体诉讼律师可能会认为用户是员工或承包商,有权根据劳动法获得赔偿。政策文件小心避免承认这种关系,描述数据收集为偶然而非业务模式必需。此描述在诉讼中的发现阶段无法存活。
我的看法
OpenAI 制定了一项隐私政策,看起来像知情同意,但实际上像一个责任盾牌。多文档结构、有关“合法利益”的模糊语言以及将保护自己数据的不可能负担放在用户身上,所有这些都指向一家非常了解这些做法在法律上多么脆弱的公司。他们打赌用户不会阅读细则,监管者不会将不同政策文件中的点联系起来,并且当法院赶上时,数据将会被烘焙到无法解开的模型中。
最令人生厌的部分不是数据收集本身,而是用户拥有实质性控制的假象。OpenAI 用取消选择键和记忆设置作为隐私尊重的证据,但这些控制是装饰性的。公司仍然得到他们需要的:您的行为模式,您的语言使用,您的问题解决方法。他们设计了一个系统,在这个系统中唯一真正的隐私保护是非使用,然后当隐私倡导者称之为强制时表现得吃惊。这不是创新,这是带有友好用户界面的剥削。
即将到来的事情是 OpenAI 的数据饥渴模型与全球隐私框架之间即将到来的清算,后者终于追上了 AI 公司。爱尔兰数据保护委员会已经在调查 OpenAI 的 GDPR 合规性。欧盟监管者正在推动明确的同意要求,这将彻底破坏“合法利益”漏洞。而在美国,联邦贸易委员会 (FTC) 已表现出越来越大的意愿去追击从事欺骗性隐私实践的科技公司。OpenAI 目前的政策无法通过这样的审查。问题是他们会主动改革还是等待数十亿美元的执法行动迫使他们改革。
接下来会发生什么
爱尔兰数据保护委员会将在 2026 年 10 月之前发出关于 OpenAI GDPR 违规的初步调查结果,特别关注合法利益理由和用户同意机制的充分性。OpenAI 将以一项看似实质性的政策全面修改作出回应,但保留核心数据收集基础设施。真正的戏剧发生在欧洲数据保护委员会将案件升级为具有约束力的决定,迫使 OpenAI 实施用于训练数据使用的真正同意。这引发了一个级联效应,OpenAI 分裂为两个产品:一个免费层,必须贡献数据,以及一个保证隐私的高级层。高级层的定价可能为每月 50 美元至 100 美元,这将揭示 OpenAI 免费收集的用户数据的实际价值。
与此同时,加利福尼亚北区提起的集体诉讼将于 2026 年底在驳回动议中幸存下来,确立 AI 训练数据具有可量化价值并且用户可能对自己的提示拥有财产权的法律先例。OpenAI 将在不承认过错的情况下以 1.5 亿至 3 亿美元和解,但和解条款将要求创建一个独立的数据审计系统,其他 AI 公司将被迫采用。请注意 OpenAI 将在 2026 年 9 月宣布此审计系统,正好在加州案件达成简易判决前,以消解原告的主要请求。
变数在于是否有举报者从 OpenAI 内部出现,提供内部通讯显示高管知道隐私政策具有误导性。如果有人泄露邮件,讨论如何最大化数据收集同时最小化法律暴露,或者揭示选择退出的数据实际上用于训练运行,整个法律环境将从民事责任转变为潜在刑事欺诈指控。鉴于 OpenAI 的快速员工增长和关于 AI 安全与商业部署的报道内部紧张局势,每个月发生泄漏的可能性都在增加。这种情况将在 2027 年中期使 Sam Altman 出现在国会面前,辩护的不仅是隐私实践,还有引领 AI 革命的公司的基本可信度。
历史告诉我们什么
OpenAI 的隐私方法反映了 Facebook 2007-2012 的做法:提供引人注目的免费服务,将数据收集条款隐藏在分散的政策文件中,比监管者的反应速度更快地扩展使用,然后在公众反弹后改进隐私控制。Facebook 与 FTC 在 2011 年达成的同意令,要求公司在超出既定隐私设置分享用户数据之前获得明确同意,仅在数年违规和正式调查后才出现。该法令塑造了 Facebook 的实践长达十年,并在 2019 年公司违反时花费了 50 亿美元的罚款。OpenAI 处于 2010 年的 Facebook 时刻,收集实践已建立但尚未被处以执行重锤。
平行之处延伸到 OpenAI 利用的“合法利益”漏洞。欧洲监管者用数年时间质疑 Facebook 声称行为广告服务于凌驾用户隐私的合法商业利益。在 2023 年由欧盟法院确认的比利时 DPA(数据保护局)针对 Facebook 的 2021 年裁决,确立了合法利益无法为收集全部用户数据提供所有可能未来用途的理由。OpenAI 声称每次对话可能以某种方式改善未来模型正好落入法院已经拒绝的过度行为。公司打赌 AI 特殊主义会豁免它们遵循社交媒体的规则,但 GDPR 没有做出这样的区分。
市场影响
OpenAI 仍保持私人公司状态,截至 2023 年底的最新融资估值为 860 亿美元,但潜在的隐私执行给更广泛的 AI 行业带来了连锁风险。已投资超过 130 亿美元并将 ChatGPT 集成到其产品线中的 Microsoft (MSFT),交易价格约为 425 美元,如果 OpenAI 被迫实施增加 API 成本的昂贵隐私控制,可能面临利润率压力。对 OpenAI 预计 2026 年收入 20-30 亿美元全球营业收入施加的 4% 重大 GDPR 罚款是可管理的,但降低训练数据 60-80% 的强制同意要求将从根本上改变 AI 开发的经济学。
对无限训练数据收集依赖的短期 AI 基础设施投资。Nvidia (NVDA) 交易价格约为 850 美元,在任何使大规模数据采集变得昂贵或不可能的监管变化下依然脆弱。如果 OpenAI 和竞争者必须为训练数据付款或补偿用户,对大规模计算集群的需求可能会停滞不前。反过来,像 Palantir (PLTR) 交易价格约为 28 美元的网络安全和隐私技术公司以及专注于隐私的云提供商可能会看到需求增加,因为企业寻求对 AI 实施的经过验证的隐私控制。2026 年第三季度爱尔兰调查进展过程中,AI 股票可能出现波动,初步发现如果强烈否定则可能出现 15-20% 的修正。