💻 technology
By WNT
AI 的版权盗窃:无人预料的诉讼
人工智能公司抓取了整个互联网来训练他们的模型,如今创作者们想要他们的一份。从 Sarah Silverman 起诉 OpenAI 到 Getty Images 要求数十亿,AI 版权侵权的法律战场已成为我们这一代的定义性知识产权之争。
基本的指控很简单:AI 公司在未经许可或支付费用的情况下,吸收了受版权保护的书籍、文章、图片、代码和音乐。OpenAI、Meta、Stability AI、Anthropic 等公司通过让他们的模型训练于人类花费多年创作的作品上,建立了价值数十亿美元的企业。如今,诉讼堆积速度快过 ChatGPT 的响应,而法律系统正努力弄清这是否构成历史上最大的版权盗窃,还是属于合理使用。
Getty Images 在 2023 年 1 月发起了首轮攻击,在美国和英国法院起诉 Stability AI,指控其从数据库中复制了 1200 万张照片用于训练图像生成器 Stable Diffusion。确凿证据?Stability 的模型偶尔会吐出带有 Getty 水印的图像,虽然遭到破坏但依然可识别。Getty 已不再要求许可协议,他们想要追求可能达到数十亿的法定赔偿。在纽约南区(案件 1:23-cv-00135)中,法官 Katherine Polk Failla 正在权衡 Stability 的抓取行为是构成转化性的合理使用还是公然侵权。截至 2024 年 5 月,该案在 Stability 提出驳回动议后生存下来,这意味着发现阶段将迫使公司透露确切的训练数据及其使用方式。
作家公会协调发起的集体诉讼如同美国文学界的名人录。Sarah Silverman、John Grisham、Michael Chabon、George R.R. Martin 和 Jodi Picoult 均起诉了 OpenAI 和 Meta(加州北区案件 3:23-cv-03416 和 3:23-cv-03223)。他们的申诉很优雅:当您提示 ChatGPT 或 LLaMA(大型语言模型 Meta AI)总结他们的书籍时,模型会产生准确的情节细节、角色发展,甚至模仿写作风格,证明完整的受版权保护文本在训练期间被吸收。OpenAI 的辩护基于两个支柱:合理使用(训练是具有转化性的,不会取代原始市场)和从受版权保护的作品中学习是人类每天都在做的事情的论点。法官 Vince Chhabria 并没有完全买账。在 2024 年 2 月,他允许核心版权索赔继续进行,同时驳回了一些关于数字千年版权法案(DMCA)违规的衍生索赔。
音乐行业强势介入。美国唱片业协会(RIAA)代表环球音乐集团(UMG)、索尼音乐娱乐公司和华纳音乐集团,起诉了 AI 音乐生成器 Suno 和 Udio(2024 年 6 月,马萨诸塞州地方的案件 1:24-cv-05410 和 1:24-cv-05311)。他们的证据是确凿的:他们用特定的歌词或风格提示 AI,结果得到的输出复制了 Mariah Carey、ABBA 和 James Brown 的录音片段。Suno 首席执行官 Mikey Shulman 在接受 BBC 采访时承认公司是在受版权保护的音乐上训练的,但认为输出是具有转化性的。RIAA 不同意,他们正在寻求每项故意侵权作品 150,000 美元,并在投诉中仅记录了 400 多首歌曲。
AI 公司实际上是如何应对这个法律地雷区的呢?策略分为四个类别:
- 合理使用辩护:声称训练 AI 是根据版权法第 107 条的转化性使用。指向 Google Books(作家公会诉谷歌,2015),扫描数百万本书以供搜索被认为是合理使用。
- 无访问即无侵权:辩称一旦训练完成,模型不“存储”受版权保护的作品,因此输出不是复制品。这在 GitHub Copilot 诉讼中部分成功,2023 年 11 月,法官 Jon S. Tigar 指出原告难以证明直接复制。
- 许可合作:OpenAI 在 2023-2024 年与美联社、Axel Springer 和金融时报签署协议,授权内容。这些协议通常每家主要出版商每年支付 500 万至 1000 万美元,相对于训练数据的实际价值是个零头,但足以创造一个“好演员”叙事。
- 责怪开放的互联网:公司声称他们抓取的是公开可用的数据,法院历史上对待这类内容与收费墙内容不同。计算机欺诈和滥用法案(CFAA)通常不适用于公开网络抓取(hiQ Labs 诉 LinkedIn,第九巡回上诉法院 2022)。
但更狂野的是:卡内基梅隆大学和艾伦人工智能研究所的研究人员在 2023 年 11 月发表了“从(生产)语言模型中大规模提取训练数据”。他们展示了 GPT-3.5 可以通过提示逐字重现《哈利·波特》的段落,确认模型记忆了实质性的受版权保护的内容,而不仅仅是统计模式。
欧盟的 AI 法案于 2024 年 8 月生效,要求 AI 开发者发布受版权保护的训练数据的详细摘要。第 53 条特别要求透明化关于使用了哪些内容,为权利持有人提供了起诉的路线图。日本则提供了相反的方法:其 2019 年修订的版权法第 30-4 条明确允许为非表达性质使用对受版权保护的作品进行 AI 训练。这就是为什么 Stability AI 在 2023 年将大量业务迁至东京。然而,日本法院仍然禁止输出重现原始作品“表达”,形成与美国合理使用辩论相似的模糊界限。
我的看法
AI 行业的“先斩后奏”策略正在实时崩溃,他们绝对自找的。这些公司在抓取盗版书籍、使用 YouTube 转录本以及复制 Getty 的整个目录时,完全知道自己在做什么。合理使用辩论是侮辱性的。Google Books 赢得了,因为他们展示的是搜索的片段,而不是构建与作者竞争的商业产品。当 ChatGPT 能够以 George R.R. Martin 的风格写作或总结 John Grisham 小说的整个情节时,那不是转化,而是带有额外步骤的工业规模抄袭。
真正的悲剧是合理的许可系统是可能的。想象一下,如果 OpenAI 在 2020 年与作家协会接洽,并表示:“我们想在您成员的作品上进行训练。这是集体许可费和当我们的模型引用您的书籍时按查询支付的版税。”作者本可以参与,AI 本可以进步,而我们本可以避免这场法律灾难。相反,Sam Altman 和他的同行决定他们不受版权法约束,如今他们面临着可能迫使他们仅使用授权数据重新训练模型的生存性诉讼,这一过程将耗费数亿美元,并将其产品路线图推迟数年。法院需要狠狠打击他们,以便让下一代 AI 构建者学会尊重他们所商品化的劳作者。
接下来会发生什么
作家协会案件中的 Chhabria 法官的裁决,预计将在 2026 年夏末公布,将要么为 AI 在合理使用下的训练开绿灯,要么强迫整个行业重置。如果他支持作者,OpenAI 和 Meta 面临的选择是:追溯许可历史训练数据(规模上可能不可能)或使用仅获许可的内容重新训练基础模型。重新训练 GPT-5 或 LLaMA 4 的计算成本仅为数亿美元,并且将导致发布推迟一年多,使在不同法律制度下运作的中国 AI 实验室获得优势。Anthropic 和 Google,由于对训练数据来源更加谨慎,将突然显得颇具洞察力。
真正的混乱将来自下游责任。如果法院裁定 AI 训练构成侵权,中,使用这些模型的每家公司,从运行 Casetext 的法律研究公司到使用 GitHub Copilot 的开发者,都可能成为共同侵权的潜在被告。公司法律部门已经在起草赔偿条款,要求 AI 供应商承担版权责任,但如果供应商在法定损害赔偿下破产,这些条款将毫无价值。预计到 2027 年将出现专门针对“AI 版权风险”的保险产品,价格之高将扼杀在医疗和金融等风险厌恶行业中的采用。
这是没人考虑到的情景:国会真的通过立法。由 Tillis 和 Coons 两位参议员于 2026 年 3 月提出的两党“生成性 AI 版权披露法案”将要求对数据集进行培训前注册,创建具有法定费率的强制许可计划,并设立 AI 版权办公室。如果它通过(在选举年不太可能,但在 2027 年初的跛鸭会议中可能),它将优先于州法律和正在进行的诉讼,并为现有模型创建一个混乱的祖父条款。AI 公司可能实际上更喜欢联邦立法而不是当前的司法决定拼凑:比起面对数十亿美元的陪审团裁决,支付已知的许可费用要好得多。但国会设定的费率可能足够惩罚,使 AI 训练经济上不可行,尤其是对于没有 OpenAI 资本储备的初创公司。
历史告诉我们什么
最接近的历史类比是 1980 年代和 1990 年代的音乐采样战争。当像 Public Enemy 和 De La Soul 这样的嘻哈制作人用数十个未获许可的采样制作曲目时,录音行业最初将其视为一种小众艺术形式。然后,在 1991 年,Biz Markie 在 Grand Upright Music, Ltd. 诉 Warner Bros. Records 案件中败诉,法官 Kevin Duffy 在意见书中以“汝不可偷窃”开始,并将案件移交刑事起诉。一夜之间,基于采样的音乐从创意共有变成了法律雷区。制作人必须清除每个采样,即使是三秒钟的片段,其费率通常超过整首歌的预算。De La Soul 的专辑《3 Feet High and Rising》等专辑仍然无法在流媒体服务上使用,因为清理追溯样本被证明是不可能的。
AI 版权之争遵循相同的轨迹,只是压缩了时间。早期的生成模型在作为研究项目时低调。现在 ChatGPT 和 Midjourney 成为了价值数十亿美元的企业,权利持有人希望拥有他们的 Biz Markie 时刻。区别在于规模:而一首嘻哈曲目可能采样 20 首歌曲,GPT-4 是在数百万部受版权保护的作品上进行训练的。如果法院严格申请采样先例,AI 公司面临与 1990 年代制作人相同的二元选择:为每个输入付费或关闭。音乐行业最终开发了机械许可系统和样本清除数据库,但花了 15 年时间,扼杀了整个审美制作方法。AI 可能会更快获得强制许可计划,但中间的混乱同样可能对创新造成破坏性影响。
市场影响
版权诉讼已经在重塑 AI 市场动态。微软(MSFT,目前交易价格约为 $412)通过其 130 亿美元的 OpenAI 投资和 Azure AI 服务有重大风险敞口。如果法院裁定不利于合理使用,微软承诺为使用 Copilot 和 Azure OpenAI 的企业客户承担责任,这一责任如果主要案件对原告有利,可能达到数十亿。短期看跌压力打击 MSFT,如果 Chhabria 法官支持作者。然而,微软的财力雄厚且已有内容许可协议(LinkedIn 数据,动视暴雪 IP 后合并)使它比纯 AI 初创公司更具优势。
Alphabet(GOOGL,交易价格接近 $168)实际上受益于对竞争对手不利的裁决。谷歌在训练 Gemini 数据时更加保守,主要依赖于他们拥有的 YouTube 内容和通过谷歌新闻计划合作伙伴获得的许可新闻。他们也是唯一拥有开创性合理使用胜利(Google Books)的主要参与者。如果竞争对手因版权责任而受阻,谷歌的搜索和云 AI 服务将获得市场份额。
版权玩法是 Invesco Dynamic Media ETF(PBS,当前约 $23),其中持有 Getty Images、华纳音乐集团以及其他内容拥有者,这些公司有能力从 AI 公司提取许可费。如果强制许可通过国会,这些公司将获得一个价值潜在数十亿的新收入来源。对于个股而言,华纳音乐集团(WMG,接近 $31)被定位为 AI 版权受益者:他们积极诉讼,拥有要求高额许可费的目录杠杆。