在纽约时报诉 AI 版权案中,美国司法部提出训练 AI 模型使用版权内容属于合理使用,与此前版权局报告直接矛盾,局势因人事变动更趋复杂。
在涉及《纽约时报》的版权纠纷中,美国司法部已站在 AI 公司一边,认为用版权材料训练 AI 模型属于合理使用。
司法部表示,用版权文本训练大语言模型不构成版权侵权,因为训练阶段的复制与模型实际输出之间存在法律层面的区别。
司法部认为,LLM 具有创造性和社会价值。仅因 AI 训练就追究责任,会扼杀版权法本应保护的创造力。
美国司法部已在合并诉讼中站在 AI 公司一边,该诉讼涉及《纽约时报》和其他权利人,司法部认为用版权材料训练 AI 模型属于合理使用。
2023 年底,《纽约时报》在曼哈顿联邦法院起诉 OpenAI 和微软,指控数百万篇《纽约时报》文章被未经许可用于训练 GPT-4 等模型,并开发与该报竞争的信息源产品。《纽约时报》索赔数十亿美元,并要求销毁用其文章训练的语料模型。此案此后显著升级,被广泛视为法院如何处理版权与 AI 训练的晴雨表。
司法部现在表示,此案中用于 LLM 训练的版权文本不构成版权侵权。关键在于训练与输出之间的区别。训练期间,整部作品被复制但从不公开发布,而输出"往往与原作缺乏实质性相似"。将两者混为一谈的市场损害理论在法律上是错误的。当然,也有人持不同意见。
这份文件引用了琼·迪迪恩(Joan Didion)作为类比。她十几岁时曾抄写海明威的故事,以理解他句子的运作方式。司法部认为,按照 Kadrey 案判决的逻辑,迪迪恩每次发表作品时都可能面临责任,因为她的学习过程和后续写作被视为一次使用。司法部引用了早期的一项裁决,认为要求人们在借助某本书写出全新方式的新作品时支付费用,是不可想象的。
司法部还认为,LLM 具有创造性和公共价值。"人类正在使用 LLM 创造原创作品,"司法部写道。"对 AI 训练追究责任会扼杀版权法本应保护的创造力。据报道,就连《纽约时报》的作者们也使用 LLM 来起草和编辑文章——不过所引用的信源讽刺地支持的大体上是相反的结论。
而且所有这些论点都掩盖了规模问题。一个作者复制文本来学习是一回事。将这些内容转化为竞争性大众产品的价值数十亿美元的公司又是另一回事——美国版权局已明确表达了这一观点。
特朗普政府在版权之争中采取亲 AI 立场
这正是美国版权局在一份报告中表达的立场,该报告拒绝了 AI 训练的全面合理使用。版权局认为,AI 能够完美复制,并以远超人类创造的速度和规模生成内容。在现有市场上与原作竞争的commercial应用超出了合理使用的允许范围。
司法部在其文件中直接反驳了那份报告。前版权登记官希拉·佩尔穆特(Shira Perlmutter)的评估不具有任何约束性的法律效力,司法部认为,而且该报告忽略了逐案分析的法律先例以及成文法规下实际构成市场损害的类型。
"合理使用的调查取决于每个案件中涉及的具体事实和使用方式。但如果实施广泛的版权责任,使 AI 模型训练一般性地变得需要许可才能进行,这将是有问题的——而且在法律上是错误的,"司法部写道。
佩尔穆特在那份报告发布后不久就被特朗普政府解雇。民主党人乔·莫雷尔(Joe Morelle)表示,她被解雇是因为拒绝为基于版权作品的 AI 训练正名——这是特朗普盟友埃隆·马斯克青睐的立场。司法部在一个脚注中指出,佩尔穆特目前正在挑战她的解雇决定。