当地时间7月20日,美国旧金山联邦法院正式确认了Anthropic与作者群体达成的15亿美元版权和解协议。

这笔款项是目前已知美国版权案件中金额最高的一项和解,将用于赔偿大约50万部作品的权利人,平均每部作品约获得3000美元。超过91%的作者和出版商已提交补偿申请。法院同时批准了超过1.01亿美元的律师费用。

这15亿美元的和解金额,似乎印证了一个观点:AI公司因使用受版权保护的作品训练模型而付出了美国版权史上的最高昂代价。

然而,这一解读可能并不完全准确。

Anthropic支付的15亿美元,与其说是用于“AI训练”的费用,不如说是对其获取、复制和长期存储盗版语料行为的一次高额结算。

法院并未否定AI训练的合理使用

此案源于2024年,多位作者,包括Andrea Bartz、Charles Graeber和Kirk Wallace Johnson,起诉Anthropic,指控该公司从“影子图书馆”如Books3、LibGen、PiLiMi等处下载了数百万本书籍,并用其中部分作品训练其Claude大语言模型。

在案件审理过程中,法院实际上做出了两项具有不同侧重点的裁决。

一方面,法院认为Anthropic使用图书训练大语言模型具有显著的“转换性”。在案件的具体事实和证据条件下,这种训练行为可能构成美国版权法下的“合理使用”。这意味着,模型通过学习大量作品来掌握语言规律,并不等同于对作品表达的直接复制和替代。至少在该判决中,法院并未支持“未经许可使用版权作品训练模型必然构成侵权”的观点。

另一方面,法院指出,Anthropic为了构建一个可供反复使用的“中央图书馆”,从盗版网站下载并存储了超过700万本书籍。这些复制行为不能仅仅因为未来可能用于AI训练,就自动获得合理使用的保护。

训练目的和语料来源是两个独立的问题。AI训练可能具有转换性,但这并不意味着企业可以通过任何方式获取训练材料。最终用途的合法性,也不能反过来证明前端的盗版下载和复制行为是合法的。这构成了本案关键的法律界限。

15亿美元和解的核心在于语料来源

将Anthropic的行为细分,整个案件至少涉及四个环节:

  • 从盗版网站批量下载图书。
  • 将图书复制并存储于企业的“中央图书馆”。
  • 从图书库中抽取部分作品用于训练模型。
  • 模型训练完成后生成新的内容。

社会讨论通常将这四个环节笼统地称为“AI训练”,但版权法不会因为这些行为服务于同一项技术活动,就将它们视为一个不可分割的整体。

语料的获取涉及复制行为的合法性;语料的存储涉及复制的目的、期限和必要性;模型训练涉及转换性使用及其对原作品市场的影响;生成内容则可能涉及表达上的相似性、实质性替代以及输出端的侵权。

Anthropic在训练环节获得了有利的法律判断,但在语料获取和存储环节面临重大法律风险。双方最终达成15亿美元和解,正是因为后一环节可能带来的法定赔偿责任极其巨大。

因此,这笔和解不能被简单理解为“美国开始对AI训练收费”,更不能被解读为所有使用版权作品训练模型的企业都必须按照每部作品3000美元的标准支付许可费。

它真正传达的警示是,合理使用原则可以保护特定的使用方式,但不能为企业非法获取训练语料的行为“洗白”。

和解金额虽高,但未形成统一判例

15亿美元的和解金额具有里程碑式的意义,但和解本身并不等于法院作出了15亿美元的侵权赔偿判决。

Anthropic通过和解避免了案件进入审判程序,也没有因此承认所有相关的AI训练行为都构成版权侵权。对于和解范围内的既有争议,案件将进入补偿分配和收尾阶段;但选择退出和解的部分作者和出版商,仍有可能另行起诉Anthropic。

更重要的是,此前关于训练行为构成合理使用的判断,只是基于本案特定事实的地区法院裁决,并未为美国所有生成式AI案件确立普遍适用的规则。不同案件的语料来源、模型功能、输出方式、市场替代效应以及权利类型都可能存在差异。图书训练案件的结论,未必能直接适用于音乐、图片、新闻报道、计算机程序或影视作品。

因此,此次法院批准和解,同时释放了两个看似矛盾但可以并存的信号:

第一,AI训练仍有可能被认定为合理使用。 第二,以盗版方式建立训练语料库,可能导致威胁企业生存的巨额赔偿风险。

这并非AI版权争议的终局,而是版权风险的焦点开始从笼统的“能否训练”,转向对数据全生命周期的逐层审查。

AI企业需建立的,不止是版权许可清单

过去,许多企业在评估训练数据风险时,首先关注的是:使用这些作品训练模型是否构成合理使用?

Anthropic案表明,这个问题问得太晚了。

在判断训练用途之前,企业至少需要回答以下问题:这些数据从何而来?下载平台是否拥有合法授权?获取过程中是否规避了技术保护措施?企业存储了多少份副本?原始数据在训练完成后是否仍被保留?谁曾接触、复制或调用过这些数据?如果发生争议,企业能否证明每一批数据的来源?

因此,AI版权合规不能仅限于一份“禁止使用数据清单”,而需要建立贯穿数据全生命周期的证据链:来源可追溯、权利可核验、用途可区分、存储可控制、删除可证明。

对于采购第三方数据集的企业,仅仅依赖供应商承诺“数据可用于AI训练”是远远不够的。合同应明确数据来源、授权范围、转授权能力、侵权赔偿责任、审计权以及问题数据的删除义务。

对于使用开源语料库的企业,“公开可下载”并不等同于“版权已清理”。开源的是数据集的访问方式,还是数据集所包含作品的版权,这是两个截然不同的问题。

对于已经积累大量历史训练数据的企业,更实际的做法是尽快完成一次语料资产盘点。需要将合法购买、获得许可、公开授权、网络抓取以及来源不明的数据进行区分标识,并对高风险数据采取隔离、替换或删除措施。

Anthropic案最容易被记住的是15亿美元这个数字。然而,真正可能改变AI行业合规方式的,不是这个金额,而是法院在训练行为与语料获取之间划出的那条界线。AI模型能够学习什么,以及AI企业如何获取学习材料,是两个不同的问题。技术的转换性可能为模型训练提供合理使用的空间,但再先进的技术目标,也不能为盗版下载和无限期存储版权作品提供通行证。15亿美元并非对所有AI训练行为的统一收费标准。它更像是一张迟到的账单,当训练语料的来源无法解释时,企业最终需要支付的,可能不是许可费,而是对其整个数据获取方式的清算。

想了解更多九游全站相关内容,尽在九游体育。

九游体育围绕汇聚海量体育电竞资讯,实时更新不间断不断创新,回应用户的真实需求。

九游体育围绕九游体育不断创新,回应用户的真实需求。

管理员发布

2025年1月25日

精选九游娱乐内容,九游体育与你一同发现更多精彩。

围绕九游官网,九游体育持续打磨更优质的服务。 - 九游体育

九游体育娱乐平台整合体育资讯、电竞动态及精品游戏内容,涵盖足球、篮球、电竞等热门领域,为用户提供赛事新闻、实时比分、游戏攻略及社区互动服务,打造集资讯与交流于一体的综合平台。 malesuada 九游体育围绕深度赛事分析与预测,助您洞悉比赛脉络不断创新,回应用户的真实需求。

精选精品游戏攻略与评测,畅享沉浸式娱乐体验内容,九游体育与你一同发现更多精彩。九游体育专注九游全站,为用户提供专业可靠的体验。想了解更多汇聚海量体育电竞资讯,实时更新不间断相关内容,尽在九游体育。

围绕汇聚海量体育电竞资讯,实时更新不间断,九游体育持续打磨更优质的服务。

围绕九游官网,九游体育持续打磨更优质的服务。

  • 九游体育深耕九游真人领域,用心服务每一位用户。
  • 在九游体育方面,九游体育提供贴心周到的支持。
  • 九游体育以九游娱乐为核心,带来高效便捷的体验。
  • 九游体育深耕深度赛事分析与预测,助您洞悉比赛脉络领域,用心服务每一位用户。

想了解更多九游全站相关内容,尽在九游体育。

围绕九游官网,九游体育持续打磨更优质的服务。 - 九游体育 围绕九游官网,九游体育持续打磨更优质的服务。 - 九游体育

九游体育围绕深度赛事分析与预测,助您洞悉比赛脉络不断创新,回应用户的真实需求。

在精品游戏攻略与评测,畅享沉浸式娱乐体验方面,九游体育提供贴心周到的支持。
九游体育以活跃社区互动,与同好玩家畅聊交流为核心,带来高效便捷的体验。

新闻通讯

精选精品游戏攻略与评测,畅享沉浸式娱乐体验内容,九游体育与你一同发现更多精彩。

新闻通讯 - 九游体育