历时近两年集体诉讼案于2026年7月20日落幕,该金额接近公司此前两年累计营收的30%,成为AI行业首例因使用受版权保护书籍数据训练模型而达成的高额和解案例。
美国人工智能公司Anthropic与出版商集团之间的图书版权纠纷案件已获法院批准和解,协议要求Anthropic向原告方支付15亿美元赔偿金。该诉讼始于2024年8月,持续至2026年7月20日结案,涉及多家出版社指控Anthropic在其大模型训练过程中未经授权使用受版权保护的电子书籍内容。
案件核心证据来自Anthropic于2021年12月发表的一篇技术论文,其中明确披露其早期模型训练数据源自Common Crawl网络爬虫及包括The Pile数据集在内的多个公开语料库。该数据集中包含名为Books3的子集,收录近20万本未经版权授权的电子书文本。尽管Books3后续已被移除,但调查证实Anthropic在2024年承认其商用模型Claude系列确曾利用含侵权内容的The Pile数据进行训练。法院认定该行为构成对著作权的实质性侵犯,促成此次和解协议达成。
据路透社此前披露数据,Anthropic在2023至2025年间累计实际营收约为50亿美元,15亿美元和解金占其两年总收入的30%,对公司现金流造成显著压力。此案是人工智能领域首次因模型训练数据版权问题引发的大规模集体诉讼并达成高额和解,可能为后续类似案件设立先例。出版行业将借此重新评估与AI企业的数据授权机制,而多家科技巨头已开始审查自身训练数据来源合法性,以避免面临同类法律风险。