AI 热点快报:OpenAI 内部承认「GPT-3 是拿盗版书训的」——训练数据责任从「合理使用」转向「明知故犯」(2026-09-28)
事件与背景
2026 年 9 月 17 日,纽约南区联邦法院的 OpenAI 版权侵权多区诉讼(In re OpenAI, Inc., Copyright Infringement Litigation,案号 25-md-3143-SHS-OTW,主审法官 Sidney H. Stein)出现一批此前被涂黑、如今解封的文书。同一周,作家集体(Alter v. OpenAI and Microsoft)与新闻媒体机构各自提交了支持简易判决(summary judgment)的材料——这意味着双方开始要求法官「不必开庭、直接依事实判」。
作家方的核心文件是 Docket 1982《Class Plaintiffs’ Memorandum of Law in Support of Motion for Partial Summary Judgment》与 Docket 1987《Corrected Rule 56.1 Statement of Undisputed Material Facts》。材料把一条时间线摆上了台面:
- 2018 年 10–11 月:OpenAI 员工 Alec Radford 从盗版站 Library Genesis(LibGen)下载约 117,500 本书,其中 96 本是本案主张的作品。LibGen 自 2017 年起被美国贸易代表办公室(USTR)列为「Notorious Market for Counterfeiting and Piracy」。
- 2019 年 4 月:OpenAI 复制这份 LibGen 下载,用于训练后来被称作 GPT-3 的模型。
- 2019 年 6 月:微软按双方第一份《Joint Development and Collaboration Agreement》向 OpenAI 注入 10 亿美元。
- 2019 年 9 月–2020 年 1 月:员工 Benjamin Mann 与 Chris Hallacy 从 LibGen 抓取约 35 TB 数据,规模与 LibGen 全部虚构与非虚构馆藏(460 万本)相符,其中含 187 本本案作品。
- 内部认知:2019 年 8 月的笔记写着「We trained GPT-3 on pirated stuff! No sharing that!」;员工私下称 LibGen 为「pirated books」「violates copyright restrictions」「sketchy af」。发表 GPT-3 论文时,内部代号 Libgen1/Libgen2 被改成 Books1/Books2,文件自陈理由是「deliberately vague」——「since it’s libgen」。
- 2026 年 2 月庭外证词:Sam Altman 与 Satya Nadella 均确认,这类盗版行为「illegal」且「wrong」。
微软一侧同样被点名:OpenAI 曾向微软分发 LibGen1/Libgen2 数据,双方互传数据的安排被微软员工称为「horse trading」;微软向 OpenAI 交出全量 Bing Index 拷贝(代号 Project Taxi);OpenAI 还把 LibGen 书籍分发给第三方承包商做「book summarization」。据此,作家方主张微软作为算力方需承担连带责任——理由是它「有权且有能力监督」承载下载、存储与训练的 Azure 服务器,并从中获得直接经济利益。同一批解封材料里,新闻媒体方的文书则给出另一组数字:微软自家数据显示 Copilot 这类「答案引擎」使 NYT 域名的点击率最多下降 93%。
经 curl 验证返回 200 的来源:
- Authors Guild:Unsealed Briefs in Authors’ Case v. Microsoft/OpenAI
- Class Plaintiffs’ Memorandum of Law ISO Motion for Partial Summary Judgment(Docket 1982,S.D.N.Y.,2026-09-17,49 页 PDF)
- TechCrunch:Microsoft exec called AI scraping ‘the largest theft of labor in human history’(2026-09-17)
- Authors Guild:Bartz v. Anthropic Settlement——和解金额与每本书定价(2026-09-04 更新)
- Fortune:AI slop books are flooding online marketplaces(2026-09-14)
需说明的核验边界:Docket 1987 的 SUF PDF 本次多次下载均返回 200 但文件损坏、无法解析,故上文数量与引语全部取自可解析的 Docket 1982 备忘录;TechCrunch 亦明确提示,新闻媒体方那批新材料主要来自该方自己的 brief,底层 exhibits 仍处密封状态、引语缺少上下文,本文据此只作转述而不放大解读。
为什么现在重要
-
争点从「合不合法」变成了「知不知道」。过去两年法院对「用版权作品训练是否合理使用」总体宽松,真正的胜负手在合理使用四要素里的「有无正当理由」与「市场损害」。这批材料不争论抽象边界,而是把明知(内部承认 LibGen 是盗版、仍决定不买不授权、并在论文里改名)摆成无可争辩的事实。影响:模型公司过去依赖的「我们只是爬公开网页、不知道版权状态」这类抗辩,在文档化程度高的团队身上会迅速失效。
-
责任开始沿供应链向上游走。对微软的连带责任主张不基于「它训练了模型」,而基于「它控制算力且从中获利」。影响:云厂商、推理平台、数据标注外包会被卷进同一张责任网络,算力合同与数据合同需要分开审,不能再用一份总协议打包。
-
数据在组织间「再分发」是独立的风险链条。本案把「互传 LibGen 数据」「分发给承包商做书籍摘要」单独列为指控,而不是只算一次训练侵权。影响:数据湖、微调数据集、标注外包之间的每一次流转都是一个新风险点,跨团队共享一本书就可能增加一次主张。
-
盗版训练数据已有市场价:每本书至少 3,000 美元。平行案件 Bartz v. Anthropic 以 15 亿美元和解,约 50 万本书符合索赔资格(对应约 700 万份下载),规则为每本符合资格的书至少得款 3,000 美元(扣除费用后由权利人与出版商分成)。影响:任何「抓了但没授权」的书目规模都可以被直接折算成负债,这个数字已经把风险从法务术语变成可入账的金额。
-
市场损害已经能被量化,不再只是假设。作家方材料引用的学术研究显示:ChatGPT 发布后新书进入市场的数量激增,AI 生成书已进入 Kindle 各品类榜单前列;其中一项研究发现,AI 生成作品的涌入对人工撰写书籍的销量产生「depressive effect」,且不含 AI 文本的书作为一类卖得更差。《Fortune》同期报道亦描述了 AI 内容对线上书店创作者收入的挤压。影响:内容方在授权谈判里不再只靠情绪论证,「替代性」有了可引用的数据支撑。
-
司法与行政方向正在分叉。9 月行政当局提交了支持 OpenAI 未授权使用的意见书,而法院在多起案件里对市场损害越来越敏感(Bartz v. Anthropic 认定盗版「inherently, irredeemably infringing」;Kadrey v. Meta 与 Warhol v. Goldsmith 被反复引用)。影响:合规团队不能只押一条线——预算法务要按「法院收紧」准备,「政策风向」不能当对冲。
工程师/产品人今天能做什么
-
做一次训练/微调数据来源清单(provenance inventory)。逐条列出数据集的上游 URL、许可类型、获取方式与获取人。关键是往上追问一层:如果你的语料来自 The Pile、RedPajama 之类的公开合集,要查清其中 Books 子集(Books3 等)的上游是不是 LibGen 镜像——本案里「我们只是下载了一个公开数据集」不是抗辩。
-
本周内隔离来源不明的图书数据集。在所有微调集、RAG 索引、评测集里搜一遍:「books3」「libgen」「the pile」,凡命中就先停用或移出生产路径。容易漏的是评测集——本案的诉状正是拿数据集里的作品清单当证据,评测用书同样会被列举。
-
重写供应商条款,把算力方也纳入。至少补上四项:数据来源保证、审计权、停用通知期、退出协助。若你的训练/推理跑在第三方云上,请评估「谁有权且有能力监督」这个问题——本案把这条链延伸到了 Azure。
-
建立数据流转台账。任何跨团队、跨公司、或向外部承包方分发数据集的动作,都留下来源、许可、接收方与时间记录。本案把「horse trading」和「发给承包商」分别列为独立指控,台账是唯一能把「一次训练」和「N 次再分发」分开举证的东西。
-
开一条内容方异议与 opt-out 通道,并留档。在「有无正当理由」这一要素下,能证明团队有意识地、可追溯地减少损害是有价值的证据,而不是行政负担。
待观察
-
简易判决什么时候、怎么被裁。Authors Guild 表示未来数月还有 brief,听证预计 2027 年初。核心看点是法官 Stein 是否接受「逐次复制分别评价」的 Warhol 框架——一旦接受,下载、训练、互传、分发会被拆成四个独立侵权节点。
-
Docket 1987(SUF)的干净副本与完整数字。本次未能解析;其中带编号的事实清单是逐条核对数量与引语的最便利来源,值得在后续下载可用时单独复核。
-
是否出现新的和解定价。Bartz v. Anthropic 的每本书 3,000 美元是目前唯一的公开锚点;若本案或 NYT 案以不同单价和解,整个行业的数据采购成本模型都会被重新校准。