当“AI饲料”,我都被AI嫌弃了?

  文 | 字母 AI

  2026 年 9 月 18 日,纽约南区联邦法院解封了一批文件,里面包含了 OpenAI 和微软的内部记录。

  材料显示,OpenAI 和微软通过采集别人生产的内容,训练自己的模型。

  但这并不是个例,我们在网上记录的点点滴滴,如今正逐渐变成 AI 的“饲料”。

  AI 不会给你点赞、收藏或者转发,因为它压根不理解你创作的内容,只是把你留下的一切收进去,变成它自己的一部分。

  于是写作、绘画、说话、歌唱、拍照,这些原本属于人的事,忽然变成了 AI 发展的核心。

  但是你也不必太担心,有一个不知道是好是坏的消息,未来 AI 不会再把我们当成饲料了,因为它马上学会自己造饲料。

  事件来龙去脉

  2026 年 9 月 17 日,纽约南区联邦法院解封了一批文件。这批文件来自《纽约时报》起诉 OpenAI 和微软的版权案,内容是两家公司的内部记录。

  在一份内部备忘录里,微软应用科学总监布伦特·赫克特(Brent Hecht)把用全网内容训练大模型称为“一场规模前所未有的惊人盗窃”,并说这很可能是“人类历史上最大的一次劳动盗窃”。这句话出自被告公司的员工,不是原告的指控。

  这起官司已经打了将近三年。

  原告是《纽约时报》,被告是 OpenAI 和微软。此前庭审的走向总体上支持“用版权内容训练模型属于合理使用”。这批解封材料的不同之处,在于它提供的是被告自己的内部记录,而不是法律论证。

  微软的内部测算显示,Copilot 上线后,《纽约时报》域名的点击率相比传统 Bing 搜索最多下降 93%。

  在内部演示文稿中,赫克特把这种下滑称为“死亡循环”,认为它“会同时伤害我们模型的表现,也会伤害整个互联网”。

  他还写道,一个终端产品威胁到自己关键供应商的经济根基,这种情况极不寻常,但这是模型业务和它的“内容供应链”造成的局面。文稿中的“供应商”,指的就是生产内容的新闻媒体。

  ChatGPT 负责人尼克·特利(Nick Turley)在内部沟通中说,ChatGPT 这类产品对出版机构构成“生存威胁”,而且“在很大程度上是替代性的”,“随着它们变得更强,会越来越具有替代性”。

  OpenAI 总裁布罗克曼说,这些模型“非常擅长新闻”。纳德拉在今年作证时承认,和聊天机器人对话“已经替代了直接去网站获取信息”。

  然而法律要求不能“替代或损害原作品的市场”。

  文件同时还给出了训练数据的规模。仅 OpenAI 的训练数据集中,就包含《纽约时报》《每日新闻》和调查报道中心的作品 91692 份拷贝。

  在一个从 Common Crawl 派生的数据集中,仅 nytimes.com 一个域名就抓取了两百多万份文档。不过其他媒体表示,从《纽约时报》抓取 390 万份,从《芝加哥论坛》报及其相关报刊抓取 730 万份。

  此外还有一个名为 Project Mango 的项目,其数据集包含至少 160903 部新闻出版方的独立作品。OpenAI 把整个 GPT-3 训练数据集交给了微软,微软则通过 Project Taxi 和 Project Mango 把数据回输给 OpenAI。

  文件中还记录了具体操作方式。

  OpenAI 研究员尼克·赖德(Nick Ryder)告诉布罗克曼,自己有一个“绕过纽约时报付费墙的黑客方法”,布罗克曼回复“不错”。

  两人搭建的数据集 WebText、WebText2,有相当大一部分是从网上直接抓来的新闻报道。还从 Common Crawl 拉取了数百万篇文章。

  此外,在数据进入模型前,他们会刻意删除版权声明,因为研究人员“不想让模型向用户输出‘版权声明’”。

  原告代理律师史蒂文·利伯曼(Steven Lieberman)说,证据表明,OpenAI 和微软知道自己在做的事是错的。

  微软对这批文件回应称,相关言论只是反映了一名员工的个人观点,不是法律分析,更不代表公司立场。赫克特并非决策者,公司雇他是为了“呈现不同的、非对称的视角”。

  还有谁在喂 AI?

  实际上 OpenAI 已经是“二进宫”了。

  2023 年 9 月,美国作家协会连同 17 位作家,如约翰·格里森姆(John Grisham)、乔治·R·R·马丁(George R. R. Martin)、朱迪·皮考特(Jodi Picoult)、大卫·鲍尔达奇(David Baldacci)、乔纳森·弗兰岑(Jonathan Franzen)、斯科特·图罗(Scott Turow)等人。

  在纽约南区对 OpenAI 提起集体诉讼。此后,多起作家诉讼(特伦布莱(Tremblay)、西尔弗曼(Silverman)、夏邦(Chabon)等)陆续并入,原告规模还在扩大。

  《纽约时报》诉状里的证物J,标题叫《GPT-4 记忆〈纽约时报〉内容的一百个例子》,整整 127 页。喂给它一篇文章的开头,它能几乎逐字补完剩下的部分,连署名和引语都在。

  2026 年,arXiv 上发布了一篇名为《对齐打地鼠》的论文。

  研究者把模型微调成“按情节写全文”——只给情节摘要,不给原文。结果 GPT-4o、Gemini 2.5 Pro 能复现出 85% 到 90% 的版权书籍原文,单段逐字复现超过 460 个词。研究者给这种现象起了个名字,叫“对齐打地鼠”:你堵住一个漏洞,它在别处又冒出来。

  这不是偶然。尼古拉斯·卡尔利尼(Nicholas Carlini)早在 2023 年就说过:模型越大、你那段数据被重复喂的次数越多、上下文给得越足,它记得就越死。

  实际上扒取网上的公开资料,把人们的记录变成 AI 饲料的,远不止于 OpenAI 和微软。

  2026 年 9 月 4 日,一起集体诉讼递到了伊利诺伊北区联邦法院。原告是两个家庭,连同他们的孩子。诉状指控 Meta 未经同意,抓取 Facebook 和 Instagram 用户的照片和生物特征数据,用来训练三样东西:人脸识别系统 NameTag 背后的模型、给 NameTag 做比对用的“人脸指纹”,以及生成式图像模型 Emu 和 Muse Image。

  NameTag 是给 Ray-Ban 和 Oakley 智能眼镜准备的。早在 2026 年 6 月初,就有人发现在 Meta 的配套 App 里存在 NageTag 相关的代码,只不过当时并不知道这个功能是干什么用的。

  Meta 的回应是:“这起诉讼没有依据,曲解了我们的工作……NameTag 没有向消费者发布,也没有最终决定要做什么。”它还强调,自己“不是在建立一个通用的人脸数据库”。

  话虽如此,但 Meta 已经是第三次因为人脸识别被告上法庭了。

  2021 年,它因为“自动标记好友”违反伊利诺伊《生物识别信息隐私法》,赔了 6.5 亿美元,约 142 万伊利诺伊用户分钱,有人拿到了 400 多美元。2023 年,Instagram 的人脸识别又让它赔了 6850 万美元,约 400 万伊利诺伊居民符合资格。Snap 也因类似问题在 2016 年赔了 3500 万美元。

  这部法律的罚则是每人每项 1000 到 5000 美元。

  从金额来看,以 Meta 的用户规模,Meta 可能要赔付超过 10 亿美元。不过 Meta 仍然选择付钱,毕竟相对于赔偿而言,法庭并没有阻止 Meta 继续开发模型,因此赔偿仍在可接受的范围内。

  Meta 的采集对象,也不只是用户。

  2026 年 4 月 21 日,Meta 在美国员工的工作电脑上安装一款追踪软件,实时记录鼠标移动、点击位置和键盘输入,并定期截屏,用来训练它的 AI 模型。

  这款工具叫“模型能力计划”(Model Capability Initiative)。Meta 首席技术官安德鲁·博斯沃思(Andrew Bosworth)在内部备忘录中说,长期目标是把 AI 智能体培养成“承担工作”的角色,人类员工则转为“指挥、审查和协助改进”。

  这个项目后来改名为“Agent 转型加速器”。Meta 的发言人称,这些数据只用于训练模型,不用于绩效考核,并设有保护敏感内容的措施。

  但据媒体报道,采集范围覆盖员工日常使用的各类应用和网站,包括谷歌、GitHub、Slack,甚至个人 Gmail;美国员工无法退出,只有受欧盟《通用数据保护条例》约束的欧洲员工被排除在外。

  同一周,Meta 裁掉约 8000 名员工,不少员工因此担心,自己正在亲手训练将来取代自己的 AI。到 2026 年 6 月,Meta 暂停了这项计划,原因是追踪工具抓取到了敏感信息,且这些信息一度被全公司访问。

  Meta 的手,也不只伸向自家平台。

  Meta 专门有个用来扒视频内容的爬虫,名为 MSAE。Meta AI 自己承认,训练数据里有 370 万条 YouTube 视频转录文本的第三方数据集。

  2026 年 1 月,包括 h3h3 Productions、Mr. ShortGame Golf、Golfholics 在内的几位 YouTube 博主,合计 620 万订阅,在加州中区联邦法院起诉 Snap,指控它用后端自动化工具,把数百万条 YouTube 视频的视听文件成批下载下来,塞进 HD-VILA-100M 和 Panda-70M 数据集,用来训练“Imagine Lens”这类的图像编辑能力。

  诉状没有走传统版权路线,而是主攻《数字千年版权法》第 1201 条的反规避:YouTube 的设计是让人在线观看,不是让人拿到原始文件,Snap 涉嫌在规模化层面,违反了该法律法规。

  原告之一伊桑·克莱因(Ethan Klein)还顺手把英伟达、Meta、字节跳动、亚马逊、OpenAI、苹果一并告了。他的说法是,这些公司“一天能抓走 80 年的内容”。

  搜索是谷歌的核心业务,因此谷歌也在名单上。

  2026 年 7 月,阿歇特出版集团、Cengage、爱思唯尔,连同畅销书作家斯科特·图罗,在纽约把谷歌告了,指控它用数百万本版权书籍训练 Gemini。诉状称,谷歌从“已知的盗版来源”抓内容,甚至绕过学术网站的付费墙,去拿爱思唯尔旗下《柳叶刀》、《细胞》的文章。

  诉状称:Gemini 可以在 20 分钟内,用 0.39 美元,生成一部 10 万字的悬疑小说。谷歌内部文件也警告过,这么做可能“给谷歌带来 100 亿到 1000 亿美元的潜在罚款”。

  语音和音乐,也没能幸免。

  苹果的 Siri,把“意外唤醒”时的录音交给外包合同工去听。据外媒报道,里面充斥着医生和病人的对话、商业谈判、疑似犯罪交易。有评估员一天要听多达 1000 条。苹果最终以 9500 万美元和解。

  2024 年 6 月,RIAA 代表环球、索尼、华纳,把 AI 音乐公司 Suno 和 Udio 告了,指控它们用受版权保护的录音。

  最后一批饲料

  不过我们也不需要担心什么,因为我们即将成为 AI 的最后一批饲料。如今,AI 公司,已经开始自己喂自己了。

  2026 年 6 月,Anthropic 发了一篇博客,标题叫《当 AI 建造自己》。里面提到,截至 2026 年 5 月,合并进 Anthropic 生产代码库的代码,超过 80% 是 Claude 写的,不是人写的。在那之前,这个比例还只是个位数。

  也就是说,15 个月里,这家公司把绝大部分编程工作交了出去。有工程师已经五个月没写过一行代码;他们每天合并的代码量,是几年前的 8 倍。

  2026 年 9 月 17 日,Anthropic 又发布了一份报告,标题是《衡量 AI 发展的速度》,这篇文章主要讲的是“研发工作有多少由 AI 主导”。它采用 Epoch AI 提出的自动化等级,从完全没有 AI 参与的 AL0,到 AI 完全自主的 AL5 来划分。

  其中 AL4 指 AI 能从一句大致的目标出发,端到端完成大部分工作,人类只负责监督和最后决策。

  文章提到,2026 年 2 月,Anthropic 达到 AL4 这一级别的研发工作还不到1%。5 月是 12%,7 月是 22%,8 月已经升到 26%。

  如果把标准放宽到“AI 在人的密切指导下完成大块工作”的 AL3,则有超过 90% 的研发工作达标。报告还提到 Anthropic 内部最主要的 Agent 平台上,任意时刻约有 3 万个 AI Agent 在从事研究和工程工作,仅在 2026 年 8 月就产生了超过 10 亿次决策。

  OpenAI 那边,走的是另一条路。

  2026 年 7 月,OpenAI 披露,发布 GPT-5.6 时,它用最强的 Sol 模型,去自主“后训练”了一个更小的模型 Luna。研究员只给了一句“相当不充分的提示”,Sol 就自己找训练配置、挑 GPU、启动训练脚本、验证运行,还顺带生成了合成训练数据。

  这项工作,过去要两个资深研究员做两周。在 OpenAI 内部的“递归自我改进指数”上,Sol 比上一代 GPT-5.5 高出 16.2 分。

  Anthropic 把这件事叫递归自我改进。它的本质,是训练数据的来源,正在从“人类生产的内容”,切换成“AI 自己生成的内容”。

  而你,就是这次切换完成之前的,最后一茬人类饲料。

  问题是,AI 自己生成的数据,撑得起下一波模型吗?

  2024 年,舒马伊洛夫(Shumailov)等人在《自然》上发了一篇论文,标题为《AI 模型在递归生成数据上训练时会崩溃》。

  他们发现,如果反复用合成数据训练模型,模型会“坍缩”,输出的多样性不断收窄,尾部信息被系统性抹掉,最后变成一种“语法正确、但语义空洞”的状态。

  论文的结论是,你不能用合成数据完全替代人类数据,必须两者叠加。只要原始的人类信号还在,模型就还健康。

  所以现在行业的配方,大概是 10% 到 30% 的真实人类数据打底,剩下的靠模型自己喂自己。

  那 10% 到 30%,就是我们还剩的用处。但很可惜,连这个用处也在倒计时。

  一旦合成数据的质量足够稳定,一旦这个闭环转得够顺,人类数据就再也没有采集的必要。