技术

微软在内部文件中称AI数据抓取为“人类历史上最大的劳动盗窃”

Adrian Kessler
在 Google 中添加我们

微软一名科学家给公司正在构建的东西起了个名字,这个名字可不太光彩。在审视大型语言模型如何从开放网络学习时,他称之为“人类历史上最大规模的劳动盗窃”。这句话原本是写给内部看的,如今却成了法庭上的呈堂证供。

这句话正被当作“抓个正着”:AI巨头自家员工把商业模式说成盗窃。但这么解读未免太狭隘了。这些解封文件真正揭示的,是一家公司明白自己正在变现的机制,用大白话描述了这一机制,然后照常把产品推向了市场。有趣的不是那句骂名,而是底下的那张示意图。

这份文件出自微软应用科学总监布伦特·赫克特(Brent Hecht)之手,在《纽约时报》起诉OpenAI和微软的版权案中浮出水面。赫克特认为,未经付费就用已发表作品训练模型,无异于“一场规模空前的惊人盗窃”。另一份内部演示材料则更进一步揭示了其中的机制:它警告说,微软的AI内容策略已经启动了一个“死亡循环”,会“同时损害我们模型的性能和整个网络”。其中一行写道,大型语言模型是“一种摧毁自身供应链的产品”。

最后这句话七个字道尽了故事。一个在搜索框内直接回答问题的聊天机器人,让用户失去了点击它所学来源页面的理由。点击减少意味着创作这些内容的网站收入下降,那就会有更多网站难以维系,也就意味着下一轮模型训练可用的新鲜人类文本更少。微软并非从外部推演这个循环。它自己的数据验证了这一点:Copilot的答案引擎使《纽约时报》网站的点击率比普通搜索下降了高达93%。

文件还量化了这笔交易的输入端。OpenAI的中期训练数据包含了超过9.1万份来自《纽约时报》、《每日新闻》和调查报道中心的作品。仅从Common Crawl提取的一个数据集就包含了来自nytimes.com的超过200万份文档。一个名为Project Mango的集合中至少包含了来自新闻出版商的16万份独特作品。文件描述了付费墙被绕过、版权声明在纳入训练前被剥离的情况。

OpenAI自家高管对后果也并非一无所知。负责ChatGPT的尼克·特利(Nick Turley)在文件中被引述称,这些产品对新闻业“很大程度上具有替代性”,并将这一转变称为出版商面临的“生存威胁”。这和赫克特得出的结论一致,只是职位不同罢了。

这些措辞之所以重要,并非仅仅因为让人难堪。微软已与这些言论保持距离,告诉法庭其实际立场符合版权法,两家公司也均拒绝对泄露事件置评。但合理使用辩护在一定程度上取决于公司知情和意图。自家科学家明确指出了危害——盗窃、供应链被摧毁、网络被掏空——这类文件并非公司可以轻易撇清的“个人观点”。它们更像是证据,表明公司在规模化之前就早已理解了这一机制。

这些模型所学习的网络是由那些以为另一端有读者在阅读的人建立的。微软的文件显示,它白纸黑字地知道,读者正在被设计出局——但它仍在继续建造。

标签: , , , , ,

在 Google 中添加我们

讨论

有 0 条评论。