英文原标题:Microsoft exec called AI scraping ‘the largest theft of labor in human history,’ new unredacted filings reveal

本文为英文原文的机器翻译摘要,原文见:TechCrunch AI ↗

  • 《纽约时报》三年前对OpenAI和微软提起的版权诉讼中,新解封的未删节文件显示,微软高管私下将AI抓取训练数据描述为“盗窃”,OpenAI领导层也承认其模型对出版商和记者构成“生存威胁”。
  • 文件详细描述了OpenAI和微软如何绕过付费墙、大规模抓取内容构建训练数据集,并故意从训练数据中删除版权声明。
  • 微软数据显示,其Copilot“答案引擎”导致《纽约时报》域名的点击率较传统Bing搜索下降高达93%,内部文件称之为“末日循环”。
  • 微软CEO纳德拉在证词中表示,任何付费墙内容都应获得许可才能用于训练,若知晓OpenAI抓取付费墙信息,他会要求OpenAI重新训练模型。
  • 文件首次披露,仅OpenAI的中期训练数据集就包含超过91,692份来自《纽约时报》、Daily News和调查报道中心的作品副本;一个源自Common Crawl的数据集包含超过200万份来自nytimes.com的文档。

关键数据

  • Copilot导致《纽约时报》域名点击率下降高达93%
  • OpenAI中期训练数据集包含超过91,692份原告作品副本
  • Common Crawl数据集包含超过200万份nytimes.com文档
  • Project Mango数据集包含至少160,903份新闻出版商作品

引语

  • “这是人类历史上最大的劳动力盗窃”
  • “我们为LLM业务创造了一种局面”
  • “ah nice”

为什么值得看:这些新解封的内部通信和文件可能削弱AI公司“合理使用”的抗辩,并揭示AI训练数据获取中的法律与道德争议。

站内导航