实时 AI 消息
微软内部称 AI 抓取是“人类史上最大规模的劳动窃取”,解封文件曝光
新解封的法庭文件显示,微软曾在内部把 OpenAI 的数据抓取做法称为“人类历史上最大规模的劳动窃取”。文件还披露,两家公司抓取了 Times 的付费内容并据此构建数据集,同时内部警告这种做法会重创出版商。

一批新解封的法庭文件,让微软与 OpenAI 在训练数据问题上的内部判断第一次完整暴露出来。根据 TechCrunch 的报道,这些未删节(unredacted)的文件显示,微软内部曾用 theft(窃取)这个词来形容 OpenAI 的数据做法。
文件披露的核心事实有三层:两家公司抓取了 Times 的付费内容,把这些内容用于构建训练数据集,同时在内部评估中警告说,这样的做法会掏空出版商。对外表述与内部判断之间的落差,是这批文件里最刺眼的地方。
更具冲击力的是一句内部评语——AI 抓取被形容为人类历史上最大规模的劳动窃取。这个说法把争议从版权合规推向了劳动与价值分配,也说明风险在微软内部并非无人知晓。
从诉讼角度看,这类内部文件通常会成为原告主张明知故犯的关键证据。版权方要证明的不是技术可能性,而是被告在行为发生时是否清楚自己在做什么、是否预见到损害,而这批文件恰好落在这一点上。
抓取 Times 付费内容这一细节,还把讨论拉回新闻出版业最敏感的地带。付费墙是许多新闻机构商业模式的核心,如果墙后的内容被直接用来训练模型,出版商在授权谈判中的议价空间会被进一步压缩。
过去几年,AI 公司与出版商之间一直在先谈授权、后补合规的灰色区间里推进。内部预警的存在意味着这些公司并非在信息真空中做决定,而是清楚代价、仍然选择推进。
后续要看两点:一是这批文件会在多大程度上被其他正在进行的版权案件引用;二是微软与 OpenAI 的公开表态是否会随之调整。无论结果如何,训练数据的原罪问题已经很难再用技术中立来回避。
为什么重要
内部文件把训练数据争议从技术问题变成责任问题,可能为多起版权诉讼提供“明知故犯”的证据,也会加大 AI 公司与出版商授权谈判的压力。
附近消息
全部09/18 03:44
Anthropic 称 Claude 已优化 30 多个开源生物分子模型
Unite.AI 报道,Anthropic 表示 Claude 已对 30 多个开源生物分子模型完成优化。这一结果把通用大模型的能力边界延伸到生命科学的研究流程之中,也再次引发 AI 能否加速科学发现的讨论。
09/18 04:00
联合国联手谷歌上线 Data Commons:把全球统计数据做成 AI 可直接调用的底座
联合国 9 月 17 日宣布与谷歌合作,基于谷歌开源 Data Commons 平台推出 UN System Data Commons,用自然语言查询取代原有的 UNData 门户,并支持 MCP 让 AI 系统直接接入数据。此举的直接触发点是联合国儿童基金会的一项测试:六个主流大模型回答全球发展指标问题时平均准确率只有 21.2%。
09/18 04:05
美媒报道:美国政府网站使用了被 FBI 指为抄袭 Anthropic 的中国 AI 搜索工具
据 whbl.com 报道,一个美国政府网站使用了一款来自中国的 AI 搜索工具,而 FBI 曾指称该工具抄袭了 Anthropic 的技术。报道把两条通常分开讨论的线索接了起来:对中国 AI 产品复制美国模型能力的指控,以及这类工具是否已经进入政府运营的公开服务。
09/18 03:01
西班牙AI Agent数据泄露报告等待AEPD审查
eWeek报道,一份涉及AI Agent的数据泄露报告正等待西班牙数据保护局(AEPD)的审查。围绕智能体处理个人数据时的合规边界,监管机构接下来怎么判断将受到关注。