← 返回新闻列表
TechCrunch AI 🗓️ 2026-07-09 🌍 英文原文

《纽约时报》称 OpenAI 在 ChatGPT 版权审判中隐藏了证据

原始标题:Breaking: New York Times says OpenAI hid evidence in ChatGPT copyright trial
⚡ 一句话看懂:新闻出版商表示,OpenAI 隐藏了可以识别 ChatGPT 输出中受版权保护的新闻的工具和数据集,通过一项新的制裁动议…

《纽约时报》和《每日新闻》声称,OpenAI 在搜索客户聊天日志数据和培训数据集以获取其受版权保护的作品的能力方面一直撒谎。

这是两岁儿童的最新一次升级 针对人工智能公司的诉讼 涉嫌违反版权法,根据《纽约时报》的内容训练其生成人工智能模型,并在用户输出中复制该新闻报道。

在整个案件中,OpenAI 辩称它缺乏搜索自己的训练语料库的能力。

它还认为,搜索或生成大量 ChatGPT 对话集合在技术上会很麻烦,并且会提高 用户隐私问题 因为日志需要被检索、处理和去识别化。

这些媒体寻求这些数据来确定 OpenAI 的训练数据集中是否存在其受版权保护的新闻,以及 ChatGPT 是否以及使用或复制其内容生成响应的频率。

在四月份法庭下令的证词中,OpenAI 数据隐私工程师 Vinnie Monaco 据称透露,OpenAI 已经对其训练语料库进行了内部搜索和评估,以搜索受版权保护的新闻作品。

据称,Monaco 的证词还透露,在《纽约时报》提起诉讼之前,OpenAI 已经积累了约 7800 万条去识别化的 ChatGPT 对话的数据库,并在内部使用该数据库来确定其对他人作品的侵权程度。

据称,除了该数据集之外,OpenAI 还实施了所谓的“Bloom”过滤器,作为名为“Project Giraffe”的一组工具的一部分,该工具在提起诉讼后不久检测并保存输出中的反流记录。

最后两个启示尤其重要。

原告最初要求 OpenAI 提供 1.2 亿条聊天记录的样本,但 OpenAI 经协商将样本减少到仅 2000 万条。

OpenAI 最终于去年 12 月向法院提交了该样本,但据称它包含了如此多的编辑内容,以至于用法院的话说,该样本“无法使用”。

原告还声称 OpenAI 删除了数十亿

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接