我们对 12,750 篇 arXiv 论文的全文进行了评分,发现大约三分之一的新论文是机器编写的。
这是方法、结果以及对局限性的诚实说明。
2021 年至 2026 年,新的 arXiv 论文被标记为机器撰写的比例,按照经过校准的阈值,因此 ChatGPT 之前的论文标记为 0.4%。
八个石板点是法学硕士预科控制月份;该带是 bootstrap 95% 区间。
截至 2026 年 7 月的 12 个月内,按领域标记为机器撰写的论文比例(每个领域约 300 篇论文)。
假阳性底线 有一种标题说“X 的 N% 现在是人工智能”,大多数都不值得阅读,因为数字背后的检测器也标记了一些真正的人类写作。
如果一个工具将 40% 的新论文标记为机器编写的,同时也将 20% 在 ChatGPT 存在之前编写的论文标记为机器编写的,那么真正的情况是无人提及的 20%。
因此我们围绕这一反对意见进行了研究。
我们的探测器, 此处描述 ,针对学术写作进行了校准;以 0.4% 的误报率,它清除了 99.6% 的真实 LLM 预科科学文本,并恢复了 85% 的 AI 学术文本。
我们将假阳性率作为锚点。
我们在 ChatGPT 之前收集了 2021 年和 2022 年提交的论文,将它们视为真实的人类,并设置了标志阈值,以便其中只有 0.4% 的人会触发该阈值。
那条线就是地板。
我们报告的每个数字都是超过阈值的论文比例,按结构计算,真正的法学硕士预科写作占 0.4%。
然后,ChatGPT 之前的年份充当内置控制:如果上升是探测器的假象,那么 2021 年和 2022 年将高达 2026 年。
第一个图显示事实并非如此。
我们测量了什么 我们从 2023 年 1 月到 2026 年 7 月对 10 个领域组进行了抽样,每个领域每月大约 25 篇论文,加上 2021 年和 2022 年的 8 个控制月,总共 12,750 篇论文。
对于每一篇文章,我们都提取了版本 1 PDF,因此 2026 年修订的论文无法将现代文本泄漏回其 2023 年插槽中。
我们对全文而不是摘要进行评分,因为摘要低估了信号:我们看到同一篇论文的摘要得分低于 20%,正文得分超过 70%。
每个报告的数字都带有引导 95% 置信区间。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜