在过去的八个月中,我们的威胁情报团队发现并中断了威胁行为者试图利用 Claude 进行恶意活动的操作。
在本报告中,我们分享了这些行动的案例研究,并描述了自我们于 2025 年 3 月、8 月和 11 月发布威胁报告以来,对 Claude 的恶意使用是如何演变的。
在每个案例中,我们都破坏了活动,利用我们学到的知识来加强我们的防护措施,并在适当的情况下与当局和行业合作伙伴共享情报。
本报告涵盖了我们在 2025 年 12 月至 2026 年 8 月期间扰乱的七个危害领域的活动:网络行动、影响力行动、监视、诈骗和欺诈、生物滥用、常规武器开发和提炼。
使用了克劳德俳句、十四行诗和作品模型。
除一起非法蒸馏案件外,所有滥用案件均未涉及使用 Claude Fable 或 Mythos 级模型。
我们在这里分享的案例并不是典型的滥用行为,而是我们迄今为止发现的最引人注目和最新颖的威胁活动的示例。
我们发布这项工作是因为我们相信我们有责任披露对我们服务的恶意滥用。
随着模型的能力越来越强,它们的风险也会增加,除非人工智能开发者和社会的捍卫者采取行动让它们变得更安全。
本报告涵盖的威胁行为者包括可疑的国家支持团体、出于经济动机的犯罪分子、商业间谍软件供应商、国家宣传机构和出于政治动机的个人。
这些案件的范围从旨在欺骗用户的虚假约会应用程序网络到旨在识别和监控持不同政见者的监控系统。
老练且持续的威胁行为者不断测试我们的防护措施,并试图规避我们用于检测和防止滥用的技术措施。
我们将继续改进我们的保障措施,并与我们的合作伙伴协调,以提高我们检测、破坏和防止未来滥用的能力。
我们希望本报告中的发现能够帮助其他开发者认识到他们自己平台上的类似模式,让政府和民间社会更清楚地了解新出现的威胁是如何形成的,并加强集体防御。
人工智能增强的网络作战 网络作战:从助手到协调者 在过去的六个月中,我们的威胁情报团队发现并破坏了一系列威胁行为者利用克劳德进行的网络行动。
这些行为者包括可疑的国家支持团体、出于经济动机的犯罪分子和出于政治动机的个人。
本节介绍其中一些案例。
在这些案例研究中,报告将引用生成威胁组 (GTG)。
这些是 Anthropic 对被观察到滥用人工智能的行为者的内部指示符。
该报告还试图衡量“提升”,这是我们用来描述人工智能能力提升的术语,或者说使用人工智能与不使用人工智能相比,造成的伤害增加了多少。
我们从速度、规模和深度的角度来看待提升,并试图确定演员采用人工智能如何对这些特征产生有意义的影响。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜