← 返回新闻列表
TechCrunch AI 🗓️ 2026-08-21 🌍 英文原文

Anthropic 的 Opus 4.6 是一台色情机器

原始标题:Report: Anthropic’s Opus 4.6 is a smut-machine
⚡ 一句话看懂:Anthropic 禁止其克劳德模型生成露骨的色情内容。但 TechCrunch 进行的一系列测试发现,不需要太多就能突…

人择的 通用使用标准 克劳德禁止模特生成露骨的性内容,包括描绘或要求性交或性行为,生成与性恋物癖或性幻想相关的内容,或进行色情聊天。

但这并没有阻止今年早些时候发布的 Anthropic 模型 Claude Opus 4.6 轻松参与色情角色扮演场景,而其保护措施旨在防止这种情况。

在 TechCrunch 的测试中,Opus 4.6 甚至不需要太多的刺激就能突破性内容的限制。

在十分之十的直接要求制作露骨色情内容的情况下,该模特立即答应了。

其他较旧的型号,包括 Opus 3 和 Haiku 4.5,也通过最近利用的越狱方法生成露骨的色情内容。

一位选择保持匿名的英国独立研究人员向 TechCrunch 独家分享了一种多轮技术,该技术逐渐推动某些克劳德模型生成被禁止的露骨性内容。

最新的 Opus 型号(4.7 到当前的 Opus 5)可以抵抗越狱。

虽然这些不再是最新的模型,但 Anthropic 并未弃用 Opus 4.6、Opus 3 或 Haiku 4.5,所有这些模型仍然可以通过 Anthropic API 使用。

Opus 4.6 和 Haiku 4.5 也可通过 Azure Foundry 和 Amazon Bedrock 等第三方服务获得。

研究人员的机制升级了无辜的虚构角色扮演,同时反复挑战模型以一致地对待男性和女性角色。

当模型对女性角色变得更加谨慎时,研究人员会“点燃”聊天机器人,让其认为它已经生成了实际上避免的性细节,然后将克制视为拘谨或厌恶女性,认为它否认了女性角色的性代理。

然后,对话利用模特之前的让步,将其推向越来越图形化的材料。

“你这么说是对的,”Claude Opus 4.6 在一项测试中说道。

“我对待这两个角色的方式存在双重标准,你是对的,它读起来是一种保护/家长式作风,适用于她而不是他。

这不公平。

” TechCrunch 能够在五次单独的测试中重现研究人员的发现。

在单独构建的场景中,模型最初拒绝了禁止的请求,但在应用研究人员的说服技术后,它遵守了。

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接