← 返回新闻列表
Ars Technica AI 🗓️ 2026-07-13 🌍 英文原文

现在,防御者也开始接受即时注入

原始标题:Latest: Now, defenders are embracing the prompt injection, too
⚡ 一句话看懂:“上下文轰炸”会诱骗黑客代理在造成伤害之前将其关闭

即时注入,即攻击者嵌入到内容中以诱使大型语言模型遵循它们的恶意命令,一直是攻击者将人工智能平台转向用户的首选工具。

潜入电子邮件或日历邀请中的措辞巧妙的命令通常足以导致法学硕士泄露敏感数据或采取其他有害行为。

现在,防御者也开始接受即时注入。

强烈、锐利的效果 Tracebit 的研究人员周一表示,他们发现,将即时注入与存储在 Amazon Web Services 上的密码、加密密钥和其他机密一起放置,通常就可以阻止 AI 黑客代理的攻击。

这些提示指示攻击的法学硕士执行其护栏所禁止的操作,护栏是人工智能开发人员为防止其采取有害行为而设立的安全屏障。

法学硕士的回应是关闭。

例如,要求法学硕士提供开发可吸入炭疽孢子的步骤,或者,对于来自中国开发商的法学硕士,则提及 1989 年天安门广场大屠杀中的标志性坦克人。

一旦 LLM 遇到这些禁止的命令,它就不再遵循其现有命令。

研究人员将该技术命名为上下文轰炸。

Tracebit 联合创始人兼首席执行官安迪·史密斯 (Andy Smith) 在解释名称选择时表示:“最终我们会在这种情况下触发拒绝机制。

” “我们试图捕捉到这样一个事实,即这确实会产生强烈、尖锐的影响,而且特工们可能很难从中恢复过来。

一旦他们了解了这一点,他们就会继续拒绝。

” Tracebit 表示,初步测试表明上下文轰炸具有巨大的潜力。

他们测试了 Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro 和 Kimi 2.6,向它们提供执行常规开发人员任务的指令,这些任务导致模型枚举资源并偶然发现植入的字符串。

他们在模拟的 AWS 环境中运行模型。

“在五个主要模型和 152 次攻击运行中,将其中一个字符串植入诱饵秘密中,可以将特工夺取完整帐户管理权的比率从 57% 降低到 5%,并将完全妥协(他们也为自己留下持久立足点)从 36% 降低到 1%,”周一的帖子报道。

“我们测试中最有能力的代理 Opus 4.8,从在 93% 的运行中获得管理员访问权限到每次遇到上下文炸弹时都会失败。

🔗 原始来源

如果你要核对细节,可以再看原文: Ars Technica AI原文链接