Anthropic 近日详细介绍了 Claude 在 Web、开发者和桌面产品中的 安全隔离架构 。
该公司认为,Agent 的安全不能仅依赖权限确认或模型自身的安全机制,更关键的是通过文件系统、网络以及执行环境等基础设施,对 Agent 建立确定性的安全边界。
文章重点分析了多个发生在信任边界和允许出口路径上的安全事件,以及这些事件如何促使 Anthropic 调整相关设计。
Anthropic 将 Agent 面临的风险归纳为三类:用户误用、模型自身的错误行为,以及通过文件、工具或网络内容发起的攻击。
Anthropic 的核心观点是,分类器、系统提示词以及模型训练等机制虽然能够影响模型行为,但无法提供绝对的保证。
真正决定 Agent 能够访问什么、能够向外发送什么数据的,是运行环境本身所施加的限制。
Anthropic 将 Agent 系统划分为三个层次:具有概率性的模型、执行环境,以及可能影响模型行为的外部内容。
(来源: Anthropic ) 以 Claude.ai 为例,其代码执行环境运行在隔离基础设施上的临时 gVisor 容器中,完全无法访问用户本地文件系统。
而 Claude Code 则直接运行在开发者本机。
最初,它采用逐项授权机制:每次写入文件、执行 Shell 命令或访问网络时,都需要用户确认。
Anthropic 发现,用户最终批准了约 93% 的权限请求,使持续依赖人工确认的安全价值大打折扣。
随后,Anthropic 为 Claude Code 引入了操作系统级沙箱:macOS 使用 Seatbelt,Linux 使用
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜