← 返回新闻列表
InfoQ AI 🗓️ 2026-08-03

Anthropic 详解 Claude 的安全隔离架构:如何在 Web、开发和桌面环境中约束 Agent 行为,这一消息引发行业关注

⚡ 一句话看懂:Anthropic 详解 Claude 的安全隔离架构:如何在 Web、开发和桌面环境中约束 Agent 行为,这一消息引发行业关注。来源:InfoQ AI。

Anthropic 近日详细介绍了 Claude 在 Web、开发者和桌面产品中的 安全隔离架构 。

该公司认为,Agent 的安全不能仅依赖权限确认或模型自身的安全机制,更关键的是通过文件系统、网络以及执行环境等基础设施,对 Agent 建立确定性的安全边界。

文章重点分析了多个发生在信任边界和允许出口路径上的安全事件,以及这些事件如何促使 Anthropic 调整相关设计。

Anthropic 将 Agent 面临的风险归纳为三类:用户误用、模型自身的错误行为,以及通过文件、工具或网络内容发起的攻击。

Anthropic 的核心观点是,分类器、系统提示词以及模型训练等机制虽然能够影响模型行为,但无法提供绝对的保证。

真正决定 Agent 能够访问什么、能够向外发送什么数据的,是运行环境本身所施加的限制。

Anthropic 将 Agent 系统划分为三个层次:具有概率性的模型、执行环境,以及可能影响模型行为的外部内容。

(来源: Anthropic ) 以 Claude.ai 为例,其代码执行环境运行在隔离基础设施上的临时 gVisor 容器中,完全无法访问用户本地文件系统。

而 Claude Code 则直接运行在开发者本机。

最初,它采用逐项授权机制:每次写入文件、执行 Shell 命令或访问网络时,都需要用户确认。

Anthropic 发现,用户最终批准了约 93% 的权限请求,使持续依赖人工确认的安全价值大打折扣。

随后,Anthropic 为 Claude Code 引入了操作系统级沙箱:macOS 使用 Seatbelt,Linux 使用

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接