← 返回新闻列表
InfoQ AI 🗓️ 2026-09-07

突发:TikTok SRE 技术负责人:AI Agents 说到底就是分布式系统

⚡ 一句话看懂:突发:TikTok SRE 技术负责人:AI Agents 说到底就是分布式系统。来源:InfoQ AI。

你的 AI Agent 调用退款接口,网络超时了,那退款到底成功没有?

TikTok 站点可靠性工程师 Salman Munaf 用这个例子阐述了他的观点:超时从来不意味着失败,而意味着“未知”。

Agent 在遇到任何失败时的第一反应往往是重试,如果没有请求标识符(request identifiers)、幂等键(idempotency keys)以及状态查询(status lookup),这种“先重试再说”的本能就可能导致同一笔退款被执行两次。

Salman 在 TikTok 从事站点可靠性工程工作。

他认为,一旦模型开始调用外部服务,问题就不再只是模型问题,而变成了分布式系统问题。

这也就意味着,它会遇到这个领域几十年来已经反复研究和命名的各种故障模式。

日前,他在一场演讲中系统拆解了为什么 AI Agent 已经从单纯的 LLM 调用演化成了真正的分布式系统,以及开发者必须从分布式系统工具箱里搬来哪些“武器”,才能让 Agent 在犯错时不至于造成不可逆的后果。

基于该演讲视频,InfoQ 对内容进行了整理。

核心观点如下: AI Agent 从只会吐字的模型变成了会执行副作用的外部系统协调器,这个转变彻底改变了系统的边界和风险面。

上下文能够影响行动时,它就是状态。

而状态会变成过期的,状态会和权威数据冲突,状态会污染 Agent 后续的行动。

我们应该把记忆当作缓存来处理,它应该可以被失效,它应该带着来源信息。

一个无害的模型,当它能执行不安全的操作时,就会变得危险。

日志不够用了,你必须记录 Agent 每一步看到了什么、据此做了什么、为什么认为这样是对的

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接