谷歌 近日宣布,WebMCP 已进入 Chrome 149 的 Origin Trial 阶段。
WebMCP 是一项新的标准提案,它允许网站向浏览器内的 AI 智能体暴露可调用工具,例如 JavaScript 函数或 HTML 表单。
这样一来,智能体便可以通过明确的接口完成用户操作,而不再需要依赖成本高昂且可靠性有限的“猜测式”交互方式,例如读取屏幕内容或解析 DOM 结构。
谷歌这样解释 WebMCP 的设计初衷: 通过定义这些工具,你可以明确告诉智能体应该如何以及在何处与网站交互。
这样一来,智能体便能够调用面向机器的接口,在数秒内完成复杂任务,同时获得更高的可靠性、准确性和个性化能力。
举例来说,假设用户正在规划一次多城市旅行。
过去,用户只能看着智能体一步步填写旅行表单;而现在,用户可以授权智能体直接调用后端 API,瞬间生成结合天气因素优化过的个性化行程方案,并提交给用户确认。
在没有 WebMCP 的情况下,如果 AI 智能体希望代表用户完成某项操作,通常需要经历一套相当复杂的流程:首先下载相关网页的 DOM,然后分析页面中的按钮和控件作用,接着截取页面截图并进行图像识别。
最后推断目标按钮在屏幕上的坐标位置,并模拟鼠标点击。
正如业内 经常提到 的那样,这种方式不仅不够确定,而且 Token 消耗极高。
一个简单的 CSS 布局变化,或者一个加载稍慢的广告组件,都可能导致整个自动化流程失效。
与此同时,即便是低分辨率截图,其图像分析过程也会带来额外延迟和大量 Token 开销。
与主要面向后端场景的
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜