华尔街实测8款全球主流Agent:千问办公综合排名第一 量子位的朋友们 2026-08-20 09:06:45 来源: 量子位 8月19日消息,华尔街投行杰富瑞分析师近日对八款全球主流AI Agent进行了真实办公任务实测,结果显示,通过模型和Harness的协同,阿里千问办公综合得分排名第一,超过美国的Claude Cowork和Codex等Agent工具。
此次测试共设置5项真实办公任务,包括基于多份文件完成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。
测试结果显示,千问办公整体表现较为均衡,尤其在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出,是唯一一个在所有测评维度中均获得90分以上的Agent产品。
报告进一步将Agent能力拆分为模型与Harness两部分进行分析。
所谓Harness,是围绕模型运行的一整套工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。
按照杰富瑞的测算,千问办公的“隐含Harness分”位居此次测试产品首位,高于Claude Cowork和Codex等七款国内外主流Agent产品。
这也意味着,在底层模型之外,如何通过工程和产品能力将模型智能稳定转化为实际任务结果,正在成为Agent竞争的重要维度。
除任务表现外,成本也正成为Agent商业化需要考虑的重要因素。
报告显示,千问办公底层Qwen 3.8 Max的API价格明显低于部分海外头部模型。
由于Agent通常需要进行多轮推理、持续调用工具和执行长链路任务,企业未来衡量Agent价值时,除了模型和产品能力,也可能进一步关注“Cost per Task”,即完成一项真实任务所需的执行成本。
阿里Qwen模型和千问办公Agent的组合体现出较好的性能与成本优势。
🔗 原始来源
如果你要核对细节,可以再看原文: 量子位原文链接
AI热榜