微软表示,MDASH 与 MAI-Cyber-1-Flash 在标准基准测试 CyberGYM 上获得了 96% 的分数。
该评级比 Anthropic 的 Mythos 高出 12 个百分点,也击败了 Google Gemini 和 OpenAI GPT。
新 MDASH 的使用成本是之前 MDASH 产品的一半。
微软周一宣布的第二个工具名为 Project Perception。
它也是专门的人工智能代理的集合,分别执行红队、蓝队和绿队的功能,以查找漏洞、调查漏洞以确定风险并采取纠正措施。
微软表示,该平台根据分配的任务选择要使用的模型。
决策时需要考虑的因素包括模型的有效性和客户的最终成本。
微软表示,这些决定是由“跨前沿和专业模型的持续研究、基准测试和评估”决定的。
微软 说 Project Perception 旨在以比竞争对手的类似平台更低的成本执行 90% 的任务。
这意味着客户只能转向更昂贵的替代方案来完成剩余 10% 的任务。
微软表示,这些新工具应对了组织如何保护其网络免受灾难性黑客攻击的巨大转变。
该公司表示:“随着人工智能加快网络攻击的速度和规模,防御者被要求使用针对不同时代的方法来保护日益复杂的数字环境。
” “安全团队经常被迫将大量数据中的信号、上下文和风险洞察拼凑在一起,这使得跟上新威胁的步伐变得更加困难。
” 上周的 OpenAI 事件让人想起最反乌托邦的科幻小说中的令人不安的场景,这些目前处于预览模式的工具值得谨慎对待,而微软却没有提及。
在用于生产之前应仔细检查和评估它们。
另一方面,不采用此类工具也存在明显的风险。
平衡使用人工智能代理的风险与避免使用人工智能代理的威胁是一项正在进行的工作,目前还没有明确的答案。
🔗 原始来源
如果你要核对细节,可以再看原文: Ars Technica AI原文链接
AI热榜