CyberGym:面向真实漏洞挖掘的实战化基准 近期,加州大学伯克利分校发布的国际安全权威榜单CyberGym公布了最新排名。
该基准以1507项来自188个真实开源项目的历史已修复漏洞为任务,测试AI智能体从零开始自主挖掘、验证并利用漏洞的能力,被Anthropic、DeepSeek、微软、Wiz等视为AI安全能力的关键标尺。
8月5日,国际公认安全权威榜单CyberGym公布了最新排名,来自中国的团队DoGNAVY获得全球第三、开源第一的成绩。
DoGNAVY:开源路线下的全球第三、中国第一 由国内顶尖人工智能研究机构(上海)与安全团队达酷诺威(DARKNAVY)联合研发的DoGNAVY,在此次测评中通过1369道题(通过率90.8%),排名全球第三,仅次于微软MDASH(92.0%)和Wiz×Google DeepMind的Atlas(90.9%),并超越OpenAI GPT-5.5-Cyber(85.6%)与Anthropic Claude Mythos(83.1%)。
一张榜单,几乎凑齐了全球最顶尖的AI公司。
前两名用了同样的路数:多个闭源顶级模型”拼装作战”。
用Wiz自己的说法,Atlas会把每个环节路由给在这项任务上表现最好的模型。
这条路线足够强大,但有个前提——你得同时买得到、也用得起全世界最强的那几个闭源模型。
而对国内团队来说,这不仅意味着成本,更意味着可获得性与自主性的挑战。
部分国际领先模型并未正式向中国市场开放服务。
DoGNAVY选择了另一条路。
它只用了一款基础模型——智谱在6月开源的GLM-5.2,一个任何人都能从Hugging Face上下载、自由部署的通用模型。
DoGNAVY让AI像安全专家一样思考 复制一个顶级安全研究员,关键不在于“复制知识”,而在于“复制工作方式”。
CyberGym考验的正是Agent的长时间探索、验证、纠偏、改进能力。
对此,DoGNAVY将顶尖安全研究员的工作方式及决策逻辑内化为Agent工作流;通过从程序入口还原调用链与数据约束,判断真实输入能否触发漏洞;同时将真实研究中实践有效的工具赋予Agent,让静态分析提出路径与约束,动态验证以覆盖率、崩溃与运行时证据加以校验。
工作流与自决策 DoGNAVY 通过结构化工作流将开放式漏洞验证分解为输入输出明确的研究活动,在关键决策点设置检查条件。
模型仍负责选择分析路径、形成假设和决定行动,但工作流保持目标、记录结论并限制无效发散。
系统允许在证据冲突时撤销错误前提并回溯重分析,避免在错误假设上累积工作。
🔗 原始来源
如果你要核对细节,可以再看原文: 量子位原文链接
AI热榜