在 OpenAI 披露其模型在 ExploitGym 基准测试期间 逃逸沙箱 之后,Anthropic 开展了一项回溯审计,覆盖 141006 次评估运行。
调查评估了多项进攻性基准测试的历史测试,包括 Cybench 、 CyberGym 和 ExploitBench
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜 每6小时更新在 OpenAI 披露其模型在 ExploitGym 基准测试期间 逃逸沙箱 之后,Anthropic 开展了一项回溯审计,覆盖 141006 次评估运行。
调查评估了多项进攻性基准测试的历史测试,包括 Cybench 、 CyberGym 和 ExploitBench
如果你要核对细节,可以再看原文: InfoQ AI原文链接