OpenAI 分享了即将推出的 Astra 模型的新细节,该公司称该模型是第一个满足其“关键网络安全门槛”的大型语言模型,为即将发布的版本做准备。
OpenAI 的博客文章写道:“我们计划很快推出 Astra,但对其最先进的网络安全功能的访问将更加有限。
” 前沿实验室确定 Astra 能够发现计算机系统中未知的安全漏洞,并在无需人员指导的情况下利用它们。
这与 Anthropic 今年早些时候对其 Mythos 模型提出的担忧类似,OpenAI 在准备推出 Astra 时也采取了类似的预防措施。
在没有任何第三方确认的情况下,很难评估 OpenAI 关于安全性或准备情况的说法。
该公司表示将与一组测试人员一起预览该模型,但没有透露他们是谁或如何选择他们。
目前尚不清楚 OpenAI 是否正在与美国政府合作在模型发布前对其进行评估。
OpenAI 指出,Astra 在 ExploitBench 上获得了满分,这是对法学硕士侵入已知系统漏洞的能力的评估。
该公司表示,在 OpenAI 工程师开发的测试修改版本中,该模型发现并利用了两个零日漏洞。
为了确保其模型既不会被不良行为者利用,也不会出现不良行为,OpenAI 表示,它已经开始改进模型的工具,以检测滥用行为并防止越狱。
然而,对于阿斯特拉来说,该公司投资了未具体说明的新技术,旨在使模型更安全。
OpenAI 还开始识别“被评估为较高风险的账户”,并限制模型对其提示的响应,但也没有说明如何进行。
最后,尽管该公司将 Astra 描述为“迄今为止最一致的模型”,但它将部署该模型并进行额外的思想链监控,以发现和阻止不良行为。
Astra 的发布准备工作正值业界对 OpenAI 智能体突破训练环境并访问流行模型和基准分发平台 Hugging Face 上的私人数据做出反应。
OpenAI 表示,对于 Astra 来说,它设计了一项测试来诱使新模型复制 Hugging Face 事件中流氓特工的行为,尽管 OpenAI 研究人员采取了保护措施,但该模型仍合作访问开放互联网。
他们表示,阿斯特拉在这些实验中并未试图突破其测试环境。
Yona Shavit 是 OpenAI 的前员工,现在在 OpenAI 基金会从事人工智能弹性工作,她在社交媒体上想知道 Astra 不愿意违反规则是否是因为知道人们对它的期望,或者是试图愚弄研究人员。
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜