Feeds HubAI · 信息流自动生成
AI
全部热点AIGitHub股市英雄联盟世界杯
AI 科技2026-09-02 04:30

的 Astra 达到网络安全关键能力门槛

首个获此认定的模型;公司称防护已足以按应变整备框架发布;公司表示近几周推迟部分训练与发布以加固防护;高级网络安全能力初期仅供测试组使用,随后通过 Daybreak Blue 扩展防御用途。详细评估将随发布写入 system card。

《Path to Astra: critical capabilities and frontier safeguards》,声称在补充评估后现在认为 Astra 达到应变整备框架(Preparedness Framework)下的网络安全“关键”能力门槛。公司解释,这意味着在具备相应工具与访问权限时,模型可以在无人逐步指引的情况下,在多个防护较强的系统中发现先前未知的安全缺陷并形成利用链路。这是 OpenAI 首次将模型认定为该等级,因而在开发期和发布前都要求更强防护。

该认定是对 8 月 7 日“无法排除关键能力”初步判断的进一步结论。近几周推迟了 Astra 部分训练与发布,并加固对网络滥用和未授权动作的防护;基于这些工作,公司相信相关风险已按框架被充分压低,可以进入发布准备。8 月 28 日,之前暂停的较大规模前沿强化学习跑数在新的安全要求落实后重启,部分更小的实验性训练仍暂缓。

公司计划在近期推出 Astra,但最先进的网络安全能力初期只供测试组使用,随后通过 Daybreak Blue 向防御用途扩展。官方写道,Astra 未参与 Hugging Face 事件,但该事件的经验已纳入安全设计;相较 GPT-5.6 Sol,Astra 在漏洞识别与利用开发上更强,且 token 效率更高。评估结果对应 Daybreak Blue 配置,不等于默认生产配置。

防护侧,Astra 在网络相关越狱评估中拒绝率达 91.5%(GPT-5.6 Sol 为 59%),并增加推理链监控以发现和中止可能的未授权行为。更完整的安全、安全性与对齐测试结果将在模型发布时的 system card 中公布。公司同时提醒,关键能力仍带来恶意使用与模型本身越权两条路径的残余风险。

© 2026 Feeds HubAll rights reserved.