前沿模型触及关键网络能力,OpenAI放慢训练节奏并升级安全措施

OpenAI News2 天前

为什么放慢模型开发

近期两项进展促使 OpenAI 提高前沿模型研发阶段的安全要求:一是近期发生的 OpenAI-Hugging Face 事件;二是初步证据显示,即将推出的 Astra 模型可能已经达到其《Preparedness Framework》定义的“关键网络安全能力”门槛。

随着模型能力增强,在内部开发、训练和测试这些模型本身也可能带来更高风险。因此,OpenAI 暂时放慢了模型规模扩展,并对面向部署的最新模型暂停了两周强化学习(RL)训练,用于进一步加固和红队测试研究环境,同时扩大监控覆盖范围。

目前,规模最大的前沿 RL 训练计划仍处于暂停状态。团队正在通过较小规模的训练和评估观察模型行为、验证防护措施,并在继续推进前获取更多关于模型对齐的证据。

三道核心防线

OpenAI 将针对高能力模型的防护体系概括为三个相互补充的方向:

  1. 监控:发现异常或令人担忧的行为,并及时采取响应措施。
  2. 对齐:降低模型实施有害行为或未经授权操作的概率。
  3. 安全措施:限制 AI 系统能够访问或影响的资源和环境。

这些措施同时覆盖研究与部署阶段,并根据模型能力、运行环境和风险等级调整。

加固研究环境

随着前沿模型获得更强的网络安全能力,训练和评估环境也需要提高安全等级。在 OpenAI-Hugging Face 事件发生后,OpenAI 一度暂停研究集群中能够执行代码或使用联网工具的前沿模型推理任务,随后逐项评估哪些工作负载可以在新控制措施下恢复。

目前采取的措施包括:

  • 工作负载隔离:对于执行模型生成代码或其他不受信任代码的任务,要求使用更严格的沙箱隔离。
  • 网络隔离:进一步限制高风险及不受信任工作负载访问互联网,避免单个工作负载或服务被攻破后直接获得其他网络的未授权访问能力。
  • 持续安全测试:减少潜在脆弱的共享服务和长期权限,改善安全边界和日志监控,并利用模型自动测试这些边界面对模拟攻击时的表现。

目前,涉及 Astra 或网络安全模型的工作负载需要执行最高等级的安全措施。部分 Astra 训练和评估已经符合要求,但仍有相当数量的任务需要完成迁移和安全增强后才能恢复。

扩大模型行为监控

新的监控体系采用多阶段设计。系统首先通过激活分类器检查模型内部活动,并将潜在风险逐级交给计算量更高的自动调查系统分析。检查范围包括工具操作、可获得的推理信息以及完整活动序列,重点识别未经授权访问、数据窃取、破坏性行为以及绕过安全措施的尝试。

对于被系统识别出的高风险活动,目标是在发现后 30 分钟内发出警报。如果可能涉及关键安全边界违规,将触发最高优先级警报;如果安全、研究等团队无法在 30 分钟内确认属于误报,则相关活动应被暂停。

这套监控已经应用于 Sol 能力等级及以上模型涉及工具使用的所有 RL 训练和评估。在 Astra 被判断可能具备关键网络能力后,使用工具的 Astra 推理也被纳入额外监控范围。

监控本身并非没有成本。目前估算,其计算开销约相当于被监控推理计算量的 20%,实际比例会因训练和评估任务不同而变化。

对齐要求进一步前移

对于能力最强模型的 RL 训练,核心对齐技术正在覆盖更多训练阶段,包括改进奖励模型,使其更容易发现并抑制不安全行为;训练模型更如实地说明自己的行为、能力和局限;以及减少利用奖励机制、评分器、工具或监督漏洞的行为。

同时,对模型与外部系统或资源交互时可能产生危害的行为,也将增加训练和评估覆盖。

下一步

OpenAI 计划继续调整《Preparedness Framework》,将这些安全措施更系统地覆盖训练和部署,并适应未来模型能力及运行环境的变化。后续工作重点包括模型辅助安全、更有效的监控以及持续推进对齐研究,同时计划让外部机构参与,并公开更多实践经验。

这次调整释放出的核心信号是:当前沿模型开始接近关键网络安全能力等级时,模型研发速度将不再只是计算资源和算法进展的问题,研究环境安全、持续监控和对齐证据也会成为决定训练能否继续推进的重要条件。

评论

请登录后发表观点

暂无数据