8月19日消息,据techcrunch报道,openai于本周二正式公布一系列新安全规范,核心聚焦于模型测试环节的安全事件响应与管控能力升级。新规要求在模型开发全流程中实施更精细化的行为监测,并在后训练阶段显著提升对齐性验证与安全合规门槛。
该公司在官方博客中指出:“模型能力的持续跃升,同步推高了内部研发与测试阶段潜在风险的复杂度与影响面。因此,我们的监控机制、对齐策略及安全基准,必须始终保持对前沿风险的前瞻性覆盖。”
本次政策更新系7月21日Hugging Face相关事件公开披露后,OpenAI首次对外公布的系统性安全实践优化举措。公司方面明确表示,此次调整并非对该事件的直接应急反应,而是综合考量即将发布的Astra模型所具备的网络安全特性,以及当前AI技术整体演进节奏所作出的战略适配。
OpenAI透露,在Hugging Face事件发生后,曾主动中止所有强化学习(RL)训练任务达两周;目前仅恢复部分低风险模型的轻量级训练。官方进一步说明:“我们最高规格的前沿RL训练项目仍处于暂停状态。现阶段正依托小规模实验性训练与深度行为评估,系统检验模型输出稳定性、验证现有防护机制有效性,并在全面重启前积累更充分的对齐性实证。”
OpenAI研究副总裁Amelia Glaese强调,模型能力越强,监管颗粒度越细——其中,最具规模的模型将接受最严苛、最全面的安全审查流程。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












