7月16日,openai官方正式发布其自主研发的内部自动化红队专用模型——gpt-red。
该模型依托自博弈式强化学习机制,能够持续生成新颖、多样的攻击策略,主动诱导目标模型执行非预期行为。OpenAI为此调配了史无前例的大规模算力资源开展训练,并将模型产出的高质量对抗样本直接整合进生产级模型的安全优化流程中。
现阶段,GPT-Red已深度参与GPT-5.6 Sol的迭代训练。实测结果表明,在最具挑战性的直接提示注入基准测试中,GPT-5.6 Sol的失败率相较四个月前性能最强的现役模型下降了约83%。这一突破性进展,标志着人工智能安全正加速迈向“以当前模型赋能未来模型防护”的全自动化新范式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












