返回行业动态
研究前沿

OpenAI发布GPT-Red红队模型:用AI攻击AI,自动化安全测试进入新阶段

OpenAI于7月15日正式披露内部自动化红队模型GPT-Red。该模型通过自博弈强化学习持续设计新型攻击方式,已用于GPT-5.6 Sol的安全训练,使该模型在直接提示注入测试中的失败次数较四个月前减少了约六分之五。这标志着AI安全从人工红队测试迈入”以AI加固AI“的自动化新范式。

来源:OpenAI官方博客原标题:Introducing GPT-Red: Automated Red Teaming for Frontier Models查看原文
OpenAI GPT-Red自动化红队模型的AI安全测试概念图

图片来源:北京拓实科技原创

发生了什么

7月15日,OpenAI通过官方博客披露了其内部专用的自动化红队模型GPT-Red。与传统依赖人工安全专家手动设计攻击测试的方式不同,GPT-Red通过自博弈强化学习(self-play RL)持续生成新的攻击策略,诱导目标模型执行非预期操作,从而在模型部署前系统性地发现和修复安全漏洞。

OpenAI表示,过去半年中自GPT-5.3之后的每个生产模型都使用了”红队”模型进行安全训练。最新数据表明,在GPT-5.6 Sol上应用GPT-Red后,该模型在最困难的直接提示注入(direct prompt injection)基准测试中失败次数较四个月前的最强生产模型减少了约六分之五。OpenAI为此投入了前所未有的算力规模来训练GPT-Red。

技术范式转移

GPT-Red代表AI安全领域的一次重要范式转移——从”人工专家设计攻击”转向”AI自主发现并修复自身漏洞”。这一机制类似于网络安全中的自动化渗透测试,但针对的是大语言模型特有的安全挑战(如提示注入、越狱攻击、角色偏离等)。

该模型的特殊之处在于它并非一次性工具,而是一个持续进化的攻击者。随着底层模型能力增强,GPT-Red的攻击策略也同步升级,形成”以当前最强模型加固未来更强模型”的正反馈循环。OpenAI已将生成的攻击数据直接纳入生产模型的安全训练流程中。

为什么重要

随着AI Agent和工具调用能力的普及,提示注入攻击的潜在危害急剧上升——恶意指令可能导致AI助手执行非授权操作、泄露数据或绕过安全限制。GPT-Red的自动化红队机制提供了一种可扩展的安全保障方案,对整个大语言模型安全生态具有示范意义。

企业视角

  • 企业部署AI Agent面临的安全风险可以通过自动化红队方案系统性缓解
  • GPT-Red的安全训练方法论可为企业自建AI安全测试流程提供参考
  • 提示注入防护能力的提升降低了企业将AI接入内部系统的安全顾虑

不确定性和展望

GPT-Red目前仅限OpenAI内部使用,尚未对外开放。其攻击策略的泛化能力——能否适用于非OpenAI家族模型——仍有待验证。此外,自动化红队模型本身的潜在滥用风险(如被恶意方用于生成攻击策略)也需要持续关注。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。