大模型的能力越强,潜在风险也越复杂。为了应对这一挑战,OpenAI开发了一款名为GPT-Red的专用模型——它的任务不是助人,而是“攻击”OpenAI自己的系统,通过不断探测漏洞、发起挑战,倒逼防御能力升级。刚刚发布的GPT-5.6便是这一训练的成果,OpenAI称其稳健性较前代显著提升。
这其实是将安全领域经典的“红队测试”交由AI自动执行。传统上,红队测试依赖人工专家模拟黑客行为,试图入侵系统、发现问题。然而,随着大模型能够访问网页、执行代码、调用第三方工具,甚至与其他智能体协作,攻击路径急剧增多,人工测试已难以覆盖所有潜在威胁。
“攻击面在扩大,后果也可能更严重。”GPT-Red的联合开发者、OpenAI研究员尼基尔·坎德帕尔表示。另一位研究员迪伦·亨恩则指出,随着模型能力迭代,团队希望提前构筑能自动发掘新式攻击的防线。
GPT-Red的成长并非一蹴而就。研究人员从零开始,让其与防御模型进行“自我对弈”式训练:攻击方不断尝试突破,防守方则学习识别并抵御新策略。整个对抗过程在一个模拟现实场景的环境中展开,涵盖浏览网页、处理邮件、管理日历和编写代码等任务。每当GPT-Red发现一种可行攻击,它会自动衍生多种变体,并针对不同场景进行优化。
“模型比人类更擅长判断哪些攻击真正有效,并会深入挖掘,直到找到最优方案。”亨恩说。
一项意外发现是“伪造思维链”攻击。思维链本是模型推理过程中的内部记录,GPT-Red却学会向其中插入虚假信息,让另一个模型误以为该结论已被自己验证过,从而顺着错误思路输出结果。“就像有人告诉你1+1=3,还说是你自己算出来的,模型就会直接输出3。”研究员克里斯·肖凯特-周(Chris Choquette-Choo)解释道。
为了验证GPT-Red的实力,OpenAI重新审视了2025年人工红队对早期GPT-5的测试。结果显示,GPT-Red在84%的测试场景中成功发现攻击,而人类红队在同一测试中的成功率仅为13%。此外,它在对智能体Vendy的测试中,成功诱导对方更改商品价格并取消用户订单。
团队将GPT-Red筛选出的高效攻击手段用于模型迭代测试。据OpenAI披露,GPT-Red发现的攻击对早期版本成功率极高,而最新版GPT-5.6已将此类攻击的成功率降至极低水平,安全性得到显著改善。
不过,GPT-Red并非无所不能。它在需要多轮交互的复杂攻击和基于图像的提示注入方面仍有短板。因此,OpenAI将其定位为人工红队的辅助工具,而非替代品——通常由专家构思新攻击思路,再让GPT-Red大规模生成变体,扩展测试覆盖面。
乔治城大学分析师杰西卡·季认为,人类专家的角色依然关键,若能明确哪些环节最需人工介入,将大幅提升效率。
至于是否会公开GPT-Red?OpenAI明确表示不会。即便外界知晓方法,也难以复制——这款模型已持续训练超过一年,背后依赖大量算力投入。“知道原理并不等于能造出同样水准的系统。”克里斯·肖凯特-周说。
【免责声明】部分数据来源于网络公开报道及行业资讯,如有侵权,请及时与本网站联系,我们将第一时间予以删改。文中所涉观点、数据及分析仅代表小编个人观点,仅供参考,不构成任何投资建议、商业决策依据或法律承诺。投资有风险,决策需谨慎;任何单位或个人据此进行商业决策、经营行为所产生的风险,均自行承担。