您正在访问亚汇网香港分站,本站所提供的内容均遵守中华人民共和国香港特别行政区法律法规。

打造 AI 网安“红队”:OpenAI 介绍内部漏洞检测模型 GPT-Red

文 / 小亚 2026-07-16 13:02:22 来源:亚汇网

感谢亚汇网网友OpenAI表示,其过去半年自GPT-5.3后的每个生产模型均将“红队”模型用于训练。伪造思维链型攻击的成功率已从GPT-5.1上的95%降低至最新模型上的不足10%;最新的GPT-5.6Sol在GPT-Red的直接提示符注入攻击中失败率仅有0.05%。GPT-Red使用自博弈强化学习进行训练:其本身和一组不同的防御型LLM在广泛的红队场景上同时进行训练。GPT-Red因成功诱发有效失败而获得奖励,而防御型模型则因抵抗攻击并完成其原始任务而获得奖励。随着防御型模型变得越来越强大,GPT-Red被迫发现更强大、更多样化的攻击。“红队”模型与产品模型相隔离。OpenAI相信其已开启了良性的人工智能网络安全循环,可利用现有模型来增强未来模型的鲁棒性、一致性、可信度。广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,亚汇网所有文章均包含本声明。

相关新闻

加载更多...