打造AI网安“红队”:OpenAI先容内部误差检测模子GPT-Red
2026-07-21 06:54:57 宣布
泉源:码云下载
作者:许建佑
浏览:4139次
IT之家 7 月 16 日新闻,,OpenAI 外地时间 15 日先容了其内部使用的网络清静“红队”模子 GPT-Red。。。该模子可自动化地举行种种网络攻击模拟,,资助 OpenAI 提升对外模子产品的鲁棒性。。。
OpenAI 体现,,其已往半年自 GPT-5.3 后的每个生产模子均将“红队”模子用于训练。。。伪造头脑链型攻击的乐成率已从 GPT-5.1 上的 95% 降低至最新模子上的缺乏 10%;;;;;;最新的 GPT-5.6 Sol 在 GPT-Red 的直接提醒符注入攻击中失败率仅有 0.05%。。。
GPT-Red 使用自博弈强化学习举行训练:其自己和一组差别的防御型 LLM 在普遍的红队场景上同时举行训练。。。GPT-Red 因乐成诱发有用失败而获得奖励,,而防御型模子则因反抗攻击并完成其原始使命而获得奖励。。。随着防御型模子变得越来越强盛,,GPT-Red 被迫发明更强盛、更多样化的攻击。。。
“红队”模子与产品模子相隔离。。。OpenAI 相信其已开启了良性的人工智能网络清静循环,,可使用现有模子来增强未来模子的鲁棒性、一致性、可信度。。。
跨省运输活鸭“中暑” 消防水枪紧迫喷淋降温
责任编辑:林浩一 校对:林佩毓