OpenAI 发布 GPT-Red:自动化红队系统对抗提示注入
"Introducing GPT-Red — An internal automated red teamer on a mission to find our models’ prompt injection vulnerabilities at scale, helping us build stronger defenses before wider deployment."
对 agent 开发者而言,GPT-Red 展示了如何用 AI 自动化安全测试。其核心思路——用当前模型提升下一代模型的鲁棒性——可直接借鉴到自己的 agent 安全评估流程中。GPT-5.6 Sol 经此训练后,提示注入失败率比四个月前的最佳生产模型降低 6 倍。