OpenAI 发布了 GPT-Red,这是一个利用自对弈强化学习的自动化红队模型。它将直接提示注入攻击的失败率降至 0.05%,攻击成功率达到 84%,而人类仅为 13%。 该模型已集成到 GPT-5.6Sol 的训练中,在保持通用能力的同时提升了鲁棒性,展现了人工智能安全飞轮效应。
评论 (0)
0/300





首页
