選項
首頁
快訊
內容
GaryLewis
GaryLewis
2026-07-16

OpenAI 發布了 GPT-Red,這是一款採用自對弈強化學習的自動化紅隊模型。它將直接提示注入攻擊的失敗率降至 0.05%,攻擊成功率達 84%,而人類僅有 13%。 該模型整合至 GPT-5.6Sol 的訓練流程中,在維持通用能力的前提下提升了系統的穩健性,展現了 AI 安全飛輪效應。

OpenAI 發布了 GPT-Red,這是一款採用自對弈強化學習的自動化紅隊模型。它將直接提示注入攻擊的失敗率降至 0.05%,攻擊成功率達 84%,而人類僅有 13%。 該模型整合至 GPT-5.6Sol 的訓練流程中,在維持通用能力的前提下提升了系統的穩健性,展現了 AI 安全飛輪效應。
評論 (0)
0/300
OR