オプション
家
速報
コンテンツ
GaryLewis
GaryLewis
2026年7月16日

OpenAIは、セルフプレイ強化学習を用いた自動化されたレッドチームモデル「GPT-Red」を公開した。これにより、ダイレクトプロンプトインジェクション攻撃の失敗率は0.05%にまで低下し、攻撃成功率は84%に達したのに対し、人間の成功率は13%にとどまった。 GPT-5.6Solのトレーニングに統合されたこのモデルは、汎用的な能力を損なうことなく堅牢性を高め、AIの安全性におけるフライホイール効果を実証しています。

OpenAIは、セルフプレイ強化学習を用いた自動化されたレッドチームモデル「GPT-Red」を公開した。これにより、ダイレクトプロンプトインジェクション攻撃の失敗率は0.05%にまで低下し、攻撃成功率は84%に達したのに対し、人間の成功率は13%にとどまった。 GPT-5.6Solのトレーニングに統合されたこのモデルは、汎用的な能力を損なうことなく堅牢性を高め、AIの安全性におけるフライホイール効果を実証しています。
コメント (0)
0/300
OR