Option
Heim
Eilmeldung
Inhalt
GaryLewis
GaryLewis
16. Juli 2026

OpenAI hat GPT-Red veröffentlicht, ein automatisiertes Red-Team-Modell, das auf selbstspielendem Verstärkungslernen basiert. Es reduziert die Fehlerquote bei direkten Prompt-Injection-Angriffen auf 0,05 % und erreicht eine Angriffserfolgsrate von 84 %, während diese bei Menschen bei 13 % liegt. Durch die Integration in das GPT-5.6Sol-Training verbessert es die Robustheit, ohne die allgemeinen Fähigkeiten zu beeinträchtigen, und demonstriert damit einen „Flywheel-Effekt“ der KI-Sicherheit.

OpenAI hat GPT-Red veröffentlicht, ein automatisiertes Red-Team-Modell, das auf selbstspielendem Verstärkungslernen basiert. Es reduziert die Fehlerquote bei direkten Prompt-Injection-Angriffen auf 0,05 % und erreicht eine Angriffserfolgsrate von 84 %, während diese bei Menschen bei 13 % liegt. Durch die Integration in das GPT-5.6Sol-Training verbessert es die Robustheit, ohne die allgemeinen Fähigkeiten zu beeinträchtigen, und demonstriert damit einen „Flywheel-Effekt“ der KI-Sicherheit.
Kommentare (0)
0/300
OR