옵션
집
속보
콘텐츠
GaryLewis
GaryLewis
2026년 7월 16일

OpenAI는 자기 플레이 강화 학습을 활용한 자동화된 레드팀 모델인 ‘GPT-Red’를 공개했습니다. 이 모델은 직접 프롬프트 주입 공격의 실패율을 0.05%로 낮추었으며, 공격 성공률은 84%를 기록해 인간의 13%를 크게 앞섰습니다. 이 모델은 GPT-5.6Sol 훈련 과정에 통합되어, 일반적인 성능을 저하시키지 않으면서도 견고성을 향상시켜 AI 안전성의 선순환 효과를 입증했습니다.

OpenAI는 자기 플레이 강화 학습을 활용한 자동화된 레드팀 모델인 ‘GPT-Red’를 공개했습니다. 이 모델은 직접 프롬프트 주입 공격의 실패율을 0.05%로 낮추었으며, 공격 성공률은 84%를 기록해 인간의 13%를 크게 앞섰습니다. 이 모델은 GPT-5.6Sol 훈련 과정에 통합되어, 일반적인 성능을 저하시키지 않으면서도 견고성을 향상시켜 AI 안전성의 선순환 효과를 입증했습니다.
의견 (0)
0/300
OR