opción
Hogar
Última hora
Contenido
GaryLewis
GaryLewis
16 de julio de 2026

OpenAI ha lanzado GPT-Red, un modelo automatizado de «equipo rojo» que utiliza aprendizaje por refuerzo mediante autojuego. Reduce las tasas de fracaso de los ataques de inyección directa de prompts al 0,05 %, alcanzando un índice de éxito en los ataques del 84 %, frente al 13 % de los humanos. Integrado en el entrenamiento de GPT-5.6Sol, mejora la robustez sin sacrificar las capacidades generales, lo que demuestra un efecto de «flywheel» en la seguridad de la IA.

OpenAI ha lanzado GPT-Red, un modelo automatizado de «equipo rojo» que utiliza aprendizaje por refuerzo mediante autojuego. Reduce las tasas de fracaso de los ataques de inyección directa de prompts al 0,05 %, alcanzando un índice de éxito en los ataques del 84 %, frente al 13 % de los humanos. Integrado en el entrenamiento de GPT-5.6Sol, mejora la robustez sin sacrificar las capacidades generales, lo que demuestra un efecto de «flywheel» en la seguridad de la IA.
comentario (0)
0/300
OR