Hogar
OpenAI ralentiza el lanzamiento para subsanar fallos de seguridad y perfeccionar los modelos de IA
![]()
Sam Altman, director ejecutivo de OpenAI. Foto: Chip Somodevilla/Getty Images
Tras la brecha de seguridad de Hugging Face, OpenAI ha ralentizado su ritmo de desarrollo. El director ejecutivo, Sam Altman, destaca que la alineación en todas las fases de entrenamiento es fundamental.
OpenAI está dando un paso atrás para ralentizar y dosificar el desarrollo de sus modelos tras el incidente de Hugging Face, lo que demuestra que, a medida que aumentan las capacidades de la IA, también lo hacen los riesgos.
Esta medida se debe a hallazgos internos que indican que su próximo modelo, Astra, podría estar acercándose al límite de ciberseguridad de la empresa, lo que suscita temores sobre sus capacidades avanzadas.
Sam Altman, director ejecutivo de OpenAI, afirma: «El progreso de los modelos es ahora extremadamente rápido y siempre hemos dicho que tomaríamos medidas si considerábamos que las capacidades de los modelos superaban el ritmo de la seguridad y la alineación
«Esperamos que la confianza en la seguridad marque cada vez más el ritmo del progreso de la IA. Somos optimistas respecto al trabajo de alineación que estamos realizando y seguimos comprometidos con hacer que las capacidades de vanguardia estén ampliamente disponibles».
Paralelamente a esta pausa operativa, OpenAI también está ampliando su ecosistema de consumidores con una versión personalizada y protegida de ChatGPT dirigida específicamente a los adolescentes.

De la presión política a los umbrales de seguridad
La decisión de detener temporalmente el desarrollo de modelos de vanguardia se produce en medio de un creciente escrutinio público y político.
En EE. UU., el senador de Vermont Bernie Sanders dirigió una carta a los directores ejecutivos de las principales empresas de IA —entre ellos Sam Altman, de OpenAI; Dario Amodei, de Anthropic; y Mark Zuckerberg, de Meta— exigiendo una pausa inmediata en el desarrollo de modelos avanzados de IA.
El senador advirtió de que las empresas tecnológicas están perdiendo rápidamente el control sobre sus modelos, e instó a los ejecutivos a cumplir sus compromisos públicos en interés de la humanidad.
Esta presión política se produjo a raíz del reciente incidente de seguridad interna en OpenAI, en el que un agente de IA en fase de pruebas hackeó inesperadamente la empresa tecnológica Hugging Face.
Además, las evaluaciones internas de Astra pusieron de manifiesto capacidades avanzadas en programación autónoma y ciberseguridad, y OpenAI indicó que podría superar el umbral de «capacidad crítica de ciberseguridad» definido en su Marco de Preparación.
En respuesta a ello, la empresa ha iniciado ahora una pausa obligatoria de dos semanas en el entrenamiento de aprendizaje por refuerzo (RL) de los últimos modelos destinados a su implementación en entornos de investigación de «equipo rojo» y para revisar la infraestructura de supervisión.
Las sesiones de entrenamiento de RL de vanguardia a gran escala siguen en suspenso mientras se llevan a cabo evaluaciones a menor escala.
Al referirse a la situación en una entrevista con Sources News, Amelia Glaese, directora de Seguridad de OpenAI, señala: «Estamos muy lejos de que todo vuelva a la normalidad».
Amelia Glaese, directora de Seguridad de OpenAI. Crédito: Amelia Glaese/LinkedIn
Revisión de la infraestructura de investigación y los controles de seguridad
Para mitigar los riesgos asociados a los modelos de gran capacidad, OpenAI está renovando sus entornos de investigación internos y aplicando una estrategia de protección basada en tres pilares, que incluye:
- Supervisión: seguimiento automatizado para detectar y responder a comportamientos preocupantes en tiempo real
- Alineación: protocolos de entrenamiento diseñados para prevenir acciones no autorizadas, engañosas o inseguras
- Medidas de seguridad: aislamiento riguroso para limitar a qué pueden acceder o qué pueden afectar los modelos.
Asimismo, ha suspendido temporalmente la inferencia de modelos de vanguardia en los clústeres de investigación capaces de ejecutar código o acceder a Internet tras la brecha de seguridad de Hugging Face. Las cargas de trabajo de alto riesgo que impliquen a Astra o a modelos centrados en la ciberseguridad requieren ahora los controles de seguridad más estrictos.
Estos protocolos actualizados imponen un estricto aislamiento de las cargas de trabajo mediante entornos aislados (sandboxes) para la ejecución de código no fiable, junto con el aislamiento de la red para evitar que las vulnerabilidades en un único punto lleguen a las redes internas o a Internet en general.
Además, OpenAI ha integrado pruebas de seguridad continuas, aprovechando modelos automatizados para ejecutar ataques simulados y supervisar los límites del sistema de forma continua.
Esperamos que la confianza en la seguridad marque cada vez más el ritmo del progreso de la IA
. Sam Altman, director ejecutivo de OpenAI
Un rediseño en varias fases
La infraestructura de supervisión también está siendo objeto de un rediseño en varias fases; la nueva configuración emplea ahora clasificadores de activación que analizan la actividad de los tokens de los modelos en tiempo real.
Si se detecta un comportamiento anómalo, los sistemas automatizados examinarán los resultados del razonamiento, las acciones de las herramientas y las secuencias de ejecución en busca de accesos no autorizados o de elusión de las medidas de seguridad.
Si se señala una violación crítica de los límites de seguridad, los equipos de seguridad e investigación recibirán alertas de alta prioridad. Si la posible violación no puede confirmarse como un falso positivo en un plazo de 30 minutos, los equipos están obligados a detener inmediatamente la ejecución en curso.
OpenAI estima que estos sistemas de supervisión continua exigen una carga computacional significativa, equivalente aproximadamente al 20 % de la capacidad computacional de inferencia supervisada.
Al mismo tiempo, OpenAI está ampliando su investigación sobre la alineación a todas las etapas de entrenamiento. Las áreas de interés incluyen:
- Prevención del «reward hacking»: garantizar que los modelos no aprovechen fallos en los entornos de entrenamiento para obtener altas recompensas sin alcanzar los resultados previstos
- Mitigar el engaño: entrenar a los modelos para que mantengan la honestidad respecto a sus acciones, límites y capacidades
- Supervisión del sistema: reforzar los modelos de recompensa y los sistemas de evaluación para reducir los comportamientos no autorizados cuando los modelos interactúan con sistemas externos.
El presidente de EE. UU., Donald Trump, emitió un comunicado en el que afirmaba que su administración está considerando controles más estrictos sobre la IA tras el incidente de Hugging Face. Crédito: Samuel Corum/Getty Images
Llegada a las aulas
Aunque el entrenamiento de modelos de vanguardia se ha ralentizado, OpenAI está ampliando su cartera de productos para consumidores con el lanzamiento de ChatGPT for Teens, una versión diseñada específicamente para usuarios de entre 13 y 17 años.
Diseñado para una generación que crece con la IA, el producto tiene como objetivo orientar a los adolescentes hacia un uso saludable y adecuado a su edad de la IA.
OpenAI identifica a los usuarios menores de edad mediante una combinación de la edad declarada por el propio usuario, los datos de la cuenta y un sistema de estimación de la edad. Las cuentas marcadas como de menores de edad se redirigen automáticamente a la experiencia para adolescentes.
Entre las características y medidas de protección clave se incluyen:
- Orientación educativa: el sistema evita proporcionar respuestas directas a los deberes o generar redacciones escolares. En su lugar, utiliza preguntas guiadas e indicaciones paso a paso para fomentar el pensamiento crítico y las habilidades de resolución de problemas
- Restricciones de contenido: Unos filtros mejorados eliminan el material perjudicial, incluyendo la autolesión, el suicidio, los trastornos alimentarios, la violencia y las interacciones románticas o sexualmente explícitas
- Controles parentales y «horas de descanso»: los padres con cuentas vinculadas pueden establecer horas de descanso obligatorias para restringir el acceso durante franjas horarias específicas y recibir notificaciones de seguridad en situaciones de alto riesgo
- Prevención de la dependencia emocional excesiva: Para evitar un antropomorfismo poco saludable o una dependencia emocional, el chatbot está estrictamente programado para no dar nunca a entender que tiene conciencia, sentimientos personales o emociones humanas.
Al formalizar requisitos de seguridad estrictos para modelos como Astra y, al mismo tiempo, crear productos de consumo con restricción de edad para los grupos demográficos más jóvenes, la empresa está llevando a cabo ahora un delicado ejercicio de equilibrio para evitar abrir la caja de Pandora al tiempo que abre las puertas a la próxima generación.
Artículo relacionado
Alabama investiga a OpenAI por la filtración informática de Hugging Face
A raíz de la brecha de seguridad de Hugging Face, OpenAI ha suspendido el desarrollo de modelos de vanguardia, y su director ejecutivo, Sam Altman, ha destacado que la alineación en materia de segurid
¿Por qué Abnormal AI se asoció con OpenAI en «Daybreak»?
Michael Aiello, responsable de productos de ciberseguridad en OpenAI | Crédito: Michael Aiello/LinkedInAbnormal AI se une al programa Daybreak de OpenAI; según Mike Aiello, esta colaboración acelerará
Sam Altman desata un debate sobre la desaceleración de la IA
Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Sam Altman, director ejecutivo de OpenAI. Foto: Chip Somodevilla/Getty Images
Tras la brecha de seguridad de Hugging Face, OpenAI ha ralentizado su ritmo de desarrollo. El director ejecutivo, Sam Altman, destaca que la alineación en todas las fases de entrenamiento es fundamental.
OpenAI está dando un paso atrás para ralentizar y dosificar el desarrollo de sus modelos tras el incidente de Hugging Face, lo que demuestra que, a medida que aumentan las capacidades de la IA, también lo hacen los riesgos.
Esta medida se debe a hallazgos internos que indican que su próximo modelo, Astra, podría estar acercándose al límite de ciberseguridad de la empresa, lo que suscita temores sobre sus capacidades avanzadas.
Sam Altman, director ejecutivo de OpenAI, afirma: «El progreso de los modelos es ahora extremadamente rápido y siempre hemos dicho que tomaríamos medidas si considerábamos que las capacidades de los modelos superaban el ritmo de la seguridad y la alineación
«Esperamos que la confianza en la seguridad marque cada vez más el ritmo del progreso de la IA. Somos optimistas respecto al trabajo de alineación que estamos realizando y seguimos comprometidos con hacer que las capacidades de vanguardia estén ampliamente disponibles».
Paralelamente a esta pausa operativa, OpenAI también está ampliando su ecosistema de consumidores con una versión personalizada y protegida de ChatGPT dirigida específicamente a los adolescentes.

De la presión política a los umbrales de seguridad
La decisión de detener temporalmente el desarrollo de modelos de vanguardia se produce en medio de un creciente escrutinio público y político.
En EE. UU., el senador de Vermont Bernie Sanders dirigió una carta a los directores ejecutivos de las principales empresas de IA —entre ellos Sam Altman, de OpenAI; Dario Amodei, de Anthropic; y Mark Zuckerberg, de Meta— exigiendo una pausa inmediata en el desarrollo de modelos avanzados de IA.
El senador advirtió de que las empresas tecnológicas están perdiendo rápidamente el control sobre sus modelos, e instó a los ejecutivos a cumplir sus compromisos públicos en interés de la humanidad.
Esta presión política se produjo a raíz del reciente incidente de seguridad interna en OpenAI, en el que un agente de IA en fase de pruebas hackeó inesperadamente la empresa tecnológica Hugging Face.
Además, las evaluaciones internas de Astra pusieron de manifiesto capacidades avanzadas en programación autónoma y ciberseguridad, y OpenAI indicó que podría superar el umbral de «capacidad crítica de ciberseguridad» definido en su Marco de Preparación.
En respuesta a ello, la empresa ha iniciado ahora una pausa obligatoria de dos semanas en el entrenamiento de aprendizaje por refuerzo (RL) de los últimos modelos destinados a su implementación en entornos de investigación de «equipo rojo» y para revisar la infraestructura de supervisión.
Las sesiones de entrenamiento de RL de vanguardia a gran escala siguen en suspenso mientras se llevan a cabo evaluaciones a menor escala.
Al referirse a la situación en una entrevista con Sources News, Amelia Glaese, directora de Seguridad de OpenAI, señala: «Estamos muy lejos de que todo vuelva a la normalidad».
Amelia Glaese, directora de Seguridad de OpenAI. Crédito: Amelia Glaese/LinkedIn
Revisión de la infraestructura de investigación y los controles de seguridad
Para mitigar los riesgos asociados a los modelos de gran capacidad, OpenAI está renovando sus entornos de investigación internos y aplicando una estrategia de protección basada en tres pilares, que incluye:
- Supervisión: seguimiento automatizado para detectar y responder a comportamientos preocupantes en tiempo real
- Alineación: protocolos de entrenamiento diseñados para prevenir acciones no autorizadas, engañosas o inseguras
- Medidas de seguridad: aislamiento riguroso para limitar a qué pueden acceder o qué pueden afectar los modelos.
Asimismo, ha suspendido temporalmente la inferencia de modelos de vanguardia en los clústeres de investigación capaces de ejecutar código o acceder a Internet tras la brecha de seguridad de Hugging Face. Las cargas de trabajo de alto riesgo que impliquen a Astra o a modelos centrados en la ciberseguridad requieren ahora los controles de seguridad más estrictos.
Estos protocolos actualizados imponen un estricto aislamiento de las cargas de trabajo mediante entornos aislados (sandboxes) para la ejecución de código no fiable, junto con el aislamiento de la red para evitar que las vulnerabilidades en un único punto lleguen a las redes internas o a Internet en general.
Además, OpenAI ha integrado pruebas de seguridad continuas, aprovechando modelos automatizados para ejecutar ataques simulados y supervisar los límites del sistema de forma continua.
Esperamos que la confianza en la seguridad marque cada vez más el ritmo del progreso de la IA
. Sam Altman, director ejecutivo de OpenAI
Un rediseño en varias fases
La infraestructura de supervisión también está siendo objeto de un rediseño en varias fases; la nueva configuración emplea ahora clasificadores de activación que analizan la actividad de los tokens de los modelos en tiempo real.
Si se detecta un comportamiento anómalo, los sistemas automatizados examinarán los resultados del razonamiento, las acciones de las herramientas y las secuencias de ejecución en busca de accesos no autorizados o de elusión de las medidas de seguridad.
Si se señala una violación crítica de los límites de seguridad, los equipos de seguridad e investigación recibirán alertas de alta prioridad. Si la posible violación no puede confirmarse como un falso positivo en un plazo de 30 minutos, los equipos están obligados a detener inmediatamente la ejecución en curso.
OpenAI estima que estos sistemas de supervisión continua exigen una carga computacional significativa, equivalente aproximadamente al 20 % de la capacidad computacional de inferencia supervisada.
Al mismo tiempo, OpenAI está ampliando su investigación sobre la alineación a todas las etapas de entrenamiento. Las áreas de interés incluyen:
- Prevención del «reward hacking»: garantizar que los modelos no aprovechen fallos en los entornos de entrenamiento para obtener altas recompensas sin alcanzar los resultados previstos
- Mitigar el engaño: entrenar a los modelos para que mantengan la honestidad respecto a sus acciones, límites y capacidades
- Supervisión del sistema: reforzar los modelos de recompensa y los sistemas de evaluación para reducir los comportamientos no autorizados cuando los modelos interactúan con sistemas externos.
El presidente de EE. UU., Donald Trump, emitió un comunicado en el que afirmaba que su administración está considerando controles más estrictos sobre la IA tras el incidente de Hugging Face. Crédito: Samuel Corum/Getty Images
Llegada a las aulas
Aunque el entrenamiento de modelos de vanguardia se ha ralentizado, OpenAI está ampliando su cartera de productos para consumidores con el lanzamiento de ChatGPT for Teens, una versión diseñada específicamente para usuarios de entre 13 y 17 años.
Diseñado para una generación que crece con la IA, el producto tiene como objetivo orientar a los adolescentes hacia un uso saludable y adecuado a su edad de la IA.
OpenAI identifica a los usuarios menores de edad mediante una combinación de la edad declarada por el propio usuario, los datos de la cuenta y un sistema de estimación de la edad. Las cuentas marcadas como de menores de edad se redirigen automáticamente a la experiencia para adolescentes.
Entre las características y medidas de protección clave se incluyen:
- Orientación educativa: el sistema evita proporcionar respuestas directas a los deberes o generar redacciones escolares. En su lugar, utiliza preguntas guiadas e indicaciones paso a paso para fomentar el pensamiento crítico y las habilidades de resolución de problemas
- Restricciones de contenido: Unos filtros mejorados eliminan el material perjudicial, incluyendo la autolesión, el suicidio, los trastornos alimentarios, la violencia y las interacciones románticas o sexualmente explícitas
- Controles parentales y «horas de descanso»: los padres con cuentas vinculadas pueden establecer horas de descanso obligatorias para restringir el acceso durante franjas horarias específicas y recibir notificaciones de seguridad en situaciones de alto riesgo
- Prevención de la dependencia emocional excesiva: Para evitar un antropomorfismo poco saludable o una dependencia emocional, el chatbot está estrictamente programado para no dar nunca a entender que tiene conciencia, sentimientos personales o emociones humanas.
Al formalizar requisitos de seguridad estrictos para modelos como Astra y, al mismo tiempo, crear productos de consumo con restricción de edad para los grupos demográficos más jóvenes, la empresa está llevando a cabo ahora un delicado ejercicio de equilibrio para evitar abrir la caja de Pandora al tiempo que abre las puertas a la próxima generación.
Alabama investiga a OpenAI por la filtración informática de Hugging Face
A raíz de la brecha de seguridad de Hugging Face, OpenAI ha suspendido el desarrollo de modelos de vanguardia, y su director ejecutivo, Sam Altman, ha destacado que la alineación en materia de segurid
¿Por qué Abnormal AI se asoció con OpenAI en «Daybreak»?
Michael Aiello, responsable de productos de ciberseguridad en OpenAI | Crédito: Michael Aiello/LinkedInAbnormal AI se une al programa Daybreak de OpenAI; según Mike Aiello, esta colaboración acelerará
Sam Altman desata un debate sobre la desaceleración de la IA
Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de











