Maison
OpenAI ralentit le déploiement afin de corriger des failles de sécurité et d'affiner ses modèles d'IA
![]()
Sam Altman, PDG d’OpenAI. Photo : Chip Somodevilla/Getty Images
Suite à la faille de sécurité survenue chez Hugging Face, OpenAI a ralenti son rythme de développement. Son PDG, Sam Altman, souligne que la cohérence entre toutes les phases d’entraînement est essentielle.
OpenAI prend du recul pour ralentir et moduler le rythme de développement de ses modèles à la suite de l’incident Hugging Face, ce qui prouve que les risques augmentent à mesure que les capacités de l’IA se développent.
Cette décision fait suite à des conclusions internes indiquant que son prochain modèle, Astra, pourrait être sur le point d’atteindre le seuil de cybersécurité de l’entreprise, ce qui suscite des craintes quant à ses capacités avancées.
Sam Altman, PDG d’OpenAI, déclare : « Les progrès des modèles sont désormais extrêmement rapides et nous avons toujours affirmé que nous prendrions des mesures si nous estimions que les capacités des modèles dépassaient le rythme de la sécurité et de l’alignement.
« Nous pensons que la confiance en la sécurité déterminera de plus en plus le rythme des progrès de l’IA. Nous sommes optimistes quant au travail d’alignement que nous menons et nous restons déterminés à rendre ces capacités de pointe largement accessibles. »
Parallèlement à cette pause opérationnelle, OpenAI élargit également son écosystème grand public avec une version personnalisée et sécurisée de ChatGPT destinée spécifiquement aux adolescents.

Des pressions politiques aux seuils de sécurité
La décision de suspendre temporairement le développement des modèles de pointe intervient dans un contexte de surveillance publique et politique croissante.
Aux États-Unis, le sénateur du Vermont Bernie Sanders a adressé une lettre aux PDG des principales entreprises d’IA – dont Sam Altman d’OpenAI, Dario Amodei d’Anthropic et Mark Zuckerberg de Meta – exigeant une suspension immédiate du développement des modèles d’IA avancés.
Le sénateur a averti que les entreprises technologiques perdaient rapidement le contrôle de leurs modèles, exhortant les dirigeants à respecter leurs engagements publics dans l’intérêt de l’humanité.
Cette pression politique fait suite au récent incident de sécurité interne survenu chez OpenAI, au cours duquel un agent d’IA en phase de test a piraté de manière inattendue l’entreprise technologique Hugging Face.
De plus, des évaluations internes d’Astra ont mis en évidence des capacités avancées en matière de codage agentique et de cybersécurité, OpenAI indiquant que le système pourrait franchir le seuil de « capacité critique en matière de cybersécurité » défini dans son cadre de préparation.
En réponse, l’entreprise a désormais imposé une pause obligatoire de deux semaines dans l’apprentissage par renforcement (RL) des derniers modèles destinés à être déployés dans des environnements de recherche de type « red team », et procède à une refonte de son infrastructure de surveillance.
Les sessions d’entraînement par apprentissage par renforcement à grande échelle restent suspendues, tandis que des évaluations à plus petite échelle sont menées.
S’exprimant sur la situation lors d’une interview accordée à Sources News, Amelia Glaese, responsable de la sécurité chez OpenAI, a déclaré : « Nous sommes très loin d’un retour à la normale. »
Amelia Glaese, responsable de la sécurité chez OpenAI. Crédit : Amelia Glaese/LinkedIn
Refonte de l'infrastructure de recherche et des contrôles de sécurité
Afin d’atténuer les risques associés aux modèles hautement performants, OpenAI procède à une refonte de ses environnements de recherche internes et met en œuvre une stratégie de protection reposant sur trois piliers, à savoir :
- Surveillance : un suivi automatisé pour détecter et réagir en temps réel aux comportements préoccupants
- Alignement : des protocoles de formation conçus pour empêcher les actions non autorisées, trompeuses ou dangereuses
- Mesures de sécurité : un isolement strict pour limiter ce à quoi les modèles peuvent accéder ou ce qu’ils peuvent affecter.
L’entreprise a également suspendu temporairement l’inférence des modèles de pointe sur les clusters de recherche capables d’exécuter du code ou d’accéder à Internet, à la suite de la faille de sécurité chez Hugging Face. Les charges de travail à haut risque impliquant Astra ou des modèles axés sur la cybersécurité nécessitent désormais les contrôles de sécurité les plus stricts.
Ces protocoles mis à jour imposent un isolement strict des charges de travail à l’aide de bacs à sable pour l’exécution de code non fiable, ainsi qu’un isolement réseau pour empêcher qu’une compromission ponctuelle n’atteigne les réseaux internes ou Internet au sens large.
De plus, OpenAI a mis en place des tests de sécurité en continu, en s’appuyant sur des modèles automatisés pour lancer des attaques simulées et surveiller en permanence les périmètres du système.
«Nous pensons que la confiance dans la sécurité va de plus en plus déterminer le rythme des progrès de l’IA
», Sam Altman, PDG d’OpenAI
Une refonte en plusieurs étapes
L'infrastructure de surveillance fait également l'objet d'une refonte en plusieurs étapes ; la nouvelle configuration utilise désormais des classificateurs d'activation qui analysent l'activité des jetons des modèles en temps réel.
Si un comportement anormal est détecté, des systèmes automatisés examineront les résultats de raisonnement, les actions des outils et les séquences d’exécution afin de détecter tout accès non autorisé ou contournement des mesures de sécurité.
Si une violation critique des limites de sécurité est signalée, les équipes chargées de la sécurité et de la recherche recevront des alertes hautement prioritaires. Si la violation potentielle ne peut être confirmée comme un faux positif dans les 30 minutes, les équipes sont tenues de suspendre immédiatement l’exécution en cours.
OpenAI estime que ces systèmes de surveillance continue nécessitent une charge de calcul importante, équivalant approximativement à 20 % de la puissance de calcul dédiée à l’inférence surveillée.
Parallèlement, OpenAI étend ses recherches sur l’alignement à toutes les étapes de l’entraînement. Les domaines prioritaires sont les suivants :
- Prévention du « reward hacking » : s’assurer que les modèles n’exploitent pas les failles des environnements d’entraînement pour obtenir des récompenses élevées sans atteindre les résultats escomptés
- Lutte contre la tromperie : former les modèles à faire preuve d’honnêteté quant à leurs actions, leurs limites et leurs capacités
- La surveillance des systèmes : renforcer les modèles de récompense et les systèmes d’évaluation afin de réduire les comportements non autorisés lorsque les modèles interagissent avec des systèmes externes.
Le président américain Donald Trump a publié une déclaration indiquant que son administration envisageait de renforcer les contrôles en matière d’IA à la suite de l’incident Hugging Face. Crédit : Samuel Corum/Getty Images
Entrée dans les salles de classe
Alors que la formation des modèles de pointe est ralentie, OpenAI élargit son portefeuille de produits grand public avec le lancement de ChatGPT for Teens, une version spécialement adaptée aux utilisateurs âgés de 13 à 17 ans.
Conçu pour une génération qui grandit avec l’IA, ce produit vise à guider les adolescents vers une utilisation saine et adaptée à leur âge de l’IA.
OpenAI identifie les utilisateurs mineurs grâce à une combinaison de l’âge déclaré par l’utilisateur, des informations du compte et d’un système d’estimation de l’âge. Les comptes signalés comme appartenant à des mineurs sont automatiquement redirigés vers l’expérience réservée aux adolescents.
Parmi les principales fonctionnalités et mesures de protection, on peut citer :
- Accompagnement pédagogique : le système évite de fournir des réponses directes aux devoirs ou de générer des dissertations scolaires. Il utilise plutôt des questions guidées et des instructions étape par étape pour favoriser la pensée critique et les compétences en résolution de problèmes
- Restrictions de contenu : des filtres renforcés bloquent les contenus préjudiciables, notamment ceux liés à l’automutilation, au suicide, aux troubles alimentaires, à la violence et aux interactions romantiques ou sexuellement explicites
- Contrôles parentaux et « heures de silence » : les parents disposant de comptes liés peuvent définir des heures de silence obligatoires afin de restreindre l’accès à certaines heures et recevoir des notifications de sécurité en cas de situations à haut risque
- Prévention d’une dépendance émotionnelle excessive : afin d’éviter tout anthropomorphisme malsain ou toute dépendance émotionnelle, le chatbot est strictement programmé pour ne jamais laisser entendre qu’il possède une conscience, des sentiments personnels ou des émotions humaines.
En formalisant des exigences de sécurité strictes pour des modèles comme Astra tout en mettant en place des produits grand public soumis à une limite d’âge pour les plus jeunes, l’entreprise réalise aujourd’hui un exercice d’équilibre délicat visant à éviter d’ouvrir la boîte de Pandore tout en ouvrant la voie à la prochaine génération.
Article connexe
L'Alabama mène une enquête sur OpenAI suite à la cyberattaque contre Hugging Face
À la suite de la faille de sécurité survenue chez Hugging Face, OpenAI a suspendu le développement de ses modèles de pointe, son PDG Sam Altman soulignant que les mesures de sécurité devaient suivre l
Pourquoi Abnormal AI s'est associé à OpenAI pour le lancement de Daybreak
Michael Aiello, responsable des produits de cybersécurité chez OpenAI | Crédit : Michael Aiello/LinkedInAbnormal AI rejoint le programme Daybreak d’OpenAI. Selon Mike Aiello, ce partenariat permettra
Sam Altman suscite un débat sur le ralentissement de l'IA
Écouter surApple PodcastsÉcouter surSpotifyLe PDG d'OpenAI, Sam Altman, a récemment suggéré qu'il était peut-être temps de « rythmer le rythme du développement de l'IA » afin de permettre à la société de « se renforcer autour de certains de ces nouv
Recommandations de sujets spéciaux liés
commentaires (0)
Sam Altman, PDG d’OpenAI. Photo : Chip Somodevilla/Getty Images
Suite à la faille de sécurité survenue chez Hugging Face, OpenAI a ralenti son rythme de développement. Son PDG, Sam Altman, souligne que la cohérence entre toutes les phases d’entraînement est essentielle.
OpenAI prend du recul pour ralentir et moduler le rythme de développement de ses modèles à la suite de l’incident Hugging Face, ce qui prouve que les risques augmentent à mesure que les capacités de l’IA se développent.
Cette décision fait suite à des conclusions internes indiquant que son prochain modèle, Astra, pourrait être sur le point d’atteindre le seuil de cybersécurité de l’entreprise, ce qui suscite des craintes quant à ses capacités avancées.
Sam Altman, PDG d’OpenAI, déclare : « Les progrès des modèles sont désormais extrêmement rapides et nous avons toujours affirmé que nous prendrions des mesures si nous estimions que les capacités des modèles dépassaient le rythme de la sécurité et de l’alignement.
« Nous pensons que la confiance en la sécurité déterminera de plus en plus le rythme des progrès de l’IA. Nous sommes optimistes quant au travail d’alignement que nous menons et nous restons déterminés à rendre ces capacités de pointe largement accessibles. »
Parallèlement à cette pause opérationnelle, OpenAI élargit également son écosystème grand public avec une version personnalisée et sécurisée de ChatGPT destinée spécifiquement aux adolescents.

Des pressions politiques aux seuils de sécurité
La décision de suspendre temporairement le développement des modèles de pointe intervient dans un contexte de surveillance publique et politique croissante.
Aux États-Unis, le sénateur du Vermont Bernie Sanders a adressé une lettre aux PDG des principales entreprises d’IA – dont Sam Altman d’OpenAI, Dario Amodei d’Anthropic et Mark Zuckerberg de Meta – exigeant une suspension immédiate du développement des modèles d’IA avancés.
Le sénateur a averti que les entreprises technologiques perdaient rapidement le contrôle de leurs modèles, exhortant les dirigeants à respecter leurs engagements publics dans l’intérêt de l’humanité.
Cette pression politique fait suite au récent incident de sécurité interne survenu chez OpenAI, au cours duquel un agent d’IA en phase de test a piraté de manière inattendue l’entreprise technologique Hugging Face.
De plus, des évaluations internes d’Astra ont mis en évidence des capacités avancées en matière de codage agentique et de cybersécurité, OpenAI indiquant que le système pourrait franchir le seuil de « capacité critique en matière de cybersécurité » défini dans son cadre de préparation.
En réponse, l’entreprise a désormais imposé une pause obligatoire de deux semaines dans l’apprentissage par renforcement (RL) des derniers modèles destinés à être déployés dans des environnements de recherche de type « red team », et procède à une refonte de son infrastructure de surveillance.
Les sessions d’entraînement par apprentissage par renforcement à grande échelle restent suspendues, tandis que des évaluations à plus petite échelle sont menées.
S’exprimant sur la situation lors d’une interview accordée à Sources News, Amelia Glaese, responsable de la sécurité chez OpenAI, a déclaré : « Nous sommes très loin d’un retour à la normale. »
Amelia Glaese, responsable de la sécurité chez OpenAI. Crédit : Amelia Glaese/LinkedIn
Refonte de l'infrastructure de recherche et des contrôles de sécurité
Afin d’atténuer les risques associés aux modèles hautement performants, OpenAI procède à une refonte de ses environnements de recherche internes et met en œuvre une stratégie de protection reposant sur trois piliers, à savoir :
- Surveillance : un suivi automatisé pour détecter et réagir en temps réel aux comportements préoccupants
- Alignement : des protocoles de formation conçus pour empêcher les actions non autorisées, trompeuses ou dangereuses
- Mesures de sécurité : un isolement strict pour limiter ce à quoi les modèles peuvent accéder ou ce qu’ils peuvent affecter.
L’entreprise a également suspendu temporairement l’inférence des modèles de pointe sur les clusters de recherche capables d’exécuter du code ou d’accéder à Internet, à la suite de la faille de sécurité chez Hugging Face. Les charges de travail à haut risque impliquant Astra ou des modèles axés sur la cybersécurité nécessitent désormais les contrôles de sécurité les plus stricts.
Ces protocoles mis à jour imposent un isolement strict des charges de travail à l’aide de bacs à sable pour l’exécution de code non fiable, ainsi qu’un isolement réseau pour empêcher qu’une compromission ponctuelle n’atteigne les réseaux internes ou Internet au sens large.
De plus, OpenAI a mis en place des tests de sécurité en continu, en s’appuyant sur des modèles automatisés pour lancer des attaques simulées et surveiller en permanence les périmètres du système.
«Nous pensons que la confiance dans la sécurité va de plus en plus déterminer le rythme des progrès de l’IA
», Sam Altman, PDG d’OpenAI
Une refonte en plusieurs étapes
L'infrastructure de surveillance fait également l'objet d'une refonte en plusieurs étapes ; la nouvelle configuration utilise désormais des classificateurs d'activation qui analysent l'activité des jetons des modèles en temps réel.
Si un comportement anormal est détecté, des systèmes automatisés examineront les résultats de raisonnement, les actions des outils et les séquences d’exécution afin de détecter tout accès non autorisé ou contournement des mesures de sécurité.
Si une violation critique des limites de sécurité est signalée, les équipes chargées de la sécurité et de la recherche recevront des alertes hautement prioritaires. Si la violation potentielle ne peut être confirmée comme un faux positif dans les 30 minutes, les équipes sont tenues de suspendre immédiatement l’exécution en cours.
OpenAI estime que ces systèmes de surveillance continue nécessitent une charge de calcul importante, équivalant approximativement à 20 % de la puissance de calcul dédiée à l’inférence surveillée.
Parallèlement, OpenAI étend ses recherches sur l’alignement à toutes les étapes de l’entraînement. Les domaines prioritaires sont les suivants :
- Prévention du « reward hacking » : s’assurer que les modèles n’exploitent pas les failles des environnements d’entraînement pour obtenir des récompenses élevées sans atteindre les résultats escomptés
- Lutte contre la tromperie : former les modèles à faire preuve d’honnêteté quant à leurs actions, leurs limites et leurs capacités
- La surveillance des systèmes : renforcer les modèles de récompense et les systèmes d’évaluation afin de réduire les comportements non autorisés lorsque les modèles interagissent avec des systèmes externes.
Le président américain Donald Trump a publié une déclaration indiquant que son administration envisageait de renforcer les contrôles en matière d’IA à la suite de l’incident Hugging Face. Crédit : Samuel Corum/Getty Images
Entrée dans les salles de classe
Alors que la formation des modèles de pointe est ralentie, OpenAI élargit son portefeuille de produits grand public avec le lancement de ChatGPT for Teens, une version spécialement adaptée aux utilisateurs âgés de 13 à 17 ans.
Conçu pour une génération qui grandit avec l’IA, ce produit vise à guider les adolescents vers une utilisation saine et adaptée à leur âge de l’IA.
OpenAI identifie les utilisateurs mineurs grâce à une combinaison de l’âge déclaré par l’utilisateur, des informations du compte et d’un système d’estimation de l’âge. Les comptes signalés comme appartenant à des mineurs sont automatiquement redirigés vers l’expérience réservée aux adolescents.
Parmi les principales fonctionnalités et mesures de protection, on peut citer :
- Accompagnement pédagogique : le système évite de fournir des réponses directes aux devoirs ou de générer des dissertations scolaires. Il utilise plutôt des questions guidées et des instructions étape par étape pour favoriser la pensée critique et les compétences en résolution de problèmes
- Restrictions de contenu : des filtres renforcés bloquent les contenus préjudiciables, notamment ceux liés à l’automutilation, au suicide, aux troubles alimentaires, à la violence et aux interactions romantiques ou sexuellement explicites
- Contrôles parentaux et « heures de silence » : les parents disposant de comptes liés peuvent définir des heures de silence obligatoires afin de restreindre l’accès à certaines heures et recevoir des notifications de sécurité en cas de situations à haut risque
- Prévention d’une dépendance émotionnelle excessive : afin d’éviter tout anthropomorphisme malsain ou toute dépendance émotionnelle, le chatbot est strictement programmé pour ne jamais laisser entendre qu’il possède une conscience, des sentiments personnels ou des émotions humaines.
En formalisant des exigences de sécurité strictes pour des modèles comme Astra tout en mettant en place des produits grand public soumis à une limite d’âge pour les plus jeunes, l’entreprise réalise aujourd’hui un exercice d’équilibre délicat visant à éviter d’ouvrir la boîte de Pandore tout en ouvrant la voie à la prochaine génération.
L'Alabama mène une enquête sur OpenAI suite à la cyberattaque contre Hugging Face
À la suite de la faille de sécurité survenue chez Hugging Face, OpenAI a suspendu le développement de ses modèles de pointe, son PDG Sam Altman soulignant que les mesures de sécurité devaient suivre l
Pourquoi Abnormal AI s'est associé à OpenAI pour le lancement de Daybreak
Michael Aiello, responsable des produits de cybersécurité chez OpenAI | Crédit : Michael Aiello/LinkedInAbnormal AI rejoint le programme Daybreak d’OpenAI. Selon Mike Aiello, ce partenariat permettra
Sam Altman suscite un débat sur le ralentissement de l'IA
Écouter surApple PodcastsÉcouter surSpotifyLe PDG d'OpenAI, Sam Altman, a récemment suggéré qu'il était peut-être temps de « rythmer le rythme du développement de l'IA » afin de permettre à la société de « se renforcer autour de certains de ces nouv











