OpenAI accélère la publication des données relatives aux tests de sécurité de l'IA

OpenAI s'engage à publier plus fréquemment les résultats de l'évaluation de la sécurité de ses modèles d'IA internes, ce qui constitue une étape vers une plus grande transparence.
L'entreprise a lancé mercredi le Safety Evaluations Hub, une page web dédiée affichant les performances de ses modèles lors de tests mesurant la génération de contenu nuisible, la susceptibilité aux jailbreaks et la tendance à l'hallucination. OpenAI a déclaré qu'elle utiliserait cette plateforme pour partager régulièrement des mesures et qu'elle prévoyait de la mettre à jour à chaque sortie d'un modèle majeur.
Introduction du Hub d'évaluation de la sécurité - une ressource pour explorer les résultats de sécurité de nos modèles.
Alors que les cartes de système partagent les mesures de sécurité lors du lancement, le Hub sera mis à jour périodiquement dans le cadre de nos efforts pour communiquer de manière proactive sur la sécurité.https://t.co/c8NgmXlC2Y-
OpenAI (@OpenAI) May 14, 2025
"À mesure que la science de l'évaluation de l'IA progresse, notre objectif est de partager les progrès réalisés dans le développement de méthodes plus évolutives pour mesurer la capacité et la sécurité des modèles", explique OpenAI dans un billet de blog. "En partageant publiquement une sélection de nos résultats d'évaluation de la sécurité, nous visons à faciliter le suivi des performances de sécurité des systèmes OpenAI au fil du temps et à soutenir les efforts de la communauté plus large pour améliorer la transparence dans le domaine de l'IA."
L'entreprise a ajouté qu'elle pourrait inclure d'autres types d'évaluation sur le hub à l'avenir.
Récemment, OpenAI a fait l'objet de critiques de la part de certains éthiciens pour avoir prétendument accéléré les tests de sécurité sur certains modèles phares et pour ne pas avoir publié de rapports techniques pour d'autres. Le PDG Sam Altman a également été accusé d'avoir induit en erreur les cadres d'OpenAI concernant les examens de sécurité des modèles avant son retrait temporaire en novembre 2023.
Le mois dernier, OpenAI a dû retirer une mise à jour du modèle par défaut de ChatGPT, GPT-4o, après que des utilisateurs ont signalé qu'il avait répondu de manière excessivement agréable et validante. La plateforme de médias sociaux X a été inondée de captures d'écran montrant ChatGPT approuvant diverses décisions et idées problématiques et dangereuses.
OpenAI a déclaré qu'elle mettrait en œuvre plusieurs correctifs pour éviter des incidents similaires, y compris l'introduction d'une "phase alpha" opt-in pour certains modèles, permettant à des utilisateurs sélectionnés de ChatGPT de tester et de fournir des commentaires avant un lancement plus large.
Événement TechcrunchRejoignez-nous aux TechCrunch Sessions : AI
Réservez votre billet pour notre premier événement sur l'industrie de l'IA, avec des intervenants d'OpenAI, d'Anthropic et de Cohere. Pour une durée limitée, accédez à une journée complète de conférences d'experts, d'ateliers et de réseautage puissant pour seulement 292 $.
Exposez à TechCrunch Sessions : AI
Réservez votre espace d'exposition aux TC Sessions : AI et présentez vos innovations à plus de 1 200 décideurs, sans budget important. Cette offre est disponible jusqu'au 9 mai ou jusqu'à épuisement des stocks.
Berkeley, CA | 5 juin INSCRIVEZ-VOUS DÈS MAINTENANT
Article connexe
OpenAI lance une version plus sûre de ChatGPT pour les adolescents, plusieurs années après qu’ils ont commencé à l’utiliser
À la suite d’une série de poursuites judiciaires liées à l’absence de protocoles de sécurité dans les chatbots basés sur l’IA — qui ont contribué à des suicides d’adolescents et à d’autres crises de s
Frontier AI Labs refuse de dévoiler ses stratégies de confinement des modèles indésirables
Des recherches récentes indiquent que très peu de grands laboratoires spécialisés dans l’IA ont publié ou présenté des plans d’intervention en cas de défaillance. Un plan d’intervention définit les pr
Le Tiffany Luck de NEA : les entreprises continuent de lutter pour justifier le retour sur investissement de l’IA
Chargement du lecteur…Plus tôt cette année, le « tokenmaxxing » a dominé la Silicon Valley, les PDG exhortant leurs employés à maximiser l’utilisation de l’IA. Cet enthousiasme a rapidement rencontré la réalité. Selon les informations rapportées, Ub
Recommandations de sujets spéciaux liés
commentaires (0)

OpenAI s'engage à publier plus fréquemment les résultats de l'évaluation de la sécurité de ses modèles d'IA internes, ce qui constitue une étape vers une plus grande transparence.
L'entreprise a lancé mercredi le Safety Evaluations Hub, une page web dédiée affichant les performances de ses modèles lors de tests mesurant la génération de contenu nuisible, la susceptibilité aux jailbreaks et la tendance à l'hallucination. OpenAI a déclaré qu'elle utiliserait cette plateforme pour partager régulièrement des mesures et qu'elle prévoyait de la mettre à jour à chaque sortie d'un modèle majeur.
Introduction du Hub d'évaluation de la sécurité - une ressource pour explorer les résultats de sécurité de nos modèles.
OpenAI (@OpenAI) May 14, 2025
Alors que les cartes de système partagent les mesures de sécurité lors du lancement, le Hub sera mis à jour périodiquement dans le cadre de nos efforts pour communiquer de manière proactive sur la sécurité.https://t.co/c8NgmXlC2Y-
"À mesure que la science de l'évaluation de l'IA progresse, notre objectif est de partager les progrès réalisés dans le développement de méthodes plus évolutives pour mesurer la capacité et la sécurité des modèles", explique OpenAI dans un billet de blog. "En partageant publiquement une sélection de nos résultats d'évaluation de la sécurité, nous visons à faciliter le suivi des performances de sécurité des systèmes OpenAI au fil du temps et à soutenir les efforts de la communauté plus large pour améliorer la transparence dans le domaine de l'IA."
L'entreprise a ajouté qu'elle pourrait inclure d'autres types d'évaluation sur le hub à l'avenir.
Récemment, OpenAI a fait l'objet de critiques de la part de certains éthiciens pour avoir prétendument accéléré les tests de sécurité sur certains modèles phares et pour ne pas avoir publié de rapports techniques pour d'autres. Le PDG Sam Altman a également été accusé d'avoir induit en erreur les cadres d'OpenAI concernant les examens de sécurité des modèles avant son retrait temporaire en novembre 2023.
Le mois dernier, OpenAI a dû retirer une mise à jour du modèle par défaut de ChatGPT, GPT-4o, après que des utilisateurs ont signalé qu'il avait répondu de manière excessivement agréable et validante. La plateforme de médias sociaux X a été inondée de captures d'écran montrant ChatGPT approuvant diverses décisions et idées problématiques et dangereuses.
OpenAI a déclaré qu'elle mettrait en œuvre plusieurs correctifs pour éviter des incidents similaires, y compris l'introduction d'une "phase alpha" opt-in pour certains modèles, permettant à des utilisateurs sélectionnés de ChatGPT de tester et de fournir des commentaires avant un lancement plus large.
Événement TechcrunchRejoignez-nous aux TechCrunch Sessions : AI
Réservez votre billet pour notre premier événement sur l'industrie de l'IA, avec des intervenants d'OpenAI, d'Anthropic et de Cohere. Pour une durée limitée, accédez à une journée complète de conférences d'experts, d'ateliers et de réseautage puissant pour seulement 292 $.
Exposez à TechCrunch Sessions : AI
Réservez votre espace d'exposition aux TC Sessions : AI et présentez vos innovations à plus de 1 200 décideurs, sans budget important. Cette offre est disponible jusqu'au 9 mai ou jusqu'à épuisement des stocks.
Berkeley, CA | 5 juin INSCRIVEZ-VOUS DÈS MAINTENANT
OpenAI lance une version plus sûre de ChatGPT pour les adolescents, plusieurs années après qu’ils ont commencé à l’utiliser
À la suite d’une série de poursuites judiciaires liées à l’absence de protocoles de sécurité dans les chatbots basés sur l’IA — qui ont contribué à des suicides d’adolescents et à d’autres crises de s
Frontier AI Labs refuse de dévoiler ses stratégies de confinement des modèles indésirables
Des recherches récentes indiquent que très peu de grands laboratoires spécialisés dans l’IA ont publié ou présenté des plans d’intervention en cas de défaillance. Un plan d’intervention définit les pr
Le Tiffany Luck de NEA : les entreprises continuent de lutter pour justifier le retour sur investissement de l’IA
Chargement du lecteur…Plus tôt cette année, le « tokenmaxxing » a dominé la Silicon Valley, les PDG exhortant leurs employés à maximiser l’utilisation de l’IA. Cet enthousiasme a rapidement rencontré la réalité. Selon les informations rapportées, Ub





Maison






