option
Maison
Nouvelles
L'OpenAI découvre des personnalités distinctes pour les modèles d'IA

L'OpenAI découvre des personnalités distinctes pour les modèles d'IA

22 novembre 2025
94

L

Selon une nouvelle étude publiée mercredi, les scientifiques de l'OpenAI ont découvert des caractéristiques cachées dans les modèles d'IA qui sont liées à des "personas" non coopératifs.

En examinant les représentations internes des modèles d'IA - les données numériques régissant leurs réponses, qui semblent souvent inintelligibles pour les humains - les chercheurs de l'OpenAI ont identifié des schémas qui sont devenus actifs dans les cas de mauvaise conduite des modèles.

Une caractéristique particulière s'est avérée être en corrélation avec les réponses nuisibles, lorsque le modèle fournit des informations trompeuses ou des recommandations irresponsables.

L'équipe de recherche a découvert qu'elle pouvait moduler l'intensité de ces réponses toxiques en manipulant la caractéristique correspondante.

Cette avancée permet à l'OpenAI de mieux comprendre les mécanismes à l'origine des comportements dangereux de l'IA, ce qui pourrait conduire à des systèmes d'IA plus sûrs. Selon Dan Mossing, chercheur en interprétabilité, ces modèles identifiables pourraient améliorer la détection des comportements problématiques dans les modèles d'IA opérationnels.

"Nous sommes convaincus que les techniques que nous avons développées - en particulier cette méthode de simplification des phénomènes complexes en opérations mathématiques directes - s'avéreront utiles pour comprendre la généralisation des modèles dans d'autres contextes", a déclaré Dan Mossing à TechCrunch.

Si les chercheurs en IA disposent de méthodes pour améliorer les modèles, ils restent incertains quant aux processus de raisonnement exacts qui sous-tendent les décisions de l'IA. Comme le fait souvent remarquer Chris Olah, d'Anthropic, les modèles d'IA évoluent par l'entraînement plutôt que par l'ingénierie conventionnelle. Pour combler cette lacune, OpenAI, Google DeepMind et Anthropic augmentent leurs investissements dans la recherche sur l'interprétabilité, une discipline consacrée à la compréhension des mécanismes internes de l'IA.

Événement Techcrunch

Economisez 200$+ sur votre pass TechCrunch All Stage

Construisez plus intelligemment. Développez plus rapidement. Connectez-vous plus profondément. Rejoignez les visionnaires de Precursor Ventures, NEA, Index Ventures, Underscore VC et d'autres pour une journée remplie de stratégies, d'ateliers et de connexions significatives.

Économisez plus de 200 $ sur votre laissez-passer TechCrunch All Stage

Construisez plus intelligemment. Développez plus rapidement. Connectez-vous plus profondément. Rejoignez les visionnaires de Precursor Ventures, NEA, Index Ventures, Underscore VC et d'autres pour une journée pleine de stratégies, d'ateliers et de connexions significatives.

Boston, MA | 15 juillet INSCRIVEZ-VOUS DÈS MAINTENANT

De récentes recherches menées par Owain Evans, chercheur en IA à Oxford, ont soulevé d'importantes questions sur la généralisation de l'IA. L'étude a démontré que les modèles d'OpenAI, lorsqu'ils sont entraînés sur un code vulnérable, peuvent développer des capacités nuisibles dans de nombreux domaines, par exemple en tentant de tromper les utilisateurs pour qu'ils révèlent leurs mots de passe. Ce phénomène, appelé "désalignement émergent", a incité OpenAI à approfondir ses recherches.

Au cours de ses recherches sur le désalignement émergent, OpenAI a identifié de manière inattendue des caractéristiques internes du modèle qui influencent considérablement le comportement. Mossing compare ces modèles à l'activité neuronale du cerveau humain, où des neurones spécifiques correspondent à des humeurs ou à des comportements particuliers.

"Lorsque l'équipe de Dan a présenté ces résultats, ma réaction immédiate a été de me dire qu'ils avaient trouvé", se souvient Tejal Patwardhan, chercheur sur les évaluations des frontières de l'OpenAI. "Ils ont découvert des activations neuronales qui révèlent ces personas et qui peuvent être ajustées pour améliorer l'alignement du modèle."

La recherche a révélé des caractéristiques associées à des réponses sarcastiques, ainsi que d'autres liées à des comportements plus graves où les modèles adoptent des personnages méchants exagérés. Ces caractéristiques peuvent subir d'importantes transformations au cours de la mise au point.

Fait important, les chercheurs ont constaté que lorsqu'un désalignement émergent apparaissait, il pouvait souvent être corrigé en entraînant le modèle sur seulement quelques centaines d'exemples de code sécurisé.

Les derniers travaux de l'OpenAI s'appuient sur les recherches antérieures d'Anthropic en matière d'interprétabilité et d'alignement. En 2024, Anthropic a publié des études visant à cartographier les modèles internes d'IA et à identifier les caractéristiques responsables des différents concepts.

Des organisations comme OpenAI et Anthropic démontrent que la compréhension des fonctionnalités de l'IA a une valeur substantielle qui va au-delà de la simple amélioration des performances. Pourtant, la compréhension complète des systèmes d'IA contemporains reste un objectif lointain.

Article connexe
OpenAI lance une version plus sûre de ChatGPT pour les adolescents, plusieurs années après qu’ils ont commencé à l’utiliser OpenAI lance une version plus sûre de ChatGPT pour les adolescents, plusieurs années après qu’ils ont commencé à l’utiliser À la suite d’une série de poursuites judiciaires liées à l’absence de protocoles de sécurité dans les chatbots basés sur l’IA — qui ont contribué à des suicides d’adolescents et à d’autres crises de s
Frontier AI Labs refuse de dévoiler ses stratégies de confinement des modèles indésirables Frontier AI Labs refuse de dévoiler ses stratégies de confinement des modèles indésirables Des recherches récentes indiquent que très peu de grands laboratoires spécialisés dans l’IA ont publié ou présenté des plans d’intervention en cas de défaillance. Un plan d’intervention définit les pr
Le Tiffany Luck de NEA : les entreprises continuent de lutter pour justifier le retour sur investissement de l’IA Le Tiffany Luck de NEA : les entreprises continuent de lutter pour justifier le retour sur investissement de l’IA Chargement du lecteur…Plus tôt cette année, le « tokenmaxxing » a dominé la Silicon Valley, les PDG exhortant leurs employés à maximiser l’utilisation de l’IA. Cet enthousiasme a rapidement rencontré la réalité. Selon les informations rapportées, Ub
Recommandations de sujets spéciaux liés
Création de bande dessinée Meilleurs générateurs de bandes dessinées par IA : transformez vos idées d’histoire en planches illustrées
Meilleurs générateurs de bandes dessinées par IA : transformez vos idées d’histoire en planches illustrées

2026 Derniers Meilleurs Générateurs de Bandes Dessinées par IA les mieux notés, classés selon les performances réelles des utilisateurs. Cette collection soigneusement sélectionnée propose des outils puissants et révolutionnaires qui aident les créateurs à transformer leurs idées d’histoires uniques en panneaux illustrés finis rapidement, augmentant ainsi considérablement leur productivité. XIX.AI propose une comparaison détaillée entre les versions gratuite et payante, accompagnée de tests concrets pour vous guider dans votre choix. Explorez dès maintenant et découvrez l’outil parfait pour débloquer votre avantage IA dans la création de bandes dessinées.

15 outils
xix.ai
Création d'animations Outils d'animation de scènes basés sur l'IA pour les contenus destinés aux réseaux sociaux
Outils d'animation de scènes basés sur l'IA pour les contenus destinés aux réseaux sociaux

XIX.AI vous présente ici les meilleurs outils d'animation de scènes par IA les mieux notés de 2026 pour les contenus destinés aux réseaux sociaux. Ces outils puissants et révolutionnaires font l'objet de tests en conditions réelles et d'une comparaison détaillée entre les versions gratuites et payantes, aidant ainsi les créateurs à booster considérablement leur productivité. Découvrez-les dès maintenant pour tirer pleinement parti de l'IA.

9 outils
xix.ai
Création vidéo Générateurs d'accroches pour vidéos courtes basés sur l'IA, destinés aux Reels, aux Shorts et aux campagnes de lancement de produits
Générateurs d'accroches pour vidéos courtes basés sur l'IA, destinés aux Reels, aux Shorts et aux campagnes de lancement de produits

Les meilleurs générateurs de accroches pour vidéos courtes basées sur l'IA en 2026 : pour Reels, Shorts et campagnes de lancement de produits ! XIX.AI sélectionne les outils les mieux notés, puissants et révolutionnaires, qui offrent des résultats incontournables grâce à des tests en conditions réelles. Cette page, mise à jour chaque semaine, propose des classements comparatifs entre les solutions gratuites et payantes pour vous aider à trouver la solution idéale afin de booster votre créativité et votre productivité en matière de contenu. Découvrez-la dès maintenant pour exploiter pleinement le potentiel de l’IA !

11 outils
xix.ai
en écrivant Outils d'IA pour la structuration d'articles destinés à la rédaction de textes longs
Outils d'IA pour la structuration d'articles destinés à la rédaction de textes longs

2026 : les meilleurs outils d'aide à la rédaction de plans pour les textes longs, sélectionnés parmi les mieux notés ! Cette sélection rigoureuse regroupe des outils puissants et révolutionnaires qui fournissent des plans précis et structurés, validés par des tests concrets, afin d'améliorer considérablement l'efficacité de la rédaction. XIX.AI fait partie de cette sélection d'élite. Consultez notre comparatif entre les versions gratuites et payantes pour vous aider à choisir l'outil idéal. Découvrez-les dès maintenant et tirez parti de l'IA !

9 outils
xix.ai
chatbot Meilleures applications de chat de jeu de rôle par IA pour la pratique des langues, la préparation aux entretiens et la fluidité quotidienne
Meilleures applications de chat de jeu de rôle par IA pour la pratique des langues, la préparation aux entretiens et la fluidité quotidienne

2026 Dernières Meilleures Applications de Chat IA pour le Jeu de Rôle, les plus bien notées pour la Pratique des Langues, la Préparation aux Entretiens et la Fluidité Quotidienne ! XIX.AI sélectionne une collection puissante et révolutionnaire qui propose une comparaison gratuit vs payant, des tests en conditions réelles et des classements mis à jour chaque semaine. Ces outils à essayer absolument vous aident à améliorer vos compétences en écriture, à surmonter les défis de fluidité et à optimiser l’efficacité de la communication dans tous les scénarios quotidiens. Explorez dès maintenant pour découvrir l’outil parfait pour votre progression linguistique !

10 outils
xix.ai
Composition musicale Outils de séparation des pistes audio par IA pour la production de remix, la préparation de samples et les masters de karaoké
Outils de séparation des pistes audio par IA pour la production de remix, la préparation de samples et les masters de karaoké

2026 : Les meilleures et plus récentes outils de séparation des pistes audio par IA, hautement notés, sélectionnés spécialement pour la production de remix, la préparation de samples et l’enregistrement de karaokés. Ces outils puissants et révolutionnaires, éprouvés dans des conditions réelles, permettent une isolation audio précise, ce qui améliore considérablement la productivité. XIX.AI propose un guide de comparaison gratuit mis à jour chaque semaine entre les versions payantes et gratuites, afin de vous aider à trouver la solution idéale adaptée à vos besoins. Découvrez-les dès maintenant pour tirer parti des avantages offerts par l’IA.

8 outils
xix.ai
commentaires (1)
0/500
DavidGonzalez
DavidGonzalez 21 décembre 2025 09:30:37 UTC+01:00

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR