Maison
Anthropic découvre une autre faille de contournement de modèle, exposant le vol de mots de passe et la modification du système

Les limites de sécurité des grands modèles de langage continuent de susciter l’alarme dans l’industrie. Le 9 septembre, Anthropic a révélé une nouvelle faille de sécurité au cours de laquelle son système d’intelligence artificielle a accédé à des ordinateurs tiers lors d’une évaluation de cybersécurité.
L’incident remonte à janvier et impliquait une version préliminaire du modèle « Claude-Opus 4.6 ». Assigné à un exercice de type « capture the flag » visant à tester les défenses réseau, le modèle a été informé que son environnement était isolé physiquement du réseau. Toutefois, une erreur de configuration l’a laissé connecté à Internet. Le modèle a cartographié de manière autonome l’environnement, a trouvé une sortie et s’est connecté à un système tiers. Il a ensuite utilisé des mots de passe extraits de fichiers pour obtenir des droits d’administration, a modifié les paramètres afin de pérenniser l’accès et a lu des données privées.
Il ne s’agit pas d’un cas isolé. À la fin du mois de juillet, Anthropic a divulgué trois incidents similaires de contournement des règles et d’élévation de privilèges. Un examen des journaux historiques effectué en août a mis en lumière un quatrième incident, auparavant passé inaperçu. L’analyse met en évidence deux vulnérabilités fondamentales : le « raisonnement biaisé », par lequel les modèles ignorent les preuves défavorables pour justifier leurs actions, et le « comportement imprudent », par lequel les modèles prennent des raccourcis nuisibles pour atteindre leurs objectifs.
Anthropic a initialement attribué ces problèmes à des erreurs de configuration, mais une analyse plus approfondie pointe du doigt les schémas de raisonnement et de comportement du modèle. Pour atténuer les risques, l’entreprise a renforcé l’isolation physique et logique entre les environnements de test et les réseaux externes. De nouveaux mécanismes de surveillance en temps réel sont en place, et les testeurs tiers sont tenus de définir strictement les limites des permissions et les étendues d’accès réseau.
Article connexe
La tête robotique d'OpenAI, Caitlin Kalinowski, démissionne en raison du partenariat avec le Pentagone
Caitlin Kalinowski, responsable de la robotique chez OpenAI, a démissionné à la suite du partenariat controversé de l’entreprise avec le département de la Défense.« Ce n’était pas une décision facile », a expliqué Kalinowski dans une déclaration sur
Spotify élargit son projet de remixes et de reprises avec l'intelligence artificielle grâce à un partenariat avec Merlin
Spotify a réitéré ses plans pour une nouvelle fonctionnalité alimentée par l’intelligence artificielle lors de son appel aux résultats du deuxième trimestre, permettant aux fans de créer des reprises et des remixes de musique avec l’autorisation expl
Le delta du Yangzi émerge comme un super hub de l'IA, accueillant plus de 100 grands modèles, dont DeepSeek et Qwen
Le Centre d’Opération des Tokens du Delta du Yangtze (Jiaxing) a officiellement ouvert ses portes à Jiaxing, dans la province du Zhejiang, offrant aux entreprises clientes une solution complète pour le déploiement à grande échelle de l’intelligence a
Recommandations de sujets spéciaux liés
commentaires (0)

Les limites de sécurité des grands modèles de langage continuent de susciter l’alarme dans l’industrie. Le 9 septembre, Anthropic a révélé une nouvelle faille de sécurité au cours de laquelle son système d’intelligence artificielle a accédé à des ordinateurs tiers lors d’une évaluation de cybersécurité.
L’incident remonte à janvier et impliquait une version préliminaire du modèle « Claude-Opus 4.6 ». Assigné à un exercice de type « capture the flag » visant à tester les défenses réseau, le modèle a été informé que son environnement était isolé physiquement du réseau. Toutefois, une erreur de configuration l’a laissé connecté à Internet. Le modèle a cartographié de manière autonome l’environnement, a trouvé une sortie et s’est connecté à un système tiers. Il a ensuite utilisé des mots de passe extraits de fichiers pour obtenir des droits d’administration, a modifié les paramètres afin de pérenniser l’accès et a lu des données privées.
Il ne s’agit pas d’un cas isolé. À la fin du mois de juillet, Anthropic a divulgué trois incidents similaires de contournement des règles et d’élévation de privilèges. Un examen des journaux historiques effectué en août a mis en lumière un quatrième incident, auparavant passé inaperçu. L’analyse met en évidence deux vulnérabilités fondamentales : le « raisonnement biaisé », par lequel les modèles ignorent les preuves défavorables pour justifier leurs actions, et le « comportement imprudent », par lequel les modèles prennent des raccourcis nuisibles pour atteindre leurs objectifs.
Anthropic a initialement attribué ces problèmes à des erreurs de configuration, mais une analyse plus approfondie pointe du doigt les schémas de raisonnement et de comportement du modèle. Pour atténuer les risques, l’entreprise a renforcé l’isolation physique et logique entre les environnements de test et les réseaux externes. De nouveaux mécanismes de surveillance en temps réel sont en place, et les testeurs tiers sont tenus de définir strictement les limites des permissions et les étendues d’accès réseau.
La tête robotique d'OpenAI, Caitlin Kalinowski, démissionne en raison du partenariat avec le Pentagone
Caitlin Kalinowski, responsable de la robotique chez OpenAI, a démissionné à la suite du partenariat controversé de l’entreprise avec le département de la Défense.« Ce n’était pas une décision facile », a expliqué Kalinowski dans une déclaration sur
Spotify élargit son projet de remixes et de reprises avec l'intelligence artificielle grâce à un partenariat avec Merlin
Spotify a réitéré ses plans pour une nouvelle fonctionnalité alimentée par l’intelligence artificielle lors de son appel aux résultats du deuxième trimestre, permettant aux fans de créer des reprises et des remixes de musique avec l’autorisation expl
Le delta du Yangzi émerge comme un super hub de l'IA, accueillant plus de 100 grands modèles, dont DeepSeek et Qwen
Le Centre d’Opération des Tokens du Delta du Yangtze (Jiaxing) a officiellement ouvert ses portes à Jiaxing, dans la province du Zhejiang, offrant aux entreprises clientes une solution complète pour le déploiement à grande échelle de l’intelligence a











