Les experts en cybersécurité critiquent les garde-fous de l’article d’Anthropic

Anthropic a lancé son nouveau modèle, Fable, mardi, le présentant comme une version publique et restreinte de son modèle axé sur la cybersécurité, Mythos, très attendu.
Cependant, ces limitations ont suscité l’insatisfaction de plusieurs chercheurs et professionnels de la cybersécurité qui ont exprimé leurs préoccupations en ligne.
« [Fable] bloque toute demande pouvant être liée à la cybersécurité, y compris des tâches inoffensives comme la lecture d’un article de blog », a déclaré Valentina « Chompie » Palmiotti, chercheuse en sécurité de renom chez IBM X-Force.
Lorsqu’une invite utilisateur active ces filtres de sécurité, Fable interrompt la conversation en affichant un message indiquant que ses « protocoles de sécurité ont signalé cette entrée pour des sujets liés à la cybersécurité ou à la biologie. »
Ces restrictions visent à atténuer le risque que Fable soit utilisé pour créer des logiciels malveillants ou exploiter des logiciels, une préoccupation persistante pour Anthropic. Les contraintes biologiques découlent de préoccupations similaires concernant le développement d’armes biologiques.
Lors du lancement de Mythos en avril, Anthropic a limité l’accès à un groupe sélectionné d’entreprises et d’organisations dans le cadre du projet Glasswing, une initiative conçue pour déployer le modèle afin de sécuriser les logiciels et infrastructures critiques. La semaine dernière, Anthropic a élargi l’accès à Mythos à des centaines d’organisations dans 15 pays.
Malgré ces bonnes intentions, de nombreux experts en cybersécurité restent frustrés par le caractère apparemment arbitraire des restrictions. Matt Suiche, un professionnel chevronné de la cybersécurité, a déclaré à TechCrunch que « si vous lui demandez d’écrire du code sécurisé, il interprète cela comme un travail lié à la cybersécurité plutôt que comme des meilleures pratiques en génie logiciel, ce qui entraîne une rétrogradation. » Fable est configuré pour revenir à Claude Opus 4.8 lorsque les garde-fous sont activés. « Il semble s’appuyer sur des mots-clés, donc tout terme du lexique « cybersécurité » active les filtres », a-t-il noté.
Contactez-nous
Avez-vous des informations complémentaires sur la manière dont les pirates exploitent l’IA, ou sur l’intégration de l’IA par les entreprises de cybersécurité ? Nous accueillons vos contributions. Depuis un appareil et un réseau personnels, vous pouvez contacter en toute sécurité Lorenzo Franceschi-Bicchierai sur Signal au +1 917 257 1382, via Telegram et Keybase @lorenzofb, ou par e-mail.
« Cependant, il est compréhensible que nous soyons encore au début et qu’ils affinent leurs garde-fous. Je suis convaincu qu’ils évolueront à mesure qu’Anthropic et d’autres développeurs de modèles de pointe collaboreront plus étroitement avec la nouvelle génération d’entreprises de cybersécurité », a déclaré Suiche, membre du personnel technique chez Tolmo, une startup de cybersécurité basée sur l’IA. « Il est préférable de restreindre excessivement au début et d’assouplir les garde-fous au fil du temps. »
Un autre chercheur s’est plaint sur X que « même demander une revue de code » active les filtres de sécurité de Fable.
Anthropic n’a pas immédiatement répondu à une demande de commentaire.
Au-delà des garde-fous au niveau du modèle, Anthropic exige que les professionnels de la cybersécurité postulent à son Programme de vérification de la cybersécurité. Les candidats approuvés font face à moins de restrictions lors de l’utilisation de Claude pour des tâches liées à la cybersécurité. OpenAI propose un programme comparable appelé Accès de confiance pour la cybersécurité.
Article connexe
La Maison-Blanche abandonne l’étiquette d’« intelligence supérieure » pour l’IA
Chargement du lecteur…Cette semaine, la Maison Blanche a réuni presque tous les principaux PDG de l’industrie technologique dans une même salle — parmi eux Mark Zuckerberg, Jeff Bezos, Elon Musk et Dario Amodei d’Anthropic — pour signer un engagemen
Anthropic dévoile Sonnet 5.5 comme un partenaire de travail plus rapide et moins cher
Au milieu de la concurrence persistante entre les modèles d’IA, Anthropic a lancé la dernière itération de Sonnet, son offre milieu de gamme, promettant une vitesse substantiellement améliorée et des coûts inférieurs par rapport à la version précéden
Le dernier conflit d’Anthropic avec l’administration Trump pourrait bien lui profiter, selon les données de vente
Anthropic connaît un mois remarquable.Selon Ramp, l’entreprise d’intelligence artificielle a dépassé OpenAI en part de marché des dépenses commerciales pour la première fois, clôturant le mois de mai avec une levée de fonds de 65 milliards de dollar
Recommandations de sujets spéciaux liés
commentaires (0)

Anthropic a lancé son nouveau modèle, Fable, mardi, le présentant comme une version publique et restreinte de son modèle axé sur la cybersécurité, Mythos, très attendu.
Cependant, ces limitations ont suscité l’insatisfaction de plusieurs chercheurs et professionnels de la cybersécurité qui ont exprimé leurs préoccupations en ligne.
« [Fable] bloque toute demande pouvant être liée à la cybersécurité, y compris des tâches inoffensives comme la lecture d’un article de blog », a déclaré Valentina « Chompie » Palmiotti, chercheuse en sécurité de renom chez IBM X-Force.
Lorsqu’une invite utilisateur active ces filtres de sécurité, Fable interrompt la conversation en affichant un message indiquant que ses « protocoles de sécurité ont signalé cette entrée pour des sujets liés à la cybersécurité ou à la biologie. »
Ces restrictions visent à atténuer le risque que Fable soit utilisé pour créer des logiciels malveillants ou exploiter des logiciels, une préoccupation persistante pour Anthropic. Les contraintes biologiques découlent de préoccupations similaires concernant le développement d’armes biologiques.
Lors du lancement de Mythos en avril, Anthropic a limité l’accès à un groupe sélectionné d’entreprises et d’organisations dans le cadre du projet Glasswing, une initiative conçue pour déployer le modèle afin de sécuriser les logiciels et infrastructures critiques. La semaine dernière, Anthropic a élargi l’accès à Mythos à des centaines d’organisations dans 15 pays.
Malgré ces bonnes intentions, de nombreux experts en cybersécurité restent frustrés par le caractère apparemment arbitraire des restrictions. Matt Suiche, un professionnel chevronné de la cybersécurité, a déclaré à TechCrunch que « si vous lui demandez d’écrire du code sécurisé, il interprète cela comme un travail lié à la cybersécurité plutôt que comme des meilleures pratiques en génie logiciel, ce qui entraîne une rétrogradation. » Fable est configuré pour revenir à Claude Opus 4.8 lorsque les garde-fous sont activés. « Il semble s’appuyer sur des mots-clés, donc tout terme du lexique « cybersécurité » active les filtres », a-t-il noté.
Contactez-nous
Avez-vous des informations complémentaires sur la manière dont les pirates exploitent l’IA, ou sur l’intégration de l’IA par les entreprises de cybersécurité ? Nous accueillons vos contributions. Depuis un appareil et un réseau personnels, vous pouvez contacter en toute sécurité Lorenzo Franceschi-Bicchierai sur Signal au +1 917 257 1382, via Telegram et Keybase @lorenzofb, ou par e-mail.
« Cependant, il est compréhensible que nous soyons encore au début et qu’ils affinent leurs garde-fous. Je suis convaincu qu’ils évolueront à mesure qu’Anthropic et d’autres développeurs de modèles de pointe collaboreront plus étroitement avec la nouvelle génération d’entreprises de cybersécurité », a déclaré Suiche, membre du personnel technique chez Tolmo, une startup de cybersécurité basée sur l’IA. « Il est préférable de restreindre excessivement au début et d’assouplir les garde-fous au fil du temps. »
Un autre chercheur s’est plaint sur X que « même demander une revue de code » active les filtres de sécurité de Fable.
Anthropic n’a pas immédiatement répondu à une demande de commentaire.
Au-delà des garde-fous au niveau du modèle, Anthropic exige que les professionnels de la cybersécurité postulent à son Programme de vérification de la cybersécurité. Les candidats approuvés font face à moins de restrictions lors de l’utilisation de Claude pour des tâches liées à la cybersécurité. OpenAI propose un programme comparable appelé Accès de confiance pour la cybersécurité.
La Maison-Blanche abandonne l’étiquette d’« intelligence supérieure » pour l’IA
Chargement du lecteur…Cette semaine, la Maison Blanche a réuni presque tous les principaux PDG de l’industrie technologique dans une même salle — parmi eux Mark Zuckerberg, Jeff Bezos, Elon Musk et Dario Amodei d’Anthropic — pour signer un engagemen
Anthropic dévoile Sonnet 5.5 comme un partenaire de travail plus rapide et moins cher
Au milieu de la concurrence persistante entre les modèles d’IA, Anthropic a lancé la dernière itération de Sonnet, son offre milieu de gamme, promettant une vitesse substantiellement améliorée et des coûts inférieurs par rapport à la version précéden
Le dernier conflit d’Anthropic avec l’administration Trump pourrait bien lui profiter, selon les données de vente
Anthropic connaît un mois remarquable.Selon Ramp, l’entreprise d’intelligence artificielle a dépassé OpenAI en part de marché des dépenses commerciales pour la première fois, clôturant le mois de mai avec une levée de fonds de 65 milliards de dollar





Maison






