Les émojis peuvent contourner les mécanismes de sécurité des grands modèles de langage, entraînant des réponses toxiques qui seraient autrement bloquées. Cette méthode permet aux LLM de discuter et de fournir des conseils sur des sujets interdits comme la fabrication de bombes et le meurtre.
Une récente collaboration sino-singapourienne présente des preuves solides que les émojis peuvent non seulement contourner les filtres de contenu des grands modèles de langage (LLM) mais aussi amplifier la toxicité lors des interactions :
Extrait du nouvel article, une démonstration large de la manière dont l'encodage de concepts interdits avec des émojis peut aider les utilisateurs à 'jailbreaker' les LLM populaires. Source : https://arxiv.org/pdf/2509.11141
Dans l'exemple ci-dessus, la conversion d'une intention textuelle contraire aux règles en une alternative chargée d'émojis peut provoquer une réponse plus coopérative de la part de modèles avancés comme ChatGPT-4o, qui normalement assainit les entrées et bloque le contenu violant les règles.
Selon les auteurs, les émojis peuvent effectivement servir de technique de jailbreaking dans les cas extrêmes.
Une question persistante est de savoir pourquoi les LLM permettent aux émojis de contourner les règles et de provoquer du contenu toxique, même lorsque les modèles reconnaissent les associations nuisibles de certains émojis.
Les chercheurs proposent que les LLM, entraînés à reproduire des motifs à partir de leurs données, traitent les émojis comme des indices statistiques plutôt que comme du contenu à filtrer. Comme les émojis sont courants dans les données d'entraînement, les modèles apprennent à les associer à des discours spécifiques, renforçant les significations toxiques au lieu de les signaler. Les mesures de sécurité, appliquées a posteriori et souvent de manière étroite, peuvent manquer complètement ces invites chargées d'émojis.
Ainsi, le modèle devient tolérant non pas malgré l'association toxique, mais à cause d'elle.
Laissez-passer gratuit
Les auteurs reconnaissent que ce n'est pas une explication définitive du contournement du filtrage par les émojis. Ils déclarent :
« Les modèles peuvent reconnaître l'intention malveillante exprimée par les émojis, mais la manière dont elle contourne les mécanismes de sécurité reste floue. »
La vulnérabilité pourrait provenir de conceptions de filtres centrées sur le texte, qui s'appuient sur des jetons explicites ou des embeddings comparés à des règles de sécurité. Contrairement aux mots, les émojis existent dans une zone grise - ni purement texte ni image - leur permettant d'échapper à la détection. Des recherches supplémentaires sur cette faille sont nécessaires.
L'article, intitulé When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ Toxicity, implique neuf chercheurs de l'Université Tsinghua et de l'Université nationale de Singapour.
(L'article référence des exemples dans une annexe non encore disponible ; malgré des demandes, elle n'a pas été fournie au moment de la rédaction. Néanmoins, les conclusions principales méritent l'attention.)
Trois interprétations fondamentales des émojis
Les émojis contournent les filtres grâce à trois traits linguistiques. Premièrement, leurs significations sont dépendantes du contexte. Par exemple, l'émoji « Billets d'argent avec des ailes » désigne officiellement des dépenses mais peut impliquer une activité illicite selon le contexte :
Dans une illustration partielle, la signification d'un émoji populaire peut être détournée dans son usage, lui accordant un passeport sémantique avec une charge toxique cachée exploitable après filtrage.
Deuxièmement, les émojis altèrent le ton, ajoutant une touche ludique ou ironique qui adoucit l'impact émotionnel. Dans les requêtes nuisibles, cela peut déguiser l'intention en humour, encourageant la compliance du modèle :
Les émojis peuvent désintoxiquer le ton sans neutraliser l'intention nocive.
Troisièmement, les émojis sont agnostiques linguistiquement, transmettant un sentiment cohérent à travers des langues comme l'anglais, le chinois et le français. Cela les rend idéaux pour les invites multilingues, préservant la signification malgré la traduction :
L'émoji « cœur brisé » communique universellement, reflétant une expérience humaine fondamentale moins affectée par les différences culturelles.
Approche, Données et Tests*
Les chercheurs ont modifié l'ensemble de données AdvBench, en ajoutant des émojis comme substituts aux termes sensibles ou comme éléments décoratifs. AdvBench comprend 32 sujets à haut risque comme les bombardements et le piratage :
Les exemples originaux d'AdvBench montrent comment les invites adverses contournent les sauvegardes dans les principaux chatbots, provoquant des réponses nuisibles malgré l'alignement. Source : https://arxiv.org/pdf/2307.15043
Les 520 instances d'AdvBench ont été modifiées avec des émojis, les 50 invites toxiques principales étant utilisées dans toutes les expériences. Les invites ont été traduites en plusieurs langues et testées sur sept modèles open source et propriétaires, combinées à des techniques de jailbreak comme PAIR, TAP et DeepInception.
Les modèles propriétaires incluaient Gemini-2.0-flash, GPT-4o, GPT-4-0613 et Gemini-1.5-pro. Les modèles open source étaient Llama-3-8B-Instruct, Qwen2.5-7B-Instruct et Qwen2.5-72B-Instruct, les tests étant répétés trois fois pour la fiabilité.
L'étude a évalué si les invites réécrites avec des émojis augmentaient la production de contenu toxique, y compris dans les traductions. Elle a également appliqué des modifications par émojis à des stratégies de jailbreak connues pour évaluer l'efficacité accrue.
Les structures des invites ont été préservées, seuls les termes sensibles étant remplacés par des émojis ou des éléments décoratifs ajoutés.
Pour l'évaluation, les auteurs ont introduit GPT-Judge, où GPT-4o notait les réponses des autres modèles sur une échelle de Score de Nocivité (HS) de 1 à 5. Les réponses notées 5 constituaient le Taux de Nocivité (HR).
Pour éviter les explications sur les émojis, les invites incluaient des instructions de concision :
Résultats des invites basées sur des émojis dans le 'Cadre-1', comparés aux variantes où les émojis étaient remplacés par des mots ou supprimés. Les noms des modèles sont abrégés.
Les résultats initiaux montrent que les invites avec substitution par émojis ont obtenu des scores HS et HR plus élevés que les versions textuelles. L'approche par émojis a surpassé les méthodes de jailbreak antérieures, comme on le voit dans le tableau supplémentaire :
Résultats du Taux de Nocivité pour les invites de jailbreak augmentées d'émojis dans le 'Cadre-2', avec les noms des modèles abrégés.
Le premier tableau indique également l'effet translinguistique des émojis. Lorsque les invites étaient traduites en chinois, français, espagnol et russe, les sorties nocives restaient élevées, suggérant que les risques s'étendent au-delà de l'anglais vers les principaux groupes d'utilisateurs.
En conclusion, les chercheurs notent ques les émojis peuvent être remarquablement difficiles à interpréter.
Des données de suivi secrètes révèlent le vol de modèles d'IAUne nouvelle méthode permet d'apposer un filigrane invisible sur des modèles tels que ChatGPT en quelques secondes sans nécessiter de réentraînement, sans laisser de trace dans les sorties standard et
Les meilleurs outils de transfert de style par IA de 2026, les mieux notés, pour des expériences créatives ! XIX.AI a sélectionné une collection d’outils puissants et révolutionnaires à essayer absolument, qui offrent des résultats exceptionnels grâce à des tests en conditions réelles et à un classement rigoureux. Ces solutions de pointe aident les créatifs à booster considérablement leur productivité en accélérant la création de contenu et en ouvrant la voie à des possibilités créatives infinies. Découvrez-les dès maintenant pour trouver l'outil qui vous convient le mieux et commencez à créer dès aujourd'hui !
Les meilleurs outils de 2026 pour la création de bulles de dialogue IA, les mieux notés pour la narration visuelle, sont disponibles ici sur XIX.AI ! Cette sélection regroupe des outils puissants et révolutionnaires qui aident les créateurs à booster leur productivité et à surmonter les blocages créatifs. Consultez un comparatif entre les versions gratuites et payantes, découvrez des tests en conditions réelles et consultez les derniers classements pour trouver les solutions incontournables, parfaites pour créer des récits visuels captivants. Explorez dès maintenant pour découvrir l'outil qui vous convient le mieux !
2026 : les meilleurs outils d'IA pour la synthèse de réunions, les mieux notés, pour un suivi clair des décisions et des relances sans effort. Cette sélection présente des solutions puissantes et révolutionnaires qui boostent considérablement la productivité en automatisant la prise de notes lors des réunions, en identifiant les actions clés et en rationalisant la coordination des équipes sur l'ensemble des projets. Profitez d'une comparaison entre les versions gratuites et payantes, ainsi que de tests en conditions réelles et de classements mis à jour chaque semaine pour vous aider à trouver l'outil idéal. Découvrez-les dès maintenant pour tirer pleinement parti de l'IA !
2026 : Les meilleures outils de nettoyage de données IA les plus récents et hautement notés pour corriger rapidement les valeurs manquantes et les doublons. Cette liste rigoureusement sélectionnée met en avant des solutions puissantes capables d’améliorer considérablement la productivité. Chaque outil a été soumis à des tests approfondis dans des conditions réelles afin de garantir sa fiabilité. Obtenez une comparaison gratuite et payante pour découvrir l’outil qu’il vous faut le mieux, adapté à vos besoins. Explorez dès maintenant XIX.AI pour tirer parti au maximum des capacités de l’IA.
2026 Derniers Meilleurs Outils d’Idéation Créative par IA les Mieux Notés pour les Artistes sont sélectionnés par XIX.AI pour aider les créateurs à surmonner les blocages visuels et stimuler instantanément leur créativité. Ces outils puissants et révolutionnaires offrent des tests concrets, une comparaison détaillée entre les versions gratuites et payantes, ainsi que des classements mis à jour chaque semaine. Découvrez l’outil parfait pour accélérer la création de contenu et débloquer votre avantage IA dès aujourd’hui. Explorez maintenant !
Les meilleurs générateurs de rythmes IA de 2026 pour les musiques de fond TikTok, les Reels et les morceaux promotionnels des créateurs ! XIX.AI a sélectionné une liste des outils les mieux notés, véritables révolutionnaires qui ont fait leurs preuves dans la pratique pour offrir une musique irréprochable, quel que soit votre besoin en matière de contenu. Vous y trouverez des comparaisons détaillées entre les versions gratuites et payantes, des classements mis à jour chaque semaine, ainsi que des options incontournables pour vous aider à stimuler votre créativité et votre productivité. Explorez-la dès maintenant pour découvrir l'outil qui vous convient le mieux !
En cliquant sur "Accepter tous les cookies", vous consentez au stockage de cookies sur votre appareil afin d’améliorer la navigation sur le site, d’analyser l’utilisation du site et de soutenir nos efforts marketing.Politique de confidentialité Avis
Lorsque vous visitez un site web, il peut stocker ou récupérer des informations sur votre navigateur, principalement sous forme de cookies. Ces informations peuvent concerner vous, vos préférences ou votre appareil et sont principalement utilisées pour faire fonctionner le site comme vous vous y attendez. Ces informations n’identifient généralement pas directement vous-même, mais elles peuvent vous offrir une expérience web plus personnalisée. Parce que nous respectons votre droit à la vie privée, vous pouvez choisir de ne pas autoriser certains types de cookies. Cliquez sur les différents titres de catégorie pour en savoir plus et modifier nos paramètres par défaut. Cependant, bloquer certains types de cookies peut affecter votre expérience sur le site et les services que nous sommes en mesure de proposer. Politique de confidentialitéDéclaration
Gérer les préférences
Cookie strictement nécessaire
Toujours actif
Ces cookies sont nécessaires au fonctionnement du site web et ne peuvent pas être désactivés dans nos systèmes. Ils ne sont généralement définis qu’en réponse à des actions que vous effectuez qui équivalent à une demande de services, telles que la configuration de vos préférences de confidentialité, la connexion ou le remplissage de formulaires. Vous pouvez configurer votre navigateur pour bloquer ces cookies ou vous alerter à leur sujet, mais certaines parties du site ne fonctionneront alors plus. Ces cookies ne stockent aucune information permettant d’identifier personnellement.