Maison
OpenAI dévoile un filtre de confidentialité pour un contexte de 128K avec huit modes de reconnaissance
OpenAI a présenté Privacy Filter, un modèle d’anonymisation des informations d’identification personnelle (PII) de pointe. Maintenant disponible sous la licence Apache 2.0 sur Hugging Face et GitHub, cet outil offre aux développeurs une solution locale hautement personnalisable pour une protection robuste de la vie privée.
Compréhension sémantique avancée au-delà de la correspondance basée sur des règles
Contrairement aux outils traditionnels basés sur des règles, Privacy Filter s’appuie sur une compréhension profonde du langage pour identifier avec précision les données sensibles dans des textes non structurés en fonction du contexte. Cette approche permet de masquer efficacement les informations privées tout en préservant un maximum d’utilité dans le contenu public.

Architecture MoE légère pour une efficacité supérieure
La conception technique du modèle privilégie à la fois la flexibilité et les performances :
Conception en Mixture of Experts (MoE) : Avec un total de 1,5 milliard de paramètres, seuls environ 50 millions de paramètres sont activés par inférence. Cette efficacité permet un fonctionnement fluide sur des appareils edge aux ressources limitées, y compris les ordinateurs portables et les navigateurs web.
Support de contexte étendu : Doté d’une fenêtre de contexte de 128 000 tokens, le modèle utilise une architecture de classification bidirectionnelle des tokens combinée à un algorithme de Viterbi contraint pour garantir précision et cohérence lors du traitement de longs documents.
Reconnaissance à haute précision : Dans le benchmark PII-Masking-300k mis à jour, le modèle a obtenu un score F1 de 97,43 %, avec un taux de rappel de 98,08 %.
Système complet de classification de la vie privée
Privacy Filter identifie et étiquette avec précision huit catégories principales d’informations sensibles :
Identité de base : Noms, adresses, adresses e-mail et numéros de téléphone.
Actifs en ligne : Liens URL.
Sécurité financière : Détails des comptes, y compris les numéros de compte bancaire et de carte de crédit.
Identifiants confidentiels : Mots de passe et clés API.
Informations sensibles dans le temps : Données relatives aux dates.
Scénarios d’application : un « pare-feu local » pour les LLM cloud
OpenAI positionne cet outil comme une couche de pré-filtrage. En traitant le texte localement pour la détection et l’anonymisation des PII avant de l’envoyer à des modèles de langage de grande taille basés sur le cloud, cette stratégie « les données restent sur l’appareil » réduit considérablement le risque que les utilisateurs exposent involontairement des informations privées aux services d’IA.
Article connexe
NewCore lève 66 millions de dollars pour doter les agents IA d’identités à mesure qu’ils occupent des rôles d’employés
Cybersecurity startup NewCore has officially launched from stealth, securing $66 million in funding on Monday. The company aims to address a critical challenge that many organizations will soon encounter as they integrate AI agents: how to authentica
Microsoft et Mistral concluent un partenariat européen de plusieurs milliards de dollars dans le domaine de l'IA
Au cœur de cette collaboration se trouve un accord de plusieurs milliards de dollars destiné à renforcer les infrastructures d’intelligence artificielle à travers l’Europe. Crédit : MicrosoftMicrosoft
Les documents Microsoft, non censurés, révèlent que les dirigeants de l’entreprise qualifient l’extraction des données par l’IA de « plus grand vol de travail de l’histoire »
Les documents déclassifiés du procès en contrefaçon de trois ans intenté par The New York Times contre OpenAI et Microsoft révèlent une admission selon laquelle le grattage d’informations par l’intelligence artificielle constitue un vol et pose une m
Recommandations de sujets spéciaux liés
commentaires (0)
OpenAI a présenté Privacy Filter, un modèle d’anonymisation des informations d’identification personnelle (PII) de pointe. Maintenant disponible sous la licence Apache 2.0 sur Hugging Face et GitHub, cet outil offre aux développeurs une solution locale hautement personnalisable pour une protection robuste de la vie privée.
Compréhension sémantique avancée au-delà de la correspondance basée sur des règles
Contrairement aux outils traditionnels basés sur des règles, Privacy Filter s’appuie sur une compréhension profonde du langage pour identifier avec précision les données sensibles dans des textes non structurés en fonction du contexte. Cette approche permet de masquer efficacement les informations privées tout en préservant un maximum d’utilité dans le contenu public.

Architecture MoE légère pour une efficacité supérieure
La conception technique du modèle privilégie à la fois la flexibilité et les performances :
Conception en Mixture of Experts (MoE) : Avec un total de 1,5 milliard de paramètres, seuls environ 50 millions de paramètres sont activés par inférence. Cette efficacité permet un fonctionnement fluide sur des appareils edge aux ressources limitées, y compris les ordinateurs portables et les navigateurs web.
Support de contexte étendu : Doté d’une fenêtre de contexte de 128 000 tokens, le modèle utilise une architecture de classification bidirectionnelle des tokens combinée à un algorithme de Viterbi contraint pour garantir précision et cohérence lors du traitement de longs documents.
Reconnaissance à haute précision : Dans le benchmark PII-Masking-300k mis à jour, le modèle a obtenu un score F1 de 97,43 %, avec un taux de rappel de 98,08 %.
Système complet de classification de la vie privée
Privacy Filter identifie et étiquette avec précision huit catégories principales d’informations sensibles :
Identité de base : Noms, adresses, adresses e-mail et numéros de téléphone.
Actifs en ligne : Liens URL.
Sécurité financière : Détails des comptes, y compris les numéros de compte bancaire et de carte de crédit.
Identifiants confidentiels : Mots de passe et clés API.
Informations sensibles dans le temps : Données relatives aux dates.
Scénarios d’application : un « pare-feu local » pour les LLM cloud
OpenAI positionne cet outil comme une couche de pré-filtrage. En traitant le texte localement pour la détection et l’anonymisation des PII avant de l’envoyer à des modèles de langage de grande taille basés sur le cloud, cette stratégie « les données restent sur l’appareil » réduit considérablement le risque que les utilisateurs exposent involontairement des informations privées aux services d’IA.
NewCore lève 66 millions de dollars pour doter les agents IA d’identités à mesure qu’ils occupent des rôles d’employés
Cybersecurity startup NewCore has officially launched from stealth, securing $66 million in funding on Monday. The company aims to address a critical challenge that many organizations will soon encounter as they integrate AI agents: how to authentica
Microsoft et Mistral concluent un partenariat européen de plusieurs milliards de dollars dans le domaine de l'IA
Au cœur de cette collaboration se trouve un accord de plusieurs milliards de dollars destiné à renforcer les infrastructures d’intelligence artificielle à travers l’Europe. Crédit : MicrosoftMicrosoft
Les documents Microsoft, non censurés, révèlent que les dirigeants de l’entreprise qualifient l’extraction des données par l’IA de « plus grand vol de travail de l’histoire »
Les documents déclassifiés du procès en contrefaçon de trois ans intenté par The New York Times contre OpenAI et Microsoft révèlent une admission selon laquelle le grattage d’informations par l’intelligence artificielle constitue un vol et pose une m











