Hogar
OpenAI presenta un filtro de privacidad para contexto de 128K con ocho modos de reconocimiento
OpenAI ha presentado Privacy Filter, un modelo de anonimización de información de identificación personal (PII) de última generación. Ahora disponible bajo la licencia Apache 2.0 en Hugging Face y GitHub, esta herramienta proporciona a los desarrolladores una solución local altamente personalizable para una protección robusta de la privacidad.
Comprensión semántica avanzada más allá de la coincidencia basada en reglas
A diferencia de las herramientas tradicionales basadas en reglas, Privacy Filter aprovecha la comprensión profunda del lenguaje para identificar con precisión los datos sensibles dentro del texto no estructurado según el contexto. Este enfoque oculta eficazmente la información privada mientras preserva la máxima utilidad en el contenido público.

Arquitectura MoE ligera para una eficiencia superior
El diseño técnico del modelo prioriza tanto la flexibilidad como el rendimiento:
Diseño de Mezcla de Expertos (MoE): Con un recuento total de parámetros de 1.500 millones, solo se activan aproximadamente 50 millones de parámetros por inferencia. Esta eficiencia permite un funcionamiento fluido en dispositivos periféricos con recursos limitados, incluidos portátiles y navegadores web.
Soporte de contexto extendido: Con una ventana de contexto de 128.000 tokens, el modelo utiliza una arquitectura de clasificación de tokens bidireccional combinada con un algoritmo de Viterbi restringido para garantizar la precisión y la coherencia al procesar documentos extensos.
Reconocimiento de alta precisión: En el actualizado benchmark PII-Masking-300k, el modelo obtuvo una puntuación F1 del 97,43 %, con una tasa de recuperación del 98,08 %.
Sistema integral de clasificación de privacidad
Privacy Filter identifica y etiqueta con precisión ocho categorías principales de información sensible:
Identidad básica: Nombres, direcciones, correos electrónicos y números de teléfono.
Activos en línea: Enlaces URL.
Seguridad financiera: Detalles de cuentas, incluidos números de tarjetas bancarias y de crédito.
Credenciales confidenciales: Contraseñas y claves de API.
Información sensible al tiempo: Información sobre fechas.
Escenarios de aplicación: un "cortafuegos local" para LLM en la nube
OpenAI posiciona esta herramienta como una capa de prefiltrado. Al procesar el texto localmente para la detección y anonimización de PII antes de enviarlo a modelos de lenguaje grandes basados en la nube, esta estrategia de "los datos permanecen en el dispositivo" reduce significativamente el riesgo de que los usuarios expongan inadvertidamente información privada a servicios de inteligencia artificial.
Artículo relacionado
NewCore recauda 66 millones de dólares para dotar a los agentes de IA de identidades a medida que pasan a desempeñar funciones de empleados
La startup de ciberseguridad NewCore ha salido oficialmente del anonimato, asegurando 66 millones de dólares en financiación el lunes. La empresa tiene como objetivo abordar un desafío crítico que muchas organizaciones pronto enfrentarán al integrar
Microsoft y Mistral firman un acuerdo de colaboración en el ámbito de la inteligencia artificial en Europa por valor de varios miles de millones de dólares
En el centro de esta colaboración se encuentra un acuerdo de varios miles de millones de dólares destinado a reforzar la infraestructura de inteligencia artificial en toda Europa. Crédito: MicrosoftMi
Los ejecutivos de Microsoft califican el raspado de datos de IA como el mayor robo de trabajo en la historia, según documentos no enmendados
Los documentos desclasificados de la demanda por derechos de autor de tres años de antigüedad presentada por The New York Times contra OpenAI y Microsoft revelan una admisión de que el raspado de datos por parte de la inteligencia artificial constitu
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
OpenAI ha presentado Privacy Filter, un modelo de anonimización de información de identificación personal (PII) de última generación. Ahora disponible bajo la licencia Apache 2.0 en Hugging Face y GitHub, esta herramienta proporciona a los desarrolladores una solución local altamente personalizable para una protección robusta de la privacidad.
Comprensión semántica avanzada más allá de la coincidencia basada en reglas
A diferencia de las herramientas tradicionales basadas en reglas, Privacy Filter aprovecha la comprensión profunda del lenguaje para identificar con precisión los datos sensibles dentro del texto no estructurado según el contexto. Este enfoque oculta eficazmente la información privada mientras preserva la máxima utilidad en el contenido público.

Arquitectura MoE ligera para una eficiencia superior
El diseño técnico del modelo prioriza tanto la flexibilidad como el rendimiento:
Diseño de Mezcla de Expertos (MoE): Con un recuento total de parámetros de 1.500 millones, solo se activan aproximadamente 50 millones de parámetros por inferencia. Esta eficiencia permite un funcionamiento fluido en dispositivos periféricos con recursos limitados, incluidos portátiles y navegadores web.
Soporte de contexto extendido: Con una ventana de contexto de 128.000 tokens, el modelo utiliza una arquitectura de clasificación de tokens bidireccional combinada con un algoritmo de Viterbi restringido para garantizar la precisión y la coherencia al procesar documentos extensos.
Reconocimiento de alta precisión: En el actualizado benchmark PII-Masking-300k, el modelo obtuvo una puntuación F1 del 97,43 %, con una tasa de recuperación del 98,08 %.
Sistema integral de clasificación de privacidad
Privacy Filter identifica y etiqueta con precisión ocho categorías principales de información sensible:
Identidad básica: Nombres, direcciones, correos electrónicos y números de teléfono.
Activos en línea: Enlaces URL.
Seguridad financiera: Detalles de cuentas, incluidos números de tarjetas bancarias y de crédito.
Credenciales confidenciales: Contraseñas y claves de API.
Información sensible al tiempo: Información sobre fechas.
Escenarios de aplicación: un "cortafuegos local" para LLM en la nube
OpenAI posiciona esta herramienta como una capa de prefiltrado. Al procesar el texto localmente para la detección y anonimización de PII antes de enviarlo a modelos de lenguaje grandes basados en la nube, esta estrategia de "los datos permanecen en el dispositivo" reduce significativamente el riesgo de que los usuarios expongan inadvertidamente información privada a servicios de inteligencia artificial.
NewCore recauda 66 millones de dólares para dotar a los agentes de IA de identidades a medida que pasan a desempeñar funciones de empleados
La startup de ciberseguridad NewCore ha salido oficialmente del anonimato, asegurando 66 millones de dólares en financiación el lunes. La empresa tiene como objetivo abordar un desafío crítico que muchas organizaciones pronto enfrentarán al integrar
Microsoft y Mistral firman un acuerdo de colaboración en el ámbito de la inteligencia artificial en Europa por valor de varios miles de millones de dólares
En el centro de esta colaboración se encuentra un acuerdo de varios miles de millones de dólares destinado a reforzar la infraestructura de inteligencia artificial en toda Europa. Crédito: MicrosoftMi
Los ejecutivos de Microsoft califican el raspado de datos de IA como el mayor robo de trabajo en la historia, según documentos no enmendados
Los documentos desclasificados de la demanda por derechos de autor de tres años de antigüedad presentada por The New York Times contra OpenAI y Microsoft revelan una admisión de que el raspado de datos por parte de la inteligencia artificial constitu











