Дом
OpenAI представляет фильтр конфиденциальности для контекста 128K с восемью режимами распознавания
OpenAI представила Privacy Filter, передовую модель анонимизации персональных данных (PII). Теперь доступная по лицензии Apache 2.0 на платформах Hugging Face и GitHub, этот инструмент предоставляет разработчикам локальное, высоконастраиваемое решение для надежной защиты конфиденциальности.
Продвинутое семантическое понимание, выходящее за рамки правил
В отличие от традиционных инструментов, основанных на правилах, Privacy Filter использует глубокое понимание языка для точной идентификации конфиденциальных данных в неструктурированном тексте на основе контекста. Этот подход эффективно скрывает личную информацию, сохраняя максимальную полезность публичного контента.

Легкая архитектура MoE для превосходной эффективности
Технический дизайн модели ориентирован как на гибкость, так и на производительность:
Архитектура «Смесь экспертов» (MoE): При общем количестве параметров в 1,5 миллиарда, в каждом вычислении активируется лишь около 50 миллионов параметров. Эта эффективность обеспечивает плавную работу на устройствах с ограниченными ресурсами, включая ноутбуки и веб-браузеры.
Поддержка расширенного контекста: Модель обладает окном контекста объемом 128 000 токенов и использует двунаправленную архитектуру классификации токенов в сочетании со строгим алгоритмом Витерби, что гарантирует точность и связность при обработке длинных документов.
Высокая точность распознавания: В обновленном бенчмарке PII-Masking-300k модель достигла F1-меры на уровне 97,43%, показав уровень полноты (recall) 98,08%.
Комплексная система классификации конфиденциальности
Privacy Filter точно идентифицирует и маркирует восемь основных категорий конфиденциальной информации:
Базовая идентификация: Имена, адреса, адреса электронной почты и номера телефонов.
Онлайн-активы: URL-ссылки.
Финансовая безопасность: Данные учетных записей, включая номера банковских и кредитных карт.
Конфиденциальные учетные данные: Пароли и API-ключи.
Временные данные: Информация о датах.
Сценарии применения: «Локальный брандмауэр» для облачных LLM
OpenAI позиционирует этот инструмент как слой предварительной фильтрации. Обрабатывая текст локально для обнаружения и анонимизации PII перед отправкой в облачные большие языковые модели, эта стратегия «данные остаются на устройстве» значительно снижает риск непреднамеренного раскрытия пользователями личной информации сервисам искусственного интеллекта.
Связанная статья
NewCore привлекает $66 млн для оснащения ИИ-агентов идентичностями по мере их перехода в роли сотрудников
Стартап в области кибербезопасности NewCore официально вышел из тени, привлекши в понедельник 66 миллионов долларов инвестиций. Компания нацелена на решение критической проблемы, с которой столкнутся многие организации в ближайшем будущем при интегра
Microsoft и Mistral заключили многомиллиардное партнерство в сфере искусственного интеллекта в Европе
В основе этого сотрудничества лежит многомиллиардное соглашение, призванное укрепить инфраструктуру искусственного интеллекта по всей Европе. Источник: MicrosoftMicrosoft и Mistral, ведущая французска
В Microsoft назвали сбор данных для ИИ «крупнейшим воровством труда в истории», показывают неотредактированные документы
Разблокированные документы по трёхлетнему иску о нарушении авторских прав, поданному газетой The New York Times против компаний OpenAI и Microsoft, содержат признание в том, что скрейпинг данных для обучения искусственного интеллекта является кражей
Рекомендации по связанным специальным темам
Комментарии (0)
OpenAI представила Privacy Filter, передовую модель анонимизации персональных данных (PII). Теперь доступная по лицензии Apache 2.0 на платформах Hugging Face и GitHub, этот инструмент предоставляет разработчикам локальное, высоконастраиваемое решение для надежной защиты конфиденциальности.
Продвинутое семантическое понимание, выходящее за рамки правил
В отличие от традиционных инструментов, основанных на правилах, Privacy Filter использует глубокое понимание языка для точной идентификации конфиденциальных данных в неструктурированном тексте на основе контекста. Этот подход эффективно скрывает личную информацию, сохраняя максимальную полезность публичного контента.

Легкая архитектура MoE для превосходной эффективности
Технический дизайн модели ориентирован как на гибкость, так и на производительность:
Архитектура «Смесь экспертов» (MoE): При общем количестве параметров в 1,5 миллиарда, в каждом вычислении активируется лишь около 50 миллионов параметров. Эта эффективность обеспечивает плавную работу на устройствах с ограниченными ресурсами, включая ноутбуки и веб-браузеры.
Поддержка расширенного контекста: Модель обладает окном контекста объемом 128 000 токенов и использует двунаправленную архитектуру классификации токенов в сочетании со строгим алгоритмом Витерби, что гарантирует точность и связность при обработке длинных документов.
Высокая точность распознавания: В обновленном бенчмарке PII-Masking-300k модель достигла F1-меры на уровне 97,43%, показав уровень полноты (recall) 98,08%.
Комплексная система классификации конфиденциальности
Privacy Filter точно идентифицирует и маркирует восемь основных категорий конфиденциальной информации:
Базовая идентификация: Имена, адреса, адреса электронной почты и номера телефонов.
Онлайн-активы: URL-ссылки.
Финансовая безопасность: Данные учетных записей, включая номера банковских и кредитных карт.
Конфиденциальные учетные данные: Пароли и API-ключи.
Временные данные: Информация о датах.
Сценарии применения: «Локальный брандмауэр» для облачных LLM
OpenAI позиционирует этот инструмент как слой предварительной фильтрации. Обрабатывая текст локально для обнаружения и анонимизации PII перед отправкой в облачные большие языковые модели, эта стратегия «данные остаются на устройстве» значительно снижает риск непреднамеренного раскрытия пользователями личной информации сервисам искусственного интеллекта.
NewCore привлекает $66 млн для оснащения ИИ-агентов идентичностями по мере их перехода в роли сотрудников
Стартап в области кибербезопасности NewCore официально вышел из тени, привлекши в понедельник 66 миллионов долларов инвестиций. Компания нацелена на решение критической проблемы, с которой столкнутся многие организации в ближайшем будущем при интегра
Microsoft и Mistral заключили многомиллиардное партнерство в сфере искусственного интеллекта в Европе
В основе этого сотрудничества лежит многомиллиардное соглашение, призванное укрепить инфраструктуру искусственного интеллекта по всей Европе. Источник: MicrosoftMicrosoft и Mistral, ведущая французска
В Microsoft назвали сбор данных для ИИ «крупнейшим воровством труда в истории», показывают неотредактированные документы
Разблокированные документы по трёхлетнему иску о нарушении авторских прав, поданному газетой The New York Times против компаний OpenAI и Microsoft, содержат признание в том, что скрейпинг данных для обучения искусственного интеллекта является кражей











