OpenAI 推出支持 128K 上下文的隐私过滤器,具备八种识别模式
OpenAI 推出了 隐私过滤器(Privacy Filter),这是一款最先进的个人身份信息(PII)匿名化模型。该工具现已在 Hugging Face 和 GitHub 上以 Apache 2.0 许可证 开放,为开发者提供了一种本地化、高度可定制的解决方案,以实现强大的隐私保护。
超越基于规则匹配的先进语义理解
与传统的基于规则的工具不同,隐私过滤器利用深层语言理解能力,根据上下文准确识别非结构化文本中的敏感数据。这种方法在最大程度保留公共内容实用性的同时,有效地隐藏了私人信息。

轻量级 MoE 架构,实现卓越效率
该模型的技术设计兼顾了灵活性与性能:
混合专家(MoE)设计: 总参数量为 15 亿,但每次推理仅激活约 5000 万 个参数。这种高效性使得该模型能够在资源受限的边缘设备上流畅运行,包括笔记本电脑和网页浏览器。
扩展上下文支持: 该模型拥有 128,000 Token 的上下文窗口,采用双向 Token 分类架构结合受限维特比算法,确保在处理长文档时的准确性和连贯性。
高精度识别: 在更新的 PII-Masking-300k 基准测试中,该模型取得了 97.43% 的 F1 分数,召回率高达 98.08%。
全面的隐私分类系统
隐私过滤器能够准确识别并标记八类核心敏感信息:
基本身份信息: 姓名、地址、电子邮件地址和电话号码。
在线资产: URL 链接。
财务安全: 账户详情,包括银行和信用卡号码。
机密凭证: 密码和 API 密钥。
时效性信息: 日期信息。
应用场景:云大语言模型的“本地防火墙”
OpenAI 将该工具定位为 预过滤层。通过在将文本发送至基于云的大语言模型之前,在本地进行 PII 检测和匿名化处理,这种“数据留在设备上”的策略显著降低了用户无意中向 AI 服务暴露私人信息的风险。
相关文章
NewCore 筹集 6600 万美元,为 AI 代理配备身份,使其逐步承担员工角色
网络安全初创公司 NewCore 正式结束低调运营期,于周一宣布获得 6600 万美元融资。该公司旨在解决一个许多组织在整合 AI 智能体时将面临的严峻挑战:如何大规模地对这些数字员工进行身份认证、治理和控制。本轮种子轮融资由专注于网络安全的风险投资公司 Cyberstarts 领投,Index Ventures 和 Evolution Equity Partners 等机构跟投。融资完成后,NewCore 的估值达到 3 亿美元。各组织越来越将 AI 智能体视为职场中的活跃参与者,而非仅仅
微软与Mistral达成数十亿美元的欧洲人工智能合作协议
此次合作的核心是一项价值数十亿美元的协议,旨在加强整个欧洲的人工智能基础设施。图片来源:微软微软与法国领先的人工智能公司Mistral共同宣布了一项价值数十亿美元的合作计划,旨在强化欧洲的人工智能生态系统。微软与法国先进大型语言模型开发商Mistral宣布达成一项新协议,旨在扩展欧洲境内的人工智能基础设施。该协议标志着双方现有合作关系的重大扩展,Mistral的人工智能模型也将由此整合到微软的产品
微软高管称AI数据抓取是“历史上最大的劳动盗窃”,未经删减的文件显示
纽约时报针对OpenAI和微软提起的为期三年的版权诉讼中解密的文件显示,一家公司承认AI抓取构成盗窃,并对媒体机构构成严重威胁。根据诉讼文件,微软的一位高管私下将公司的AI训练方法称为“盗窃”,而OpenAI的领导层承认,其模型对训练它们的出版商和记者构成了“生存威胁”。新解密的记录还详细说明了这些公司如何绕过付费墙而不被察觉地访问和利用这些内容,通过大规模抓取构建训练数据集,并故意从数据中删除版权声明。需要注意的是,这些新信息大多来自《纽约时报》自身的法律简报,而非仍处于保密状态的原始证
相关专题推荐
评论 (0)
0/500
OpenAI 推出了 隐私过滤器(Privacy Filter),这是一款最先进的个人身份信息(PII)匿名化模型。该工具现已在 Hugging Face 和 GitHub 上以 Apache 2.0 许可证 开放,为开发者提供了一种本地化、高度可定制的解决方案,以实现强大的隐私保护。
超越基于规则匹配的先进语义理解
与传统的基于规则的工具不同,隐私过滤器利用深层语言理解能力,根据上下文准确识别非结构化文本中的敏感数据。这种方法在最大程度保留公共内容实用性的同时,有效地隐藏了私人信息。

轻量级 MoE 架构,实现卓越效率
该模型的技术设计兼顾了灵活性与性能:
混合专家(MoE)设计: 总参数量为 15 亿,但每次推理仅激活约 5000 万 个参数。这种高效性使得该模型能够在资源受限的边缘设备上流畅运行,包括笔记本电脑和网页浏览器。
扩展上下文支持: 该模型拥有 128,000 Token 的上下文窗口,采用双向 Token 分类架构结合受限维特比算法,确保在处理长文档时的准确性和连贯性。
高精度识别: 在更新的 PII-Masking-300k 基准测试中,该模型取得了 97.43% 的 F1 分数,召回率高达 98.08%。
全面的隐私分类系统
隐私过滤器能够准确识别并标记八类核心敏感信息:
基本身份信息: 姓名、地址、电子邮件地址和电话号码。
在线资产: URL 链接。
财务安全: 账户详情,包括银行和信用卡号码。
机密凭证: 密码和 API 密钥。
时效性信息: 日期信息。
应用场景:云大语言模型的“本地防火墙”
OpenAI 将该工具定位为 预过滤层。通过在将文本发送至基于云的大语言模型之前,在本地进行 PII 检测和匿名化处理,这种“数据留在设备上”的策略显著降低了用户无意中向 AI 服务暴露私人信息的风险。
NewCore 筹集 6600 万美元,为 AI 代理配备身份,使其逐步承担员工角色
网络安全初创公司 NewCore 正式结束低调运营期,于周一宣布获得 6600 万美元融资。该公司旨在解决一个许多组织在整合 AI 智能体时将面临的严峻挑战:如何大规模地对这些数字员工进行身份认证、治理和控制。本轮种子轮融资由专注于网络安全的风险投资公司 Cyberstarts 领投,Index Ventures 和 Evolution Equity Partners 等机构跟投。融资完成后,NewCore 的估值达到 3 亿美元。各组织越来越将 AI 智能体视为职场中的活跃参与者,而非仅仅
微软与Mistral达成数十亿美元的欧洲人工智能合作协议
此次合作的核心是一项价值数十亿美元的协议,旨在加强整个欧洲的人工智能基础设施。图片来源:微软微软与法国领先的人工智能公司Mistral共同宣布了一项价值数十亿美元的合作计划,旨在强化欧洲的人工智能生态系统。微软与法国先进大型语言模型开发商Mistral宣布达成一项新协议,旨在扩展欧洲境内的人工智能基础设施。该协议标志着双方现有合作关系的重大扩展,Mistral的人工智能模型也将由此整合到微软的产品
微软高管称AI数据抓取是“历史上最大的劳动盗窃”,未经删减的文件显示
纽约时报针对OpenAI和微软提起的为期三年的版权诉讼中解密的文件显示,一家公司承认AI抓取构成盗窃,并对媒体机构构成严重威胁。根据诉讼文件,微软的一位高管私下将公司的AI训练方法称为“盗窃”,而OpenAI的领导层承认,其模型对训练它们的出版商和记者构成了“生存威胁”。新解密的记录还详细说明了这些公司如何绕过付费墙而不被察觉地访问和利用这些内容,通过大规模抓取构建训练数据集,并故意从数据中删除版权声明。需要注意的是,这些新信息大多来自《纽约时报》自身的法律简报,而非仍处于保密状态的原始证





首页






